发明
一种基于多模态大模型的实时歌唱自适应指导方法及系统2026
2026-07-15 13:03:23
发布于四川
1
- 申请专利号:CN202610543934.2
- 公开(公告)日:2026-07-14
- 公开(公告)号:CN122392565A
- 申请人:暨南大学
摘要:本发明公开了一种基于多模态大模型的实时歌唱自适应指导方法及系统,方法包括:S1.对学习者歌唱音频进行处理,提取包含基频轨迹、音高稳定性指标及音域边界在内的声学证据,生成初始证据摘要;基于结构化评估结果对初始证据摘要进行更新;S2.将学习者歌唱音频输入多模态大模型、音频大模型、音频‑文本多模态大模型或其微调模型,结合预定义输出格式,生成包含各维度评分值及解释文本的结构化评估向量;S3.将训练目标规约、当前证据摘要、有界交互历史及当前学习者输入作为输入提供给大语言模型,实时生成阶段控制指令;S4.依据阶段控制指令,向学习者输出与当前训练阶段相匹配的练习提示、即时反馈、复练指令或阶段报告。
专利内容
本发明公开了一种基于多模态大模型的实时歌唱自适应指导方法及系统,方法包括:S1.对学习者歌唱音频进行处理,提取包含基频轨迹、音高稳定性指标及音域边界在内的声学证据,生成初始证据摘要;基于结构化评估结果对初始证据摘要进行更新;S2.将学习者歌唱音频输入多模态大模型、音频大模型、音频‑文本多模态大模型或其微调模型,结合预定义输出格式,生成包含各维度评分值及解释文本的结构化评估向量;S3.将训练目标规约、当前证据摘要、有界交互历史及当前学习者输入作为输入提供给大语言模型,实时生成阶段控制指令;S4.依据阶段控制指令,向学习者输出与当前训练阶段相匹配的练习提示、即时反馈、复练指令或阶段报告。G10L25/51(2013.01);G06N5/04(2023.01);G06Q50/20(2012.01)
原创力.专利