发明

基于多模态情感语音合成的站群文章智能播报系统及方法2026

2026-02-18 13:13:38 发布于四川 0
  • 申请专利号:CN202610064403.5
  • 公开(公告)日:2026-04-10
  • 公开(公告)号:CN121545494A
  • 申请人:南京苏迪科技有限公司
摘要:本发明公开了基于多模态情感语音合成的站群文章智能播报系统及方法,涉及语音合成技术领域,包括:提取段落级语义与情绪特征,并对语义与情绪特征进行维度映射,生成情感补偿参数集合;基于情感补偿参数集合,将前序文本段落韵律预测阶段产生的隐层状态特征按段落粒度进行存储;在对当前文本段落执行韵律预测时,回溯并引入对应的前序段落隐层状态特征,参与当前段落的韵律预测,生成跨段落一致的韵律预测信号;将韵律预测信号与情感补偿参数集合进行跨模态对齐融合,生成声学特征预测结果,并将声学特征预测结果转换为梅尔频谱特征,生成对应的数字音频信号流,本发明提升了长文本自动播报的语音自然度与情感一致性。

专利内容

本发明公开了基于多模态情感语音合成的站群文章智能播报系统及方法,涉及语音合成技术领域,包括:提取段落级语义与情绪特征,并对语义与情绪特征进行维度映射,生成情感补偿参数集合;基于情感补偿参数集合,将前序文本段落韵律预测阶段产生的隐层状态特征按段落粒度进行存储;在对当前文本段落执行韵律预测时,回溯并引入对应的前序段落隐层状态特征,参与当前段落的韵律预测,生成跨段落一致的韵律预测信号;将韵律预测信号与情感补偿参数集合进行跨模态对齐融合,生成声学特征预测结果,并将声学特征预测结果转换为梅尔频谱特征,生成对应的数字音频信号流,本发明提升了长文本自动播报的语音自然度与情感一致性。G10L13/027(2013.01);G10L13/10(2013.01);G10L13/047(2013.01);G10L25/63(2013.01);G06F40/30(2020.01)

最新专利