来源:河北网络广播电视台
责编:白萌
时间:2026-07-31 18:01:10
近期,云知声完成U2-ASR语音识别、U2-TTS语音合成多语种能力全面升级,以底层算法创新拓展全球语音交互边界,充分展现AI“向上探索”的实践成果。
U2-ASR:统一联合建模,听懂世界
U2-ASR进一步拓展统一多语种联合建模架构,新增支持阿拉伯语、德语、西班牙语、法语、印尼语、日语、韩语、葡萄牙语、俄语、土耳其语、越南语、泰语、意大利语等13种国际语言。针对不同语言在音素体系、发音节奏、语调规律及口音分布等方面的差异,U2-ASR通过统一联合建模,实现跨语言特征的协同学习与能力共享。

在统一测试口径下,U2-ASR与WhisperLargeV3Turbo、FunASR、Seed-ASR等业界代表性模型进行了对比评测,并分别验证了“显式传入语种标签”与“不传入语种标签”两类场景下的识别表现。
显式传入语种标签时,U2-ASR在13种语言工业级测试集上的平均字错率(CER)低至6.58%,12种语言CER低于8%,德语、西班牙语、印尼语、意大利语、越南语等5个重点语种更全部进入5%以内。不传入语种标签时,面对无标注的音频流,U2-ASR 凭借自动语种识别与闭集路由能力,依然保持高准确率,有效避免了语种误判和错误率飙升。

U2-TTS:强化多语种语音合成能力,言说全球
如果说ASR解决的是“听懂用户”,那么TTS决定的则是AI能否用用户熟悉的语言自然回应。U2-TTS重点强化东南亚多语种语音合成能力,新增支持:泰语、越南语、印尼语、马来语、缅甸语、柬埔寨语、菲律宾语、老挝语等8种语言。针对不同语言的发音规则、语调习惯、停顿节奏和韵律特征,U2-TTS进行了专项优化,让AI不仅能够“开口说”,还能够说得更加清晰、自然、流畅,更符合当地用户的语言习惯。
U2-TTS能够准确还原不同语言的发音特点、语调变化和表达节奏,为当地用户带来更加自然、亲切的语音交互体验。此外,它采用流式神经网络声学模型,可逐chunk实时输出24kHz、16bit高保真语音。通过“边生成、边播放”的流式机制,模型能够有效降低首包等待时间,避免长文本全部生成后才能播放的问题,更好地满足实时语音对话、数字人驱动、智能客服、车载交互及智能终端等强时效场景的应用需求。
本次U2系列模型能力升级瞄准行业现存技术壁垒,依托统一模型架构、标准化接口构建一体化解决方案。企业仅需接入一套服务,即可实现多语种语音识别与合成,摆脱多套系统并行运维的沉重负担,为高效搭建全球化语音交互体系开辟新路径。