
新浪科技讯 7月20日晚间消息,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,让合成语音从“能说话”走向“会表达”。目前,在全球第三方权威榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus斩获冠军。
Qwen-Audio-3.0-TTS的上一代版本已支持freestyle(自由风格模式),可在提示词中加入“资深客服”、“足球解说员”等角色设定,以控制情绪、场景和语速等。新模型则在细粒度上进一步跃迁,通过结构化标签,用户可直接在文本里嵌入 [gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)这类标记,把控制精度从整段情绪细化到“哪个字后面该倒吸一口气”,适用于需要精确控制细节的叙事、游戏、配音等场景。
面向全球多语种场景,Qwen-Audio-3.0-TTS 进行了专项优化,覆盖中、英、日、韩、德等16 种语言,新增阿拉伯语、越南语、马来语以及菲律宾语。
模型规模越大、训练数据越杂,方言的发音会不自觉地滑向普通话腔。针对这个痛点,研究团队专门设计了方言强化训练,让模型在韵律、声调与口语表达上接近母语者,覆盖广东、重庆、东北、陕西、上海、四川、云南等 20种方言。
语音克隆产品往往要求原始参考音频在安静环境下录制,Qwen-Audio-3.0-TTS通过真实声学仿真训练,在克隆流程中嵌入了语音增强能力,让模型在高噪声、高混响条件下也能过滤干扰、只留音色。面向严肃创作场景,模型拥有开箱即用的精品音色库,并将音频输出从提升24kHz 到 48kHz,相当于视频配音和有声书的品质提升到录音棚、影视配音的规格,单次语音合成可长达 3 分钟。
即日起,两款模型已在阿里云百炼开放调用。
元股证券:ygzq.hk配资在线门户
海量资讯、精准解读,尽在新浪财经APP
责任编辑:孙同怀 低位股

(“圳”的猛,你一“揭”便知,时长共14秒) 这个五一,何必远方?家门口就有让你热血沸腾的绝佳选择——5月2日,粤超联赛
2026-07-25
智通财经APP讯,越疆(02432)发布公告,公司注意到近期有关宋某就其与本公司员工持股平台深圳市越疆谘询合伙企业(有限
2026-07-22
今天 海南多市县发布高温橙色预警信号 白天最高气温将升至37℃以上 儋州市气象台2026年04月03日12时44分发布高
2026-07-29
5月23日19时35分低位股,新韵重庆·2026重庆城市篮球超级联赛(“渝BA”)九龙坡区主场赛事在296文体村文森篮球
2026-07-21
配资炒股首选 “我回来了!”,41岁C罗连续6届世界杯破门创纪录,历史仅此一人 巨星闪耀的美加墨世界杯赛场,怎能少了C罗
2026-07-26