36 氪获悉,7 月 20 日,阿里巴巴发布语音合成大模型 Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle 指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的 Flash 版本(首包延时 300ms 级别)和面向高质量生成的 Plus 版本,让合成语音从 " 能说话 " 走向 " 会表达 "。目前,在全球第三方榜单 Artificial Analysis,Qwen-Audio-3.0-TTS-Plus 登顶,其预览版 Fun-Realtime-TTS 也曾在一个月前登顶该榜单。
36氪
13小时前