关于ZAKER Skills 合作
星途科讯 刚刚

Meta 发布首款实时音频模型 Muse Voice Transcribe

Meta Superintelligence Labs(超智能实验室)正式推出 Muse Voice Transcribe,这是该公司开发的首款实时音频感知模型。

Muse Voice Transcribe 标志着 Meta 在实时语音模型落地应用上的重要里程碑。该模型支持实时流式语音转文字(ASR)、超过 20 人的说话人分离(Diarization)以及端点检测(Endpointing)。其具备多语言能力,可无缝处理语言切换,并通过语言、关键词和上下文偏置技术进一步提升准确率。

数据显示,截至 2026 年 9 月 1 日,Muse Voice Transcribe 在流式语音转文字及公开说话人分离基准测试中均位列第一。

基于流式 ASR 的自回归架构

Muse Voice Transcribe 隶属于 Muse Spark 系列,是一款自回归多模态模型。音频以 80 毫秒(12.5 赫兹)为块进行处理,每个块被转换为一个软标记(soft token)。在处理每个音频块时,模型需决定是继续监听下一个音频块,还是输出文本标记。当模型选择继续监听时,会预测特殊标记 <|next_audio|>,并在下一次输入时将其替换为实际音频块。

当音频流停止时,系统插入特殊标记 <|empty_audio|> 告知模型音频结束。接收该标记后,模型将输出所有剩余文本标记,不再产生 <|next_audio|> 标记。

由于模型完全掌控监听时机,它可在转录前决定接收多少音频上下文(即 " 延迟 ")。准确率与延迟存在权衡:等待预测时间越长,转录越准确,但延迟越高。Muse Voice Transcribe 具备 " 自适应延迟 " 功能,可根据难度动态调整每个单词的延迟。该功能通过强化学习实现,将词错率(WER)奖励与延迟奖励相乘结合,从而在最终转录时间的速度与准确性权衡上达到帕累托前沿。

集成说话人分离与端点检测

基于流式 ASR 架构,通过引入额外特殊标记,该模型可轻松支持其他音频感知任务。

在说话人分离方面,模型引入 <|start_of_turn|> 标记潜在说话人切换,并使用 <|speaker_{A-Z}|> 标签区分不同说话人。一旦检测到切换,模型立即预测 <|start_of_turn|>,并将说话人标签预测推迟至块末尾。同一说话人的音频可能被 <|start_of_turn|> 分割,但片段间的说话人标签保持一致。

在端点检测方面,模型引入 <|speech_onset|> 标记语音开始,<|speech_endpoint|> 标记用户结束说话时刻。这两个任务与流式 ASR 联合训练,并在 ASR 奖励基础上增加了针对说话人分离和端点检测的额外奖励。

核心能力

语言覆盖

Muse Voice Transcribe 使用 70 多种语言训练,其中 25 种经过广泛验证。初始版本建议优先试用这 25 种已验证语言,同时也支持其他更多语言。

代码切换(Code-Switching)

针对双语使用者常见的语言混合场景,Muse Voice Transcribe 原生支持任意形式的代码切换,无论是句内还是句间。模型还利用上下文偏置进一步提高识别准确率。

长上下文处理

模型原生支持超过一小时、多达 20 多名说话人的长音频输入,无需进行后处理。

应用场景

目前,Meta AI 和 Muse Code 中的语音听写功能已由 Muse Voice Transcribe 驱动。用户只需按住 'Fn' 键,即可通过 Meta AI 处理屏幕上的任何窗口任务。该模型现已通过 Meta Model API、Mac 版 Meta AI 以及 Muse Code 开放获取。

【星途科讯 图文丨伊贝 首发于 ZAKER 科技,转载请注明出处】

相关标签
mac
星途科讯

星途科讯

解码海外,科技新知

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容