
Muse 旨在实时处理语音而非等待录音结束,支持超过一小时的长音频、无缝多语言代码切换及语言和关键词偏向。该模型在 70 多种语言上训练,初始发布时验证了其中 25 种语言的准确性。值得注意的是,虽然支持 20 多名说话人是显著优势,但这并非行业最高纪录:Speechmatics 实时服务默认支持 50 人(可增至 100 人),Amazon Transcribe 则支持最多 30 人。
说话人分离成为核心语音堆栈
随着转录内容接入下游 AI 系统,区分 " 说了什么 " 与 " 是谁说的 " 至关重要。错误的说话人归属会导致会议记录、客服分析及合规工作流不可靠。Muse 将说话人归属直接整合至自回归多模态架构中,通过 " 自适应延迟 " 机制平衡字错率与延迟,统一训练 ASR、说话人分离和端点检测,而非将其作为独立的下游过程。
在 Meta Model API 中,说话人分离被列为一级操作模式,提供基于轮次(turn-level)而非单词的时间戳,标签仅限于会话范围。
性价比与准确率的双重优势
Muse 的定价策略极具侵略性。每 1000 分钟 3 美元(即每小时 0.18 美元)的费率,使其在包含说话人分离功能的服务中处于市场低位。相比之下,Deepgram 含说话人分离的综合成本约为每小时 0.47 美元,AssemblyAI 约为 0.57 美元,而 OpenAI GPT Live Transcribe 高达 1.02 美元且未列出说话人分离功能。Soniox 虽以每小时 0.12 美元更便宜,但仅支持最多 15 名说话人。
在准确率方面,Meta 提供的基准数据显示,Muse 在 Artificial Analysis 流式索引中的字错率(WER)为 3.1%,优于 Cartesia Ink-2(3.4%)、ElevenLabs Scribe v2(3.6%)及 Qwen3 ASR Flash(3.7%)等竞品。在 AMI-IHM 等数据集上,其平均说话人分离错误率为 17.5%,同样低于竞争对手。
尽管存在部署限制——如仅提供基于轮次的时间戳、默认并发 8 个流、单会话最长 60 分钟——但 Muse 凭借高容量实时说话人分离、低延迟转录及低廉价格,为企业开发者构建会议系统、实时助手及环境 AI 提供了极具竞争力的新选择,同时也迫使竞争对手在说话人意识准确性和总体运营成本上展开新一轮较量。
【星途科讯 图文丨 LCC 首发于 ZAKER 科技,转载请注明出处】