模型The Decoder AI·原文 2026年9月6日

Meta发布实时语音转录模型Muse Voice Transcribe,称在速度和准确率间动态取舍

Meta Superintelligence Labs推出实时语音感知模型Muse Voice Transcribe,按80毫秒分块处理音频,据称能区分20多位说话者并检测句子边界,API定价每小时0.18美元。

AI解读:Meta这次发布实时转录模型Muse Voice Transcribe,核心思路是在准确和速度之间不再固定取舍,而是让模型逐字决定多听一会儿还是赶紧输出。技术上是把音频切成80毫秒的小块,每听完一块就判断是继续听还是把下一个字转成文本,听的时间越长通常越准但延迟也越大,Meta用强化学习训练模型同时兼顾低错误率和低延迟。根据Artificial Analysis的测试,它在英语上的词错误率是3.1%,字输出延迟0.16秒,比ElevenLabs、AssemblyAI等竞品更准一点,价格却便宜一半以上,每小时音频处理只收0.18美元。对开发者来说,成本下降明显,此前ElevenLabs和Deepgram每小时要6.5美元。但要注意,Meta没公开模型参数、训练数据也没开放权重,如果你想在本地部署或改动模型,这条路走不通。对普通用户,现在Meta AI和Muse Code已经用上了它,按住Fn键就能在任意App里语音输入,这点马上可以体验。长远看,Meta把这类实时转录看作是AI眼镜等设备上助理听真人对话的基础能力,但德国曾讨论过禁止Meta摄像头眼镜,隐私争议仍是落地障碍。

Meta Superintelligence Labs发布了首个实时音频感知模型Muse Voice Transcribe,可在实时对话中转录语音、区分说话者并检测句子边界。该模型属于Spark系列,将输入音频切成80毫秒的块处理,每处理一块后决定继续听还是输出下一个词,从而控制转录前收集多少上下文。

根据Meta的说明,Muse Voice Transcribe会针对每个词根据识别难度动态调整等待时间,简单的词更快输出,困难的词获得更多聆听时间。Meta称这一行为通过强化学习训练,同时奖励低错误率和短延迟。

除转录外,说话者分离和句子检测内建于同一模型,无需单独系统。模型标记说话者切换并为每段话分配A到Z的标识符,同时标记每句话的起止。这些任务与语音识别联合训练。Meta称模型能同时区分20多位说话者,无需后处理即可处理超过一小时长的录音。

Muse Voice Transcribe现已支持Meta AI和Muse Code中的语音听写,并通过Meta Model API提供。用户可在任意应用中按住“Fn”键试用。据The Decoder报道,Meta以每小时0.18美元(每1000音频分钟3美元)的价格提供该模型。

多语言与识别优化

Meta表示Muse Voice Transcribe在超过70种语言上训练,其中25种经过深入测试。模型支持语码转换,即说话者在同一句话中切换两种语言。语言、关键词和上下文的提示可进一步提高准确性,尤其对“Meta”“Muse”或“Menlo Park”等专有名词。

独立评测与竞争对比

人工智能分析平台Artificial Analysis在2026年9月1日的测试中确认,Muse Voice Transcribe在检测到说话结束后生成的最终转录本准确率最高。测试结果显示,Muse Voice Transcribe在英语上的词错误率为3.1%,延迟0.16秒;ElevenLabs Scribe v2 Realtime为3.6%和0.14秒;AssemblyAI Universal-3.5 Pro Realtime为4.0%。Cartesia Ink-2得分3.4%或4.0%,取决于模型自行检测话语结束还是依赖外部系统。

  • Meta称在该模型定价上低于其他竞品:Cartesia Ink-2为每1000分钟4美元,ElevenLabs Scribe v2 Realtime和Deepgram Flux为6.5美元。这延续了Meta此前在Muse Spark 1.1和1.2版本中以价格而非峰值性能竞争的思路。

发布背景与调用限制

Meta将此次发布与CEO马克·扎克伯格的“个人超级智能”愿景挂钩。在一场演示中,Meta员工认为可靠的语音识别是个人AI助手通过AI眼镜听取真实对话的基础。此前德国曾讨论对Meta摄像头眼镜的禁令,但德国联邦网络局决定不追究。

Meta未披露该模型的参数数量、训练数据量或音频数据来源,也未开放权重。2025年夏季,Meta在Superintelligence Labs框架下重组了AI部门,以最高四年3亿美元的薪酬方案从OpenAI、Google DeepMind和Apple招募顶尖研究员,但并非所有人才都留下,部分人在数周后返回OpenAI。

信息来源

The Decoder AI原始来源