Meta 发布 Muse Voice Transcribe:每小时0.18美元支持20+说话人实时语音转写与说话人区分
Meta 推出 Muse Voice Transcribe,以每小时0.18美元定价提供流式语音转文本、端点检测与20+说话人实时区分能力,在AA-WER基准测试中词错误率低至3.1%,为会议系统、通话分析与语音智能体提供高性价比基础设施。

Meta 正以 Muse Voice Transcribe 进入日益激烈的实时语音转文本市场。这是一款新型音频感知模型,集流式转录、端点检测与说话人区分(speaker diarization)于一体,可支持超过 20 名说话人,且公共 API 定价仅为每小时处理音频 0.18 美元。
Muse 由 Meta 超级智能实验室(Meta Superintelligence Labs)开发,旨在边说话边处理语音,而非等待录音结束后再进行处理。Meta 的 Muse Voice Transcribe 发布公告 称,该模型支持时长超过一小时的长音频、无缝多语种语码转换(multilingual code-switching)、语言与关键词偏向性(language and keyword biasing),以及无需单独后处理流程的说话人区分。该模型在 70 多种语言上进行了训练,其中 25 种语言在首发版本中经过了广泛验证。
‘超过 20 名说话人’这一数字相当可观,但并非世界纪录。对当前各供应商文档的审查显示,已有系统公布了更高的上限值。 Speechmatics 的实时转录服务 称其默认可识别 50 名说话人,将限制调高后最多可达 100 名;而 Amazon Transcribe 的说话人区分文档 则明确指出,其最大支持 30 名唯一说话人,该上限同样适用于流式转录。(Speechmatics)
尽管如此,Muse 仍处于市场高端水平;而 Meta 更广泛的主张——即在同一模型中整合高容量实时说话人区分、低延迟转录、端点检测、多语种语码转换及极具竞争力的 API 定价——其重要性 arguably 超过了单纯的说话人数上限。
对于构建会议系统、通话分析工具、实时助手或环境 AI 的企业开发者而言,这种组合能力可能比谁持有说话人数纪录更为关键。
说话人区分正成为核心语音技术栈的一部分
传统语音识别回答的是一个相对简单的问题: 说了什么? 说话人区分则增加了另一个问题: 谁说的?
当转录文本被输入下游 AI 系统时,这一区别变得至关重要。会议助手即使能准确转录每一句话,若将批准、承诺或异议错误归因于某位参会者,仍会生成不可靠的企业记录。同样的问题也影响客户服务分析、合规工作流,以及在多人可同时发言的房间中运行的 AI 智能体。
Muse 将说话人归属(speaker attribution)直接纳入其自回归多模态架构中。Meta 表示,音频以 80 毫秒为单位分块输入,即每秒输入 12.5 块,每一块均被转换为一个软标记(soft token)。在每个步骤中,模型决定是继续接收更多音频,还是输出文本。Meta 将此机制称为自适应延迟(adaptive delay):它不为每个词统一应用固定延迟预算,而是在语音模糊时等待更久,在上下文足够时更早确认输出。Meta 表示,该行为通过结合词错误率(word-error-rate)与延迟奖励(delay rewards)的强化学习进行训练。 Meta 关于 Muse 的技术说明 详述了其架构。(Meta AI Research)
随后,说话人归属与端点检测便成为同一标记序列的一部分。一个 <|start_of_turn|> 标记表示潜在的新说话人轮次(speaker turn),诸如 <|speaker_A|> 之类的标记用于标识说话人,而独立的起始(onset)与终止(endpoint)标记则用于标识语音边界。Meta 表示,其将自动语音识别(ASR)、说话人区分与端点检测联合训练,而非将说话人聚类作为无关的下游流程单独运行。
Meta 的 Model API 语音转文本文档 还将说话人区分列为与按键讲话(push-to-talk)和端点检测并列的一等操作模式。说话人标签(如 A 和 B)按会话范围界定,而非经验证的身份;API 提供的是轮次级(turn-level)时间戳,而非词级(word-level)时间戳。
20 多名说话人数量已属较高,但 Speechmatics 的支持上限明显更高
说话人数对比需谨慎,因为各供应商实现说话人区分的方式不同,且并非全部公开其上限值。
Speechmatics 当前在此项审查中提出的实时容量声明最为明确有力。其 实时语音转文本(STT)文档 称说话人区分功能可实时启用;其实时常见问题解答(FAQ)则指出,该系统默认支持 50 名说话人,上限可提升至 100 名。
AWS 同样超出 Meta 公布的数值: Amazon Transcribe 最多可区分 30 名唯一说话人,且 AWS 提供了针对流式转录的说话人分区(speaker partitioning)明确操作指南。
Soniox 在实时与异步处理两种模式下均支持说话人区分,但文档中注明每会话最多支持 15 名说话人。 AssemblyAI 的流式说话人区分系统 允许开发者设置 max_speakers 介于 1 至 10 之间的数值。两家公司均提醒,实时说话人归属难度更大,因为流式系统必须在比离线模型更少未来音频上下文的情况下做出判断。
xAI 当前的语音转文本(Speech-to-Text)API 亦在流式模式下支持说话人区分,但本报道所审阅的其文档并未公布经区分说话人的最大数量,因此无法与 Muse 进行直接的上限值比较。(X.ai Docs)
这意味着将 Muse 支持‘20 多名说话人’的能力描述为一项新的全球纪录是不准确的。本次调研中发现的最高明确记载的实时说话人数上限,是 Speechmatics 可配置的 100 名说话人。
Meta在其发布材料中也未展示20名以上参与者同时参与的场景。其主要现场演示使用了8名发言者,而其长时录音中则标注了11名参与者。‘20名以上’这一数字是该模型所声明的能力,而非公开演示中实际参与者的数量。
Muse每小时0.18美元的定价在价格上具有强劲竞争力。
Meta的定价使竞争格局变得更加有趣。
根据其 Muse Voice Transcribe开发者页面,Muse的费用为每1000分钟3美元,即每小时0.18美元。流式传输与非流式传输的转录费用相同,Meta表示零数据留存处理的定价与标准处理持平。计费依据为实际处理的音频时长,并向下取整至整秒。
将公开发布的费率统一换算为每小时流式音频,可得出以下粗略对比:
流式语音转文本服务 | 每小时约公开成本 | 实时说话人分离(diarization) |
0.12美元 | 包含;最多支持15名说话人 | |
0.18美元 | 包含;支持20名以上说话人 | |
0.20美元 | 支持;未说明最大人数 | |
0.24美元 | 包含;默认50名,可配置至100名 | |
约0.324美元 国际版 | 经审阅的资料中未记载可比的最大人数 | |
基础价约0.35美元/小时,含说话人分离约0.47美元/小时 | 说话人分离附加费0.12美元/小时 | |
0.39美元(按量付费,PAYG) | 实时模式下不支持 | |
基础价0.45美元/小时,含说话人分离0.57美元/小时 | 说话人分离附加费0.12美元/小时;最多支持10名说话人 | |
约0.54美元(混合计价) | 直播模式下不支持 | |
AWS美国东部(北弗吉尼亚)流式示例中约为0.60美元 | 包含;最多支持30名说话人 | |
1.02美元 | 说话人分离未列为该模型的能力 |
该对比必然存在不完善之处。Qwen的价格因部署地理位置而异;其国际版实时费率每秒0.00009美元,折合每小时约0.324美元。谷歌Gemini的数据为估算的混合token成本,而非固定每小时资费。AWS价格因区域及用量层级而异。ElevenLabs在其API定价页面上列出每小时0.39美元,但在年度企业(Business)计划中宣传每小时0.28美元或更低。
Deepgram的定价尤其说明了为何需进行功能层面的对比:其当前Nova-3 Multilingual流式费率约为每小时0.35美元,但 说话人分离需额外收取每分钟0.002美元,使得可比总费用升至每小时约0.47美元。AssemblyAI同样将Universal-3.5 Pro Realtime标价为每小时0.45美元,并另收每小时0.12美元的流式说话人分离附加费。
Cartesia 更难进行标准化,因为 Ink-2 通过按月计费的信用额度计划提供服务 而非简单的按小时计量的即用即付(PAYG)费率。其 5 美元的 Pro 套餐包含约九小时十六分钟的 Ink-2 转录时长;若所有信用额度均仅用于语音转文本(STT),则相当于每转录小时约 0.54 美元。该数值不应被视为等同于独立的每小时 0.54 美元 API 费率。
即便存在上述注意事项,Muse 的市场定位依然清晰明确:它并非绝对最廉价的流式转录服务——Soniox 当前公布的等效费率更低——但每小时 0.18 美元且已包含说话人分离(diarization)功能的定价,使 Meta 处于市场低价区间末端,尤其相较于那些对说话人归属(speaker attribution)另行收费的服务商而言。
在处理 1,000 小时音频的情况下,Meta 公布的费率意味着转录费用约为 180 美元。
Meta 在其发布准确率基准测试中亦处于领先地位
若价格优势伴随显著的准确率损失,则价格的重要性将大幅降低。而 Meta 的基准测试材料所论证的恰恰相反。
在随发布提供的 Artificial Analysis AA-WER 流式索引(AA-WER Streaming Index)中,Muse 的最终转录词错误率(word error rate)为 3.1%,优于 Cartesia Ink-2 的 3.4%、ElevenLabs Scribe v2 Realtime 的 3.6%、Qwen3 ASR Flash Realtime 的 3.7%、GPT Live Transcribe 与 Grok Speech to Text Streaming 的 3.9%,以及 Gemini 3.5 Transcribe Live 与 AssemblyAI U3.5 Realtime Pro 的 4.0%。
Meta 指出,Muse 在第三方独立人工智能基准测试机构 Artificial Analysis 的流式语音转文本评估中 截至 9 月 1 日位列第一。 Meta 在其发布帖中公布了以下基准测试图表。

Muse Voice Transcribe AA-WER 基准测试结果。图片来源:Meta
其说话人分离结果可能对产品定位更具相关性。Meta 报告称,在 AMI-IHM、AMI-SDM 和 VoxConverse 数据集上,Muse 的平均说话人分离错误率为 17.5%,低于其图表中所示各竞品系统。

Meta Muse Voice Transcribe 说话人分离性能图表。图片来源:Meta
说话人容量(speaker capacity)与说话人分离错误率(diarization error rate)不可混为一谈。一个能够支持 100 人的平台,并不自动意味着其在正确归属话语方面优于仅支持 20 人的平台;且 Meta 的基准测试并未检验每个竞品在其所宣传的最大说话人数量下运行时的表现。
部署方面亦存在权衡取舍。Meta 的 API 当前仅提供话轮级(turn-level)时间戳,而不提供词级(word-level)时间戳;亦不公开词级置信度分数、声音事件检测(sound-event detection)或情绪检测(emotion detection)。文档还明确规定,默认情况下每个租户最多支持八个并发流,且实时会话最长持续 60 分钟,之后应用程序必须重新连接。
尽管如此,Muse 的发布创造出一种异常鲜明的价格-性能组合方案。其支持 20 位以上说话人的说话人分离能力虽未创下世界纪录,但该纪录本身或许并非最关键指标。对于企业开发者而言,更核心的问题在于:当一场复杂的现实世界对话仍在进行中时,某项服务能否同时维持说话人归属准确性、文本准确性以及可用的话轮边界(turn boundaries)。
以每小时 0.18 美元的价格,搭配在同一实时模型内实现的 20 位以上说话人的说话人分离功能——而该模型当前在 Meta 提供的流式准确率基准测试中位居榜首——Muse Voice Transcribe 为企业团队提供了会议智能(meeting intelligence)、实时转录及语音代理(voice-agent)基础设施的一项严肃新选择;同时也进一步向竞争对手施加压力,迫使其不仅在原始语音识别(raw speech recognition)层面竞争,更需在具备说话人感知能力的准确率(speaker-aware accuracy)与总体运营成本(total operating cost)两方面展开竞争。
JOTO 企业落地观察
- 对企业部署而言,Muse 将说话人归属直接嵌入自回归多模态架构并联合训练ASR与端点检测,意味着企业无需拼接多个API或自建后处理模块,可降低实时会议系统集成复杂度与运维成本,但需注意其仅提供话轮级时间戳且单租户限8并发流。
- 对智能体工程而言,Muse 支持70+语言及多语码切换,并在单模型内实现低延迟转录与说话人轮次标记(如<|speaker_A|>),使多角色环境AI(如会议室智能体)能更可靠地绑定话语与身份,但其未提供词级置信度或情绪检测,限制了下游细粒度意图解析能力。
- 对FDE落地而言,Muse 每小时0.18美元含说话人区分的定价显著低于多数竞品(如AssemblyAI需额外加收0.12美元/小时),在千小时量级下可节省超百美元,但60分钟会话上限与零数据留存需单独确认合规性,提示企业在设计长期语音工作流时须规划重连与审计机制。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


