微软MAI-Transcribe-2发布:60语种实时转录,每小时仅10美分,直击OpenAI与ElevenLabs
微软推出自研语音识别模型MAI-Transcribe-2,支持60种语言、说话人分离、词级时间戳与语码转换,定价降至每小时0.10美元,较五个月前降幅达72%,并在FLEURS与Artificial Analysis基准中表现领先。

微软AI 于周四发布 MAI-Transcribe-2,该公司称该语音识别模型比目前OpenAI、Google或ElevenLabs所售任何产品都更快、更准确且成本更低。随后,该公司将该产品定价为每小时音频10美分。 OpenAI, Google,或 ElevenLabs 目前销售的产品都更快、更准确且成本更低。随后,该公司将该产品定价为每小时音频10美分。
这一数字值得稍作停顿。当微软AI五个月前推出该系列首个模型时, 其收费为每小时0.36美元。周四的早鸟价 较此前降幅约为72%。对于一家每年处理10万小时呼叫中心音频的企业——对大型银行或电信公司而言这仅属中等规模——账单将从3.6万美元降至1万美元。在此价位上,转录服务已不再是一项需要反复争论的支出项目。
此次发布正值微软推行一项两年前看似难以实现的战略:逐模态构建自有前沿级模型,然后稳步将其替换进原先依赖OpenAI技术的产品中。转录是该战略推进最快的模态,而 MAI-Transcribe-2 是迄今最清晰的佐证。它也预示了这家全球估值最高的软件公司如何在不依赖其斥资130亿美元培育的合作伙伴的情况下参与AI竞争。
MAI-Transcribe-2的功能及其特性清单为何对企业买家至关重要
该模型支持60种语言的音频转录,高于今年6月发布的MAI-Transcribe-1.5的43种,以及今年4月初版发布的25种。它运行于 MAI-Transcribe-1.5 和4月初版发布的25种。它运行于 Microsoft Foundry(该公司面向开发者的模型市场)及 MAI Playground(其测试环境)中。微软表示,该模型专为真实企业产生的杂乱音频而构建——包括背景噪音、低质量录音、重叠语音等——而非干净的录音棚环境。
比语言数量更重要的是微软已整合进基础产品的功能。说话人日志(speaker diarization)可区分多人录音中各人的发言内容,这是将一整段文字墙转化为可用会议记录的关键。词级时间戳(word-level timestamps)为每个单词附上精确的时间标记,从而支持搜索、编辑及与视频对齐。关键词偏向(keyword biasing)允许开发者向模型提供药物名称、产品代码或员工姓名列表,以避免模型扭曲领域术语。自动语言识别意味着用户无需预先声明语言。
两项功能因其特异性尤为突出。可配置输出样式提供一种“逐字”(verbatim)模式,保留每个“呃”(um)、错误起始和结巴,供合规与法律团队使用;同时提供一种“洁净”(clean)模式,剔除填充词,生成易读的字幕与笔记。语码转换(code switching)可处理句中混用多种语言的对话;微软明确点名印地语-英语混合语(Hinglish)与西班牙语-英语混合语(Spanglish),以此呼应印度市场与美国西班牙裔市场——在单一客户服务通话中,语言切换可能多达十余次。专业供应商历来针对上述每项能力单独收取溢价。微软则将全部功能打包定价为每小时10美分。
如何解读微软关于FLEURS与Artificial Analysis基准测试的主张
微软提出三项性能主张,每项均基于不同测量标准;技术型买家应理解每项主张所涵盖及未涵盖的内容。
第一项主张是 MAI-Transcribe-2 在FLEURS基准测试中,于60种语言上综合排名第一,平均词错误率(WER)为5.2%。FLEURS是 FLEURS 由谷歌研究人员于2022年发布的基准测试,其数据集由母语者朗读约2000句句子构成,覆盖102种语言,每种语言约12小时语音。它是多语言语音识别的标准衡量尺度,因为它允许你在相同内容基础上比较模型对斯瓦希里语与瑞典语的识别效果。其指标词错误率简单统计相对于人工参考文本的替换、插入与删除次数;5.2%意味着约每20个词中有一个出错。但FLEURS采用朗读语音而非对话语音,且微软报告的平均词错误率实际上已从6月MAI-Transcribe-1.5的3.7%上升。这几乎可以肯定反映的是覆盖范围扩大而非性能倒退——将平均值计算扩展至60种语言(而非43种)意味着纳入资源匮乏语言,而所有模型在这些语言上均表现吃力——但买家应索要按语言细分的数据。 由谷歌研究人员于2022年发布的基准测试,其数据集由母语者朗读约2000句句子构成,覆盖102种语言,每种语言约12小时语音。它是多语言语音识别的标准衡量尺度,因为它允许你在相同内容基础上比较模型对斯瓦希里语与瑞典语的识别效果。其指标词错误率简单统计相对于人工参考文本的替换、插入与删除次数;5.2%意味着约每20个词中有一个出错。但FLEURS采用朗读语音而非对话语音,且微软报告的平均词错误率实际上已从6月MAI-Transcribe-1.5的3.7%上升。这几乎可以肯定反映的是覆盖范围扩大而非性能倒退——将平均值计算扩展至60种语言(而非43种)意味着纳入资源匮乏语言,而所有模型在这些语言上均表现吃力——但买家应索要按语言细分的数据。 由谷歌研究人员于2022年发布的基准测试,其数据集由母语者朗读约2000句句子构成,覆盖102种语言,每种语言约12小时语音。它是多语言语音识别的标准衡量尺度,因为它允许你在相同内容基础上比较模型对斯瓦希里语与瑞典语的识别效果。其指标词错误率简单统计相对于人工参考文本的替换、插入与删除次数;5.2%意味着约每20个词中有一个出错。但FLEURS采用朗读语音而非对话语音,且微软报告的平均词错误率实际上已从6月MAI-Transcribe-1.5的3.7%上升。这几乎可以肯定反映的是覆盖范围扩大而非性能倒退——将平均值计算扩展至60种语言(而非43种)意味着纳入资源匮乏语言,而所有模型在这些语言上均表现吃力——但买家应索要按语言细分的数据。
第二项主张是该模型在Artificial Analysis的词错误率排行榜上排名第二,并定义了该公司的准确率-延迟帕累托前沿(accuracy-latency Pareto frontier)。Artificial Analysis是一家独立基准测试机构,通过公开API测试模型,测量客户实际获得的效果。其指数融合模拟客服对话、欧洲议会演讲及企业财报电话会议,权重高度倾向英语商务语音。今年6月,该公司将 词错误率排行榜 MAI-Transcribe-1.5 MAI-Transcribe-1.5 阿里巴巴的 Fun-Realtime-ASR-preview 和ElevenLabs的Scribe v2之后,位列第三,词错误率为2.4%,同时称其为前十名中速度最快的模型。攀升至第二名表明微软已超越ElevenLabs。“帕累托前沿”(Pareto frontier)是从业者需注意的术语:这意味着没有竞品能在准确率上超越该模型而不牺牲速度,也没有竞品能在速度上超越该模型而不牺牲准确率。
第三项主张是原始速度——比OpenAI的 GPT-Transcribe快10倍,比ElevenLabs的 Scribe v2,比谷歌的 Gemini 3.5 Transcribe快五倍,依据 Artificial Analysis 的评测结果。在批量转录场景中,速度的重要性较低,因为此时无人等待;而其重要性更高在于吞吐量即成本。一个以实时速度300倍运行的模型,所需GPU小时数仅为一个以实时速度30倍运行的模型的几分之一。正是这种效率使微软得以将价格定为每小时10美分,并且(可合理推断)仍能盈利。
五个月内发布三款语音模型:深入解析微软AI团队的快速发布节奏
这一节奏本身即是故事中的故事。4月2日, MAI-Transcribe-1 上线,支持25种语言,定价为每小时0.36美元。6月2日, MAI-Transcribe-1.5 发布,支持43种语言、关键词偏向功能,并在Artificial Analysis评测中位列第三。今天, MAI-Transcribe-2 正式发布,支持60种语言、说话人分离(diarization)、时间戳、语码转换(code switching),在Artificial Analysis评测中排名第二,定价为每小时0.10美元。
五个月内三次发布,每次均将语言覆盖范围扩大约40%,同时新增多项功能——而这些功能竞争对手通常仅向付费高级版本用户开放。这种发布节奏体现了一支已确立稳定架构、正专注于数据与规模扩展的团队特征;这正是语音模型往往能快速且可预测地提升性能的阶段。它同时也是一家意图在任何其他公司之前将转录服务变为大宗商品的公司的节奏。
支撑该发布速度的组织决策,正是微软AI首席执行官穆斯塔法·苏莱曼(Mustafa Suleyman)于4月向 The Verge所描述的内容。他将首款模型归功于一支“精干专注的10人小团队”,该团队“摆脱了所有官僚程序束缚”,而一个更大的外围团队则负责供应商管理和数据获取。
他还告诉The Verge,该模型运行成本为“其他最先进模型GPU成本的一半”,并称其为微软“巨大的成本节约”。The Verge指出,Meta、亚马逊、谷歌和Anthropic均曾尝试过类似的扁平化组织结构。微软的转录产品线是迄今最显著的一次检验:该方法能否产出商业成果,而非仅限于研究论文。
为何微软在已向OpenAI投入130亿美元的前提下仍自建AI模型
微软已向OpenAI投资逾 130亿美元,并在Azure、Office及Copilot中托管OpenAI的模型。在过去四年中的大部分时间里,关于任何一款微软自研模型,人们最直接的问题始终是:何苦为之?过去一年间,这一问题的答案日益清晰,其起点便是独立性。
当 微软于2024年3月从Inflection AI聘任苏莱曼 ,并同时吸纳Inflection的大部分员工时,Salesforce首席执行官马克·贝尼奥夫(Marc Benioff)将其解读为一项意图声明。“微软正在构建自己的AI,而且我认为微软未来不会使用OpenAI。他们将拥有自己的前沿模型。” 贝尼奥夫于2025年1月对CNBC表示 。“这正是他们聘用穆斯塔法·苏莱曼的原因。”贝尼奥夫自身亦有其动机——Salesforce与微软存在竞争关系,且向Anthropic投资——但事态发展在很大程度上印证了他的观点。
2025年10月, 微软与OpenAI重组了双方合作关系 ,根据微软自身的公告,该协议首次允许微软“独立追求通用人工智能(AGI),或与第三方合作共同推进”。苏莱曼告诉The Verge,此次重新谈判“解锁了[微软]追求超级智能的能力”,微软数周后即宣布成立MAI超级智能(Superintelligence)团队。2026年4月,双方再次修订协议,据当时报道,此举终结了微软对OpenAI模型的解锁了[微软]追求超级智能的能力”,随后微软数周后宣布成立其MAI超级智能团队。2026年4月,双方再次修订该协议,终止了微软的 独家访问权 ,并 取消了微软的收入分成付款。每一次修订均松动了双方纽带,而每一次修订之后,都随之发布了更多MAI模型。
微软自研模型如何降低Teams、Word与Excel的成本
答案的另一半在于利润率。微软向OpenAI模型发送的每一个提示(prompt)均产生成本;而将其发送至自身GPU上运行的自有模型,则成本更低。今年7月,彭博社报道称, 微软已开始在Word与Excel中使用MAI模型 回应部分用户提示——此前微软曾宣传这两款产品由OpenAI与Anthropic提供支持。TechCrunch将此次转变视为整个行业 AI支出收缩浪潮的一部分 ,报道称亚马逊、Uber、Meta与埃森哲(Accenture)均在削减相关开支。
转录是此类替代的天然首选目标,因其问题边界明确且衡量指标客观。微软拥有Teams,后者产生海量会议音频;微软拥有Nuance,其临床文档业务依赖语音识别;微软还拥有Azure语音服务,数千家企业客户已长期调用该服务。上述每一项工作负载均具备迁移至 MAI-Transcribe-2的条件,而每迁移一小时,微软便少向其他方支付一小时费用。
苏莱曼对此目标的表述异常坦率。他在4月接受The Verge采访时表示,超级智能 ,他告诉The Verge在四月,“实质上关乎:‘这些模型是否能够为依赖我们提供世界级语言模型的数百万企业交付产品价值?’”无论人们如何看待将‘超级智能’一词应用于转录API,其商业逻辑显而易见:一次性构建能力,跨十余款产品部署,并停止向一家日益成为竞争对手的合作伙伴开具支票。
MAI-Transcribe-2 对阵 OpenAI、谷歌与 ElevenLabs:竞争格局
微软的发布声明中点名了四位竞争对手:OpenAI的 GPT-Transcribe、Google 的 Gemini 3.5 Transcribe、OpenAI 较早的 Whisper V3-Large以及 ElevenLabs 的 Scribe v2。文中未提及 Deepgram、 AssemblyAI、 Speechmatics或 Rev ——这些专业公司过去十年间一直向企业销售转录服务。微软正将自身定位为对标前沿实验室(frontier labs),而非现有 incumbents( incumbent providers)
这种定位部分出于营销考量,部分属实。前沿实验室将语音处理视为更广泛平台的一项‘勾选式’功能,并据此定价;而一款专用模型若能在速度上比它们快 5 至 10 倍,同时准确率与之持平,则确实构成一项真正的差异化优势。但专业公司将首当其冲感受到价格压力。按每小时 0.10 美元计价,微软的定价等于或低于许多专业公司面向高用量企业合同所报的价格,且其基础费率已捆绑了说话人分离(diarization)、时间戳及 60 种语言支持。专业公司剩余的护城河在于领域深度——例如医学术语库、法律文书格式、行业专属集成等——而微软的关键词偏向(keyword biasing)功能正是直接针对这一护城河。
微软明显未宣称在准确率上超越的唯一竞争对手是阿里巴巴,其模型在 2026 年大部分时间内于多项独立权威排行榜上均位居前列。TechCrunch 于 7 月报道称 一些美国公司已开始评估中国模型 作为更低成本的替代方案,尽管存在安全顾虑。微软向此类买家提出的主张虽属隐含,却毫不含糊:准确率相当、推理速度更快、价格更低,且供应商是贵司合规团队业已信任的对象。
技术决策者在更换转录服务商前应提出的问题
尽管该发布在基准测试方面极为具体,但仍留下若干实际问题待解。第一是服务时长:微软称每小时 0.10 美元为首发优惠价,却未说明截止日期或标准费率;任何构建成本模型者均应以书面形式获取这两项信息。第二是流式传输(streaming)。该发布强调批处理吞吐量与长音频处理能力,却对实时转录只字未提——而语音代理(voice agents)与实时字幕(live captioning)恰恰依赖此项能力。Artificial Analysis 维持一份独立的流式传输排行榜,微软对此保持沉默实属引人注目。
第三是各语种准确率。60 种语言平均错误率为 5.2%,可能意味着主流语言错误率仅 3%,而低资源语言则高达 12%;因此有特定语种需求的买家应直接测试相关语言。第四是说话人分离(diarization)质量。词错误率(WER)并不衡量说话人归属准确性;一份转录文本可能拥有近乎完美的 WER,却仍将每隔一句都归错说话人。该发布未提供任何说话人分离错误率或类似指标。
第五是数据处理方式。企业级转录涉及医疗记录、法律特权及金融披露等敏感内容,而该发布对数据驻留地(data residency)、数据保留期限(retention)或提交至 Foundry 的音频是否会用于未来训练均未作说明。据《The Verge》报道,微软今年 4 月的公告将训练数据描述为‘人工精选录音、承包商录制的带噪音频,以及来自开放网络的海量数据’——这一描述理应引发受监管行业的尖锐质询。上述各项空白在首发公告中并不罕见,但它们恰恰是区分‘排行榜胜出’与‘生产环境部署’的关键问题。
微软语音模型战略所揭示的其更广泛的 AI 抱负
暂且抛开语音识别细节,一种延伸至转录之外的模式已然浮现。微软 AI 部门如今已推出面向图像、语音、转录、代码、推理及网络安全的模型。在今年 6 月的 Build 大会上,它于一场主题演讲中宣布 七款全新 MAI 模型 。每一款均遵循相同策略:瞄准定义明确的模态(modality),激进优化推理成本,定价低于前沿实验室,通过 Foundry 分发,并悄然将其替换进微软自有产品。
此举并非试图打造一款在所有任务上均超越 GPT 或 Gemini 的通用模型,而是旨在构建一套专业化模型组合,使其总体上足以支撑微软绝大多数企业工作负载,从而无需向其他方付费;同时以专业公司无法匹敌的价格,将富余算力出售给其他所有客户。转录恰是该策略率先全面成熟的模态,但 MAI-Transcribe-2 的发布说明读起来更像一份模板,而非单纯的产品公告。
苏莱曼(Suleyman)已用两年时间谈论‘人文主义超级智能’(humanist superintelligence)及‘对其负责、站在用户一方’的 AI 助手。其措辞崇高,执行却是一份电子表格。五个月前,微软对一小时语音转文字收费 36 美分;本周四,它将价格降至 10 美分,额外附赠六项竞争对手单独销售的功能,并宣称在业界标准多语种基准测试中登顶。这家曾斥资 130 亿美元学习前沿 AI 成本的公司,已决定宁可自建工厂,也不愿租用产出;如今,它甚至以低于租金的价格对外出售该产出。
MAI-Transcribe-2 即日起可通过 Microsoft Foundry 及 MAI Playground获取。
JOTO 企业落地观察
- 对企业部署而言,MAI-Transcribe-2将转录从高争议性支出变为可规模化采购的基础设施——每小时0.10美元含全部高级功能,使中型银行等客户年转录成本从3.6万美元骤降至1万美元,显著降低AI落地门槛。
- 对智能体工程而言,该模型原生支持流式不敏感的批处理高吞吐、词级时间戳与语码切换(如Hinglish/Spanglish),为构建跨语言客服智能体、会议纪要Agent及合规审计Agent提供了开箱即用的低延迟语音理解基座。
- 对AI安全治理而言,文章明确指出其训练数据含‘开放网络海量数据’且未说明音频是否用于再训练、数据驻留地或保留策略,这对医疗、金融等受监管行业构成实质性合规风险,要求企业在接入前必须书面确认数据生命周期管控条款。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


