JOTO
联系我们
← AI 智库
多模态模型

微软发布自研MAI图像与语音模型,称GPU成本最高降89%

2026 年 7 月 23 日 · VentureBeat AI · 9 分钟阅读

微软推出MAI-Image-2.5-Pro与MAI-Voice-2-Flash两款自研AI模型,已部署于Bing、PowerPoint、Dynamics 365等产品,实测GPU成本最高降低89%,并宣布以‘爬山式’方法论推动模型家族化与企业级落地。

Microsoft launches new in-house AI models it says cut costs up to 89% versus OpenAI

微软 AI 于周三向公众预览阶段发布了两款全新自研模型—— MAI-Image-2.5-Pro,这是该公司迄今保真度最高的图像生成器;以及 MAI-Voice-2-Flash,一款专为高吞吐量企业工作负载构建的语音模型——同时公布了生产数据,这些数据构成了该公司迄今最有力的主张:它可完全依靠自有模型驱动其产品,而无需依赖 OpenAI 的前沿模型。

该公告由 微软 AI 超级智能团队(Microsoft AI's Superintelligence team)发布,距该公司承诺内部构建专用模型约一年时间,且此次公告罕见地详细说明了这些模型当前的运行位置: BingPowerPointOneDriveDynamics 365ExcelGitHub Copilot以及 Azure。这一信息面向企业买家——并隐含地面向 OpenAI——传递的信号是:微软的自研模型已不再是研究项目,而是服务于数百万用户的生产级基础设施。

该公司在公告博客中写道:“每一项增强功能都朝着同一目标迈进:由微软模型驱动的微软产品。”

MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash 如何占据 AI 成本曲线的两端

这两款新发布模型占据了微软所称的质量-速度-成本曲线的两端,这种定位是刻意为之。 MAI-Image-2.5-Pro 瞄准高端层级:主打标志性图像、精细编辑及图像内文本的精准渲染——最后一项长期以来一直是图像生成模型公认的薄弱环节。微软对该模型的定价为:每百万文本输入 token 5 美元、每百万图像输入 token 8 美元、每百万图像输出 token 106 美元。基础版 MAI-Image-2.5 模型最近在 Arena 图像编辑排行榜上位列第二,该社区排行榜已成为生成式媒体领域的事实性计分板。

创意产业似乎已开始关注。全球广告巨头 WPP 的全球首席创意官 Rob Reilly 在微软公告所附声明中称该 Pro 版本模型为“生成式媒体(GenMedia)工具的重大飞跃”,并补充道:“微软已牢固确立了其在生成式 AI 领域的领导者地位。”

MAI-Voice-2-Flash 则走向另一方向。该模型首次在微软 Build 大会上预览亮相,Flash 运行速度是 MAI-Voice-2 的两倍,成本降低 32%,定价为每百万字符 15 美元。它专为不具光环但规模庞大的高吞吐量语音市场而设计——呼叫中心、语音代理以及对延迟和单次通话成本敏感、而非对表达力边际提升敏感的实时语音应用。这两款模型共同体现了一种构建模型家族而非单一旗舰模型的战略,因为正如该公司所言,一家追求极致保真度的创意工作室,其需求与一家每日处理数百万通电话的客服运营机构截然不同。

微软的生产指标显示,自研模型将 GPU 成本最高削减达 89%

此次模型发布本身或许不如微软随附公布的部署指标更具新闻价值——这些数字读起来就像一份系统性论证,旨在将其产品组合中第三方前沿模型全面替换为自研模型。 

Bing 图像生成器(Bing Image Creator) 目前已完全端到端运行于 MAI-Image-2.5之上,标志着这款面向消费者的图像工具首次实现完全自研。在 PowerPoint 中,微软表示 MAI-Image-2.5 相比 OpenAI 的图像模型 GPT-Image-2 最高可降低 84% 的 GPU 成本。在 OneDrive 中,MAI-Image-2.5 已成为关键图像编辑场景的默认模型,该公司报告称保存率提升 26%,P95 延迟降低约 25%,中等利用率生产工作负载下的效率提升 2.5 倍。

在语音方面, MAI-Voice-2-Flash 目前为 Dynamics 365 客户联络中心(Dynamics 365 Contact Center)提供支持——该平台客户包括 T-Mobile 和易捷航空(EasyJet)——微软声称 GPU 成本最高降低达 89%。该模型还已集成至 Azure Voice Live,供开发者构建语音转语音代理。

或许最具深远影响的部署位于医疗健康领域。微软的 Dragon Copilot该平台由17万名医疗从业者使用,上季度处理了2800万次患者就诊事件,目前其覆盖58种语言的多语言工作流已运行在MAI-Transcribe-1.5之上。微软表示,内部评估显示,该模型在大多数语言上的转录错误率和语言识别错误率均实现了50%的相对降幅——这一声明在转录错误可直接传导至临床记录的领域中具有重要意义。

揭秘让小型模型在Excel任务中击败GPT-5.6的‘爬山式’策略

在同日发布的配套文章中,微软详细阐述了这些成果背后的方法论——即其称之为‘爬山式机器’的集成飞轮系统,该系统由数据、模型以及环绕它们的产品‘harness’(封装层)共同构成。

最清晰的案例是 MAI-Code-1-Flash,这款轻量级编程模型于6月在GitHub Copilot中发布。微软称,该模型在VS Code中的代码接受率比GPT-5.4 Mini和Claude Haiku 4.5高出约10%,同时中位数token用量减少10%。开发者留存率也呈现类似趋势:与GPT-5.4 Mini相比,用户在多日内回归的可能性高出6%;与Claude Haiku 4.5相比则高出11%。

随后,微软做了一件更有趣的事:它取用MAI-Code-1-Flash检查点,并进一步 在Excel强化学习环境中对其进行训练,教会该编程模型掌握电子表格知识工作的工具与工作流。据生产环境用户反馈,该模型在最常见的Excel任务上已达到与GPT-5.6相当的水平——同时体积足够小,可在英伟达较旧的H100甚至A100 GPU上运行,而无需依赖最新一代加速器。

这一硬件细节值得强调。每家主要AI公司都在争夺尖端芯片的配额,而一款能在两代前硅基硬件上交付接近前沿质量的模型,从根本上改变了部署经济性。它同时也释放出最新硬件资源——包括微软现已投入运行的GB200集群——用于训练而非推理服务。

萨提亚·纳德拉的‘前沿扩散’宣言重塑了与OpenAI的关系

微软CEO萨提亚·纳德拉在X平台发布了一篇题为《前沿扩散与控制》的长文,以此框架化本次公告,该文实质上近似一份战略宣言。纳德拉写道:“我们现在可将已饱和的前沿能力规模化交付,并以更低成本通过针对高频使用产品优化的模型实现,同时继续使用前沿模型满足前沿需求。”他还补充称,微软“正开始将我们第一方产品界面的流量路由至MAI,只要我们的模型匹配或优于前沿替代方案”。

将高管措辞翻译为实际含义:一年前尚属业界顶尖的能力如今已成为基本门槛,而微软相信自己能以低成本为真实产品使用中占主导地位的具体、重复性任务复现这些能力。当用户仅需重新格式化Excel列时,为何还要为前沿模型支付前沿价格?

纳德拉谨慎指出,“来自OpenAI和Anthropic的前沿模型是与MAI并存于编排系统中的组成部分”——但他也阐明了一项明确的模型独立性原则,主张企业的评估“应在任一特定模型被移除后仍持续进行爬山式优化”。 

他辩称,‘将封装层、记忆、上下文及技能保留在模型之外’,才是微软掌控力的来源。言外之意不难察觉。路透社4月报道称,微软对OpenAI技术的 独家授权 已被修订为非独家安排;《The Information》去年9月报道指出,微软已 开始将Anthropic模型 整合进部分产品中。本周三的公告完成了这一三角关系:微软作为编排者,其合作伙伴的前沿模型成为可互换组件,而微软自有模型则持续吸纳日益增长的常规流量。”

开发者为更廉价的任务专用模型欢呼,怀疑者则质疑微软过往执行记录

线上反响既体现了该策略的吸引力,也反映出对其的质疑。一位X用户 @mavihsk在回应纳德拉的帖子时写道:“当人们为细分任务使用小型模型时,我非常欣喜。为什么我仅仅为了在Excel中更改字段就必须调用那个无所不知的模型?”另一位用户 @nabu_lines则简洁提炼了该主张:“当你停止过度使用最大模型时,成本与性能都会提升。”

其他人士对微软的执行履历则不那么宽容。“微软在倾听用户反馈方面表现最差,”设计师 @designedbyabin写道,认为该公司“将因屡次未能理解用户需求而在AI竞赛中落败”。还有一位用户 @tokenoverflow对模型独立性主张提出了更冷峻的批评:“我希望它在移除微软之后仍能持续爬山式优化。”

怀疑者提出的观点确有道理。微软自我报告的指标——接受率、保存率、GPU节省量——均源自其内部评估,而非独立基准测试,且该公司自行决定公布哪些对比结果。

但该策略的逻辑并不依赖于任何单一数字。纳德拉将软件如今拥有‘真正的边际成本’的表述,解释了微软为何执着于token、GPU及推理服务成本:当AI功能需在覆盖十亿用户的全产品组合中响应每一次按键操作时,84%的GPU成本削减便不再仅是一项优化,而是可行商业模式与烧钱陷阱之间的分水岭。

微软为何将其内部AI方法论转化为Azure产品

该策略的最后一环在于:微软出售的不仅是模型,更是方法论本身。纳德拉明确将‘爬山式’方法定位为“适用于所有其他原生AI、SaaS或企业公司的模板”,并正通过Foundry及所谓‘前沿调优’(Frontier Tuning)将该工具链打包提供,使企业客户能够基于自身专有评估标准及强化学习环境训练专用模型。此举将微软内部的成本削减实践转化为一项Azure产品,并为企业客户提供了即便模型本身源自别处,也仍选择在其云平台上运行AI工作负载的理由。

该公司强调模型须经‘清洁、可追溯、企业级数据训练,且未经第三方模型蒸馏’,同样服务于同一商业目标。在行业正面临日益加剧的训练数据溯源审查背景下,微软押注企业买家乃至法院将关注模型能力的来源。微软表示,目前已将‘爬山式’方法扩展至 Copilot ChatOutlookPowerPoint,且这两款新模型均已通过 Microsoft Foundry 以及 MAI Playground。该公司写道:“这一切都不是终点,我们才刚刚开始。”

七年前, 微软押注超过130亿美元 ,相信OpenAI将构建人工智能的未来。周三的公告表明,该公司此后吸取了一个更廉价的教训:人工智能的未来可能属于打造前沿技术者,但利润却属于使之普及化者。


本文由 JOTO AI 智库从已授权的 VentureBeat AI 同步并整理。

原始来源:VentureBeat AI

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
致电我们
+86 (021) 6566 1628
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。