JOTO
Contact us
← AI 智库
大语言模型

微软发布 Microsoft-Decision-1:专做选择题的小模型,85 毫秒给答案

2026 年 10 月 10 日

微软推出专用决策模型 Microsoft-Decision-1,专为结构化选择题任务设计,不生成文本、仅输出校准概率。其在36项测试中平均准确率83.5%居首,中位延迟85毫秒,比GPT-6 Sol快35倍。模型基于Qwen3.5-9B后训练,输入纯文本(最长32K token),输出JSON格式概率,已上线Microsoft Foundry。

专为结构化决策而生

北京时间 10 月 10 日凌晨 2 点 37 分,微软 CEO 纳德拉发帖:微软有了一个新模型,叫 Microsoft-Decision-1。

它不写文章,不聊天。你给它一道选择题,它告诉你每个选项有几成把握。

官方说,它在 36 项测试里平均准确率排第一,中位延迟 85 毫秒,比 GPT-6 Sol 快 35 倍。

Microsoft-Decision-1 来了。这是我们做的快速决策模型,在结构化决策任务上,延迟和质量都是顶级,表现超过大语言模型和其他决策模型。

@msdev 官方帖截图,展示 Microsoft-Decision-1 发布消息
@msdev 官方帖。帖子里的链接卡片图是空白的,我们截图时裁掉了,不影响文字内容

「决策模型」是什么

先打个比方。大模型像一个会写作文的专家,你问什么他都能洋洋洒洒写一篇。

决策模型更像医院的分诊台护士。她不给你写病历长文,只问几句,然后说:去急诊 90%,去内科 8%,去皮肤科 2%。

答案是固定选项里的一个,后面跟着一个把握程度。程序拿到这个数,就能直接往下走:把握高的自动处理,把握低的转人工。

这类活很多:给客服工单分类、判断一个搜索结果相不相关、让 AI 给另一个 AI 的回答打分、决定智能体下一步该继续还是停下。

单次不难,难在量大、链条长。官方算过一笔账:每个决策多等 100 毫秒,连着做 20 个,整个流程就多等 2 秒。

它是怎么做出来的

官方页面写得比较清楚:

  • 基座:阿里的开放权重模型 Qwen3.5-9B,微软做了后训练
  • 输出:给每个选项一个校准过的概率,一次调用算完,不生成文字
  • 题型:是非题、多选题、打分题,也能按评分标准给 AI 的回答和智能体的动作打分
  • 输入:纯文本,最长 32K token;输出是 JSON
  • 训练数据:公开数据集(过了微软的开放数据审核)加团队自己合成的数据

微软还说,之后会把它换到别的基座上重做,包括微软自家的 MAI 和 OpenAI 的模型。

它有几个明确不做的事:不生成文字,不聊天,不翻译,不做总结,也不解释为什么选这个。

成绩单

官方做了一张对比图,放在纳德拉的帖子里,是个 10 秒的动画。下面是它的最后一帧:

微软官方对比图,显示 Microsoft-Decision-1 在准确率与延迟上的领先表现
微软官方对比图(纳德拉帖子里的视频末帧)。手机上字太小,下面把数字逐条列出

官方拿了 36 个测试集,共 147,137 道题,说这些都是训练时没见过的。里面有公开的,也有私有的,覆盖路由、排序、长上下文、多语言、推理、安全等。

准确率(36 项平均):

  • Microsoft-Decision-1:83.5%
  • Quyet-1.0-Large:81.9%(JevBench 榜单第 1)
  • Surogate Rune 26B-A4B:79.7%
  • GPT-6 Luna Decisions:79.4%
  • deck-31B:77.8%
  • H2O-Lightning-4B v1.1:77.2%
  • Strands-Decider 2B:54.8%(只跑了 36 项里的 23 项)

中位延迟(越低越好):

  • Microsoft-Decision-1:85 毫秒(p95 为 125 毫秒)
  • H2O-Lightning-4B v1.1:210 毫秒
  • Jev 1.13.0:240 毫秒
  • GPT-6 Luna Decisions:300 毫秒
  • Quyet-1.0-Large:380 毫秒
  • Surogate Rune 26B-A4B:380 毫秒
  • deck-31B:400 毫秒
  • GPT-6 Sol:3.01 秒

官方的算法是:比 Quyet-1.0-Large(亚军)快 4.5 倍,比 GPT-6 Sol 快 35 倍。

校准度(100 分为满分,指「说有 90% 把握时,真的对九成」):

  • Quyet-1.0-Large:93.1
  • Microsoft-Decision-1:92.2,排第二,差 0.9 分
  • Surogate Rune 26B-A4B 和 H2O-Lightning-4B:都是 91.8
  • GPT-6 Luna Decisions:89.9;deck-31B:83.5

所以更准确的说法是:准确率第一、速度最快,校准度第二。

看数字时有一点要留意。图注写明,对手的延迟取自 JevBench 的校正后中位数(10 月 7 日),Microsoft-Decision-1 则是微软自己在 Foundry 同区域实测的。两边测法不完全一样。

另外两项自测:

  • 稳定性:同一个请求换 8 种方式扰动(改写、换选项描述、调顺序、改字段名、加格式噪音等),决策平均只翻转 1.3%。改写选项描述、颠倒或打乱选项这两类,一次都没翻
  • 安全:在 11 个测试集、5,250 个请求上测有害内容、越狱和提示词注入,官方说能拒绝有害请求,同时不误伤正常请求,没给具体数字

微软内部先用了什么

官方列了 4 个内部试用,数字都是微软自己报的:

  • Xbox 研究团队:把问卷、Steam 和推特上 1 万多条玩家反馈,分进研究员定好的主题。质量和 GPT-6 Sol 相当,快 14 倍多,便宜 200 倍
  • Copilot 团队:给聊天和智能体的回答打质量分。和 GPT5.6 Luna(官方原文写法)相当,快 100 倍
  • 值班工程师:出故障时检索日志、工单等资料,比大模型更好也更快,没给数字
  • Microsoft Discovery:科研智能体评估上一轮实验、再调整方案。评分一致性是大模型打分的 46 倍,速度 3 倍,自适应重规划整体快近 4 倍

纳德拉的帖子也提到,微软内部在各处测试它。

纳德拉推文截图,宣布 Microsoft-Decision-1 发布
纳德拉(@satyanadella,约 958 万粉丝)的帖子,北京时间 10 月 10 日 2:37。帖子里的视频预览就是上面那张对比图

怎么用,多少钱

  • 在哪用:Microsoft Foundry 已上线,目录页标的是正式可用。OpenRouter 官方说「即将」上线
  • 价格:输入每百万 token 0.042 美元,输出免费

按这个价格粗算:1 万条各 500 token 的请求,一共 500 万 token,约 0.21 美元。这是我们的算术,不是官方案例。

官方还写了一些限制:不能把它当作信贷、就业、住房、保险、教育、医疗、法律权利这类重大决定的唯一依据,也不能用来监控或给个人画像。

开源吗?官方没说

官方页面只说它基于开放权重的 Qwen3.5-9B,没说 Microsoft-Decision-1 自己的权重会不会放出来。

我们在 Hugging Face 上搜了名字,也没找到。目前能确认的用法只有上面的 Foundry。

这些官方没说

  • 最终模型的参数量。只知道基座是 9B 的 Qwen3.5
  • 训练方法和数据规模。只知道是后训练,数据来自公开数据集加合成数据
  • 36 个测试集的完整名单
  • GPT-6 Sol 的具体规格
  • 支持哪些语言。测试里有多语言类,但没给分语种的成绩

以上成绩都来自微软自己的测试,我们没有独立复现。

JOTO 企业落地观察

  • 企业部署决策模型需重新评估服务链路中的“等待成本”——当单次决策延迟从 300 毫秒降至 85 毫秒,20 步串联决策的整体响应时间可压缩近 4 秒,这对实时性敏感场景(如客服路由、风控拦截)构成实质性工程阈值突破。
  • 该模型放弃通用能力换取确定性输出,意味着企业在构建智能体工作流时,可将“判断节点”标准化为轻量级、高吞吐、低延迟的专用服务,降低对大模型 API 的依赖强度与调用频次,从而优化整体系统稳定性与成本结构。
  • 输出为 JSON 格式校准概率、不生成解释文本,契合 RAG 知识工程中“可信度驱动决策”的需求——下游系统可直接消费置信度数值,用于动态触发知识召回、人工复核或 fallback 路由,无需额外解析不可控的自然语言输出。
  • 模型明确禁止用于信贷、医疗等高风险领域,且未披露多语言细粒度性能,表明其当前定位是“受控环境下的结构化辅助决策”,企业若计划将其嵌入关键业务流程,需自行完成领域适配验证与合规边界界定。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.