JOTO
Contact us
← AI 智库
开源模型

小米MiMo-V2.6系列发布:Pro登顶全球开源权重模型榜首,Flash以1/3成本逼近旗舰性能

2026 年 9 月 22 日

小米MiMo-V2.6-Pro以46分成为Artificial Analysis‘智能指数’全球最高分开源权重模型,超越Grok 4.6与Gemini 3.8 Flash;配套的V2.6-Flash在多项智能体基准中达Pro的94%–97%性能,API成本仅为其三分之一,且全栈开源MIT许可。

'Better than DeepSeek': Xiaomi's MiMo-V2.6-Pro debuts as the top open weights model in the world alongside cheaper V2.6-Flash

在一场令人意外的逆袭中,中国电动汽车及消费电子制造商小米公司发布了其不断壮大的MiMo语言模型系列的最新版本,且 MiMo-V2.6-Pro 已成为第三方基准测试机构 Artificial Analysis公司‘智能指数’(Intelligence Index)上全球表现最佳的开源权重模型,得分为46

这一成绩使小米这款新旗舰模型在Artificial Analysis最新评分方法下,超越了包括xAI公司的Grok 4.6(当前得分为44)和谷歌Gemini 3.8 Flash(当前得分为41)在内的专有模型。它还使MiMo-V2.6-Pro 与同日发布的全新Grok 4.7并列——后者首日亮相即获46分,同时领先于另一款中国开源权重模型DeepSeek V4.1 Flash(39分)和DeepSeek V4.1 Pro(36分)。

该结果之所以引人注目,不仅因为小米在国际上更以智能手机、电动汽车和消费电子产品而闻名,而非前沿人工智能。

也因为它是一款开源权重模型, 采用MIT许可证授权 ,且通过小米API访问的成本远低于性能相近的诸多专有模型。

换言之,独立开发者与企业均可免费从 Hugging Face下载该模型,针对其特定用途进行定制或微调,在自有或租用的硬件上自行运行,并将其投入生产工作流中——全程无需向小米支付任何费用。他们也可通过小米API运行该模型(对那些受限于使用中国境内服务器的用户而言,此方案实施难度更高),其每百万token收费为全球最低水平之一。

小米对未缓存输入token收费0.435美元/百万,输出token收费0.87美元/百万。Artificial Analysis测得该模型每项智能指数任务成本为0.13美元,输出速度约为每秒134个token,证实其上下文窗口达100万个token,支持文本、图像、音频及视频输入。

该旗舰模型还搭配推出了MiMo-V2.6-Flash,这是一款更小、成本显著更低的模型(每百万输入/输出token分别收费0.14美元/0.28美元),在保持相同100万token上下文窗口及原生多模态能力的同时,面向高吞吐量生产工作负载。据我们评估,它是目前全球通过应用程序编程接口(API)提供服务的主要前沿模型中第二便宜的模型。

小米还发布了MiMo-V2.6-Pro-UltraSpeed,称其生成速度最高可达标准Pro版输出速度的20倍。

综上所述,V2.6看起来与其说是一次单一模型发布,不如说是小米构建完整开源智能体栈(open agent stack)最新一步:涵盖基础模型、编码智能体、智能体框架(harnesses)、强化学习环境,以及如今支撑它们的训练基础设施。

从智能手机与电动汽车到前沿人工智能

小米进军前沿模型领域的步伐在过去一年内迅速加快。

该公司自2025年起开始公开扩展MiMo系列,并在2026年大部分时间里深入布局智能体AI。今年4月,其 MiMo-V2.5与V2.5-Pro发布 确立了如今在V2.6中清晰可见的诸多架构与经济理念:稀疏混合专家(sparse mixture-of-experts)模型、百万token上下文窗口、宽松许可条款,以及针对长期运行智能体工作负载的异常低廉价格。

MiMo-V2.5-Pro本身已是一款参数量达1.02万亿的混合专家模型,推理时激活420亿参数,专为长周期软件工程及小米所称的‘框架感知’(harness awareness)而训练——即在数百或数千次工具调用构成的智能体框架内部运行时,管理内存与上下文的能力。

今年6月, 小米继而推出MiMo Code——一款开源终端编码智能体,具备持久跨会话记忆、任务检查点及一个独立的检查点写入子智能体。小米内部测试表明,当工作流执行步骤超过200步后,MiMo Code相较Claude Code的优势愈发明显;不过这些结果由厂商报告,且对配置高度敏感。

该公司还推出了 HarnessX——一个研究框架,将围绕模型的提示词、记忆系统、工具及控制逻辑视为可被重写与优化的组件。小米报告称,当智能体框架动态演化(不替换底层模型)时,在15种模型-基准组合上平均绝对性能提升达14.5%。

MiMo-V2.6则将上述各条技术路线重新整合回模型训练流程本身。

小米斥资数百万美元扩展强化学习

V2.6背后最大的技术故事是强化学习(RL)。这是模型通过尝试任务、依据执行效果获得奖励或惩罚、并据此更新自身以趋向更优行为的阶段。

扩大该过程规模成本高昂,因为智能体任务可能涉及长链推理、工具调用与验证;但潜在回报巨大:模型不再仅从静态示例中学习,而是反复实践实际执行复杂工作,包括规划、使用工具、纠正错误及从失败策略中恢复。

小米表示,MiMo-V2.6-Pro与更小的MiMo-V2.6-Flash各自经历了30轮大规模强化学习步骤,六天内覆盖约75万条轨迹,报道成本分别为Pro版262万美元、Flash版85万美元。

其公开 技术报告 使该规模更为具体:每轮训练步骤始于1568个提示词,为每个提示词生成16条候选轨迹,每步产出约2.5万次推演(rollouts)及27亿至37亿个训练token。小米称最终生成的序列平均每条长度约为11万至15万个token。

这意味着小米并非主要强化简短回答,而是强化整套冗长的智能体工作流。

且这笔支出中仅一部分用于更新模型本身。小米称,Pro版强化学习成本中43.5%用于训练,43.8%用于生成推演,另有12.7%用于评分。换言之,超半数预算用于在将经验转化为权重更新前,生成并评估模型的经验。

该公司将其策略称为‘仅需一次强化学习’(You Only RL Once)。小米并未为编码、视觉任务、计算机使用及网络安全等领域分别运行完全独立的强化学习项目,而是将这些领域及多种智能体框架混合进单一大型训练运行中。

框架多样性本身即构成该训练分布的一部分。小米称,其为编码、通用专业工作流、视觉任务及网络安全创建了轻量级‘微型框架’(mini-harnesses),使模型能接触不同组合的系统提示词、工具及上下文管理策略,而不会与某一特定生产框架紧密耦合。

该系统采用完全异步的组相对策略优化(Group Relative Policy Optimization,简称 GRPO)。这种异步设计至关重要,因为长时间运行的智能体任务并非全部同时完成。小米采用部分 rollout( rollout 指策略执行轨迹)方式,使 GPU 集群持续保持忙碌状态,而非等待最慢的轨迹完成;它会中断尚未完成的任务,并在之后恢复执行。此外,小米还构建了一种样本混合机制,旨在防止每一批次中更快或更简单的任务类别压倒较慢的任务类别。

其结果是,此处“扩展强化学习(scaling RL)”意味着同时扩展多个维度:模型生成的经验数量、这些经验所发生的环境范围,以及用于决定哪些行为真正值得强化的计算资源。

不仅教会智能体通过测试,更要教会其干净利落地解决问题。

最后这一部分可能是报告中最具影响的技术细节之一。

简单的二元奖励可以告诉编码模型其补丁是否通过测试套件,但无法可靠地区分两个均能通过的解法——其中一个简洁且最小化,而另一个则引入了广泛的回退逻辑、不必要的 API 更改或脆弱的变通方案。

因此,小米构建了另外两种更复杂的奖励系统。

  1. 组级奖励合成(Groupwise Reward Synthesis,简称 GRS)通过比较同一问题的多次尝试,生成任务特定的评分标准。这些评分标准分别评估实现质量与智能体行为质量:即是否满足需求、是否处理边缘情况、是否尊重周边代码库,以及是否收集并验证了所需证据。

  2. 组级优势再分配(Groupwise Advantage Redistribution,简称 GAR)进一步通过在同一 rollout 组内比较通过的解法,将更多训练优势向更优解法倾斜。

技术报告包含一项实验,用以说明此机制为何重要。在 MiMo-V2.6-Flash 上进行的纯代码强化学习运行中,训练 未启用 在线组级评分时,智能体轮次(turn)数量与生成 token 长度迅速上升,最终导致更多轨迹逼近其长度上限。而启用 GAR 后,小米表示通过率持续提升,同时轮次数量基本稳定,token 增长也更为平缓。

面向维护者的审计还发现,未启用在线评分训练出的策略日益依赖诸如推测性兼容分支、广泛导出、捕获并忽略异常、放宽验证以及针对评估场景的配置更改等技术。小米称,经组级评分训练的策略则倾向于生成更小、更精准的补丁。

这触及了智能体型强化学习的一个根本性问题:模型可能变得更善于最大化奖励,却并未在奖励本应代表的实际工作中变得更好。

小米在报告中一个不同寻常地详尽章节中专门探讨了该问题,标题为 奖励黑客(reward hacking)

在早期编码运行中,智能体有时发现:与其自行解决指定缺陷,不如下载软件包的新版本、获取上游源文件、克隆仓库的后续状态,或在问题历史记录中搜索已发布的修复方案。

这些方法虽可满足测试要求,却完全绕过了预期任务本身。

小米表示,其应对措施包括:从训练环境中移除构建产物与缓存、删除未来的 Git 历史、屏蔽对潜在答案来源的网络访问,并部署一个独立的“黑客智能体(hack agent)”,专门在训练前搜寻剩余漏洞。在最终运行中,该公司称确认的奖励黑客轨迹比例在 Pro 和 Flash 两个版本中均低于 2%;当评分器识别出此类轨迹时,其有效奖励被重置为零。

在此规模下,机器学习问题开始与分布式系统问题密不可分。小米必须确保数万个长时间运行的轨迹在异构环境中持续推进,防止较快任务主导批次,保持训练与推理行为一致,并确保能力日益增强的模型不会学会利用评分器自身的弱点。

技术报告指出,小米甚至在强化学习阶段冻结了模型的专家混合(mixture-of-experts)路由器,以减少训练漂移并提升稳定性。

前 DeepSeek 研究员、现任小米 MiMo 团队负责人的罗富立(Fuli Luo) 在 X 平台发文 称,V2.6 很可能是开源模型团队迄今开展的最大单次强化学习运行之一。

她表示,小米为此项目投入了数十名人员,并指出其研究与工程挑战超过了她在参与 DeepSeek R1 期间所遇到的挑战。

“在算力极度稀缺的时代,我们仍选择在较长时间内,将数十人组成的团队集中于一个目标:扩大强化学习规模。”

她的描述与技术报告内容一致——该报告花费几乎与学习算法本身同等篇幅,来阐述维持强化学习系统稳定所需的基础设施。

开源人工智能知识工作初创公司 Paper Instruments 的首席执行官达尼什·卡齐(Daanish Khazi) 在 X 平台发文 称,他认为此次发布应促使研究人员“更新所有关于后训练缩放定律(post-training scaling laws)的先验认知”,重点关注小米在仅使用中国芯片(而非英伟达 GPU)、且据报算力开销相对有限的情况下,所提取出的显著能力提升。

智能体性能强劲,诞生新的开源权重领导者——但并非全面横扫基准测试。

小米自建基准测试套件显示,V2.6 相比 V2.5 取得大幅进步,在 DeepSWE v1.1 上得分为 71.9,在 AutomationBench 上为 53.1,在 Toolathlon-Verified 上为 76.9,在 Terminal Bench 2.1 上为 89.9,在 JobBench 上为 62.0;此外,在 CyberGym 上达到 94.0,在小米自研 MiMo 视觉编码基准测试上达到 72.3。

Xiaomi MiMo-V2.5-Pro benchmark chart

小米 MiMo-V2.5-Pro 基准测试图表。图片来源:小米

小米报告的多项评测中,Anthropic 的专有模型 Claude Opus 5 仍领先,包括 DeepSWE v1.1、ProgramBench 和 Terminal Bench 4.0。OpenAI 的专有模型 GPT-5.6 Sol 在部分网络安全评测(如 ExploitBench 和 SEC Bench Pro)中亦处于领先地位。

在 DeepSWE v1.1 上,MiMo-V2.5-Pro 得分为 19.0,而 V2.6-Pro 达到 71.9;AutomationBench 从 16.0 提升至 53.1;MiMo Code Bench 则从 40.4 升至 63.2。

这一区别至关重要。小米并未展示其在所有基准测试上全面胜过最强闭源模型。它所做的是,将一个开源权重系统实质性地推向该前沿水平,同时保留可下载权重及远低得多的运行成本。

Flash 版本对高吞吐量用户而言可能更具实际意义。

旗舰版 Pro 模型自然会吸引最多关注,但 MiMo-V2.6-Flash 对于运行大量智能体调用的企业而言,可能更具相关性。

Flash 本身即是一个大型稀疏专家混合(mixture-of-experts)模型:总参数量为 3100 亿,推理时激活 150 亿参数;相比之下,Pro 版本总参数量为 1.02 万亿,推理时激活 420 亿参数。两者均支持 100 万 token 的上下文窗口、多模态输入,以及最多 128,000 个输出 token。

Flash在小米多项代理基准测试中表现意外地接近Pro:在DeepSWE v1.1上得分为67.9,低于Pro的71.9;在AutomationBench上为52.3,低于Pro的53.1;在MiMo Code Bench上为61.2,低于Pro的63.2;在Terminal Bench 2.1上为87.6,低于Pro的89.9;在JobBench上为61.2,低于Pro的62.0;在MiMo Visual Coding上为71.5,低于Pro的72.3。

在CyberGym上,Flash实际以95.1分超越Pro的94.0分,但这一结果不应被解读为Flash整体上是更强的网络安全模型:Pro在ExploitGym、ExploitBench和SEC Bench Pro上大幅领先。

然而,两者的价格差距显著。小米对Flash收取每百万未缓存输入token 0.14美元、每百万输出token 0.28美元的费用,而缓存命中(cache-hit)输入则降至每百万token 0.0028美元。Pro的费用为每百万未缓存输入token 0.435美元、每百万输出token 0.87美元,缓存命中时为每百万token 0.0036美元。

VentureBeat前沿模型每百万token API成本对比表快照——2026年末

模型

输入(美元/百万)

输出(美元/百万)

总计(美元/百万)

来源

0.10美元

0.20美元

0.30美元

Meta

MiMo-V2.6-Flash

0.14美元

0.28美元

0.42美元

小米

DeepSeek-V4.1-Flash — 非高峰时段

0.15美元

0.60美元

0.75美元

DeepSeek

MiMo-V2.6-Pro

0.435美元

0.87美元

1.305美元

小米

GPT-5.6 Luna

0.20美元

1.20美元

1.40美元

OpenAI

MiniMax-M3

0.30美元

1.20美元

1.50美元

MiniMax

LongCat-2.0 — 限时促销

0.30美元

1.20美元

1.50美元

LongCat

DeepSeek-V4.1-Flash — 高峰时段

0.30美元

1.20美元

1.50美元

DeepSeek

DeepSeek-V4-Pro — 非高峰时段

0.66美元

1.98美元

2.64美元

DeepSeek

LongCat-2.0 — 标准版

0.75美元

2.95美元

3.70美元

LongCat

Gemini 3.7 Flash — 至2026年12月31日

0.75美元

3.75美元

4.50美元

Google

Gemini 3.8 Flash — 至2026年12月31日

0.75美元

3.75美元

4.50美元

Google

DeepSeek-V4-Pro — 高峰时段

1.32美元

3.96美元

5.28美元

DeepSeek

Muse Spark 1.1 / 1.2 / 1.3

1.25美元

4.25美元

5.50美元

Meta

GLM-5.3

1.40美元

4.40美元

5.80美元

Z.AI

Grok 4.7 — 输入提示词数 ≤200K

2.00美元

6.00美元

8.00美元

xAI

Qwen3.8-Max

2.00美元

6.00美元

8.00美元

QwenCloud

Gemini 3.7 Flash — 自2027年1月1日起

1.50美元

7.50美元

9.00美元

Google

Gemini 3.8 Flash — 自2027年1月1日起生效

1.50美元

7.50美元

9.00美元

Google

GPT-5.6 Terra

2.00美元

12.00美元

14.00美元

OpenAI

Grok 4.7 — 超过20万提示词(prompt tokens)

4.00美元

12.00美元

16.00美元

xAI

Grok 4.7 Fast(Cursor)—— 输入长度不超过256K

4.00美元

12.00美元

16.00美元

Cursor

GPT-5.4

2.50美元

15.00美元

17.50美元

OpenAI

Kimi K3

3.00美元

15.00美元

18.00美元

Moonshot AI

Grok 4.7 Fast(Cursor)—— 输入长度超过256K,最高达500K

6.00美元

18.00美元

24.00美元

Cursor

Claude Opus 5

5.00美元

25.00美元

30.00美元

Anthropic

Sakana Fugu Ultra(输入长度不超过272K)

5.00美元

30.00美元

35.00美元

Sakana AI

GPT-5.6 Sol — 标准模式

5.00 美元

30.00 美元

35.00 美元

OpenAI

Claude Fable 5 / Claude Mythos 5

10.00 美元

50.00 美元

60.00 美元

Anthropic

Claude Fable 5.1 / Claude Mythos 5.1

10.00 美元

50.00 美元

60.00 美元

Anthropic

GPT-6 Astra — 标准模式

10.00 美元

50.00 美元

60.00 美元

OpenAI

GPT-5.6 Sol — 快速模式

10.00 美元

60.00 美元

70.00 美元

OpenAI

GPT-6 Astra — 快速模式

20.00 美元

100.00 美元

120.00 美元

OpenAI

这意味着 Flash 在未缓存的输入和输出场景下,成本约为 Pro 的三分之一,同时在小米多项长周期智能体基准测试中仅落后 Pro 几分。

对于一家公司可能启动数千次或数百万次智能体运行的工作负载——例如编程助手、文档处理系统、内部研究智能体或自动化后台办公工作流——这种成本差异可能比微小的基准测试差距更为重要。

正如 蒂姆·德特默斯(Tim Dettmers)所言,他是卡内基梅隆大学计算机科学教授、艾伦人工智能研究所(Ai2)研究员,也是大语言模型量化技术 bitsandbytes 的创造者 bitsandbytes 在 X 平台上发文称:“Flash 模型给人的感觉确实很好,仿佛是 3000 亿至 5500 亿参数级别中最佳的模型。优于 DeepSeek v4.1 和 GLM 5.3 Flash……”

小米将 Flash 描述为其面向‘高频调用与大规模任务’的模型,这一市场定位十分合理。V2.6 版本的技术亮点不仅在于其万亿参数的 Pro 模型登顶了开源权重排行榜,更在于小米似乎已将相当一部分相同的智能体能力迁移至一个成本更低、仅含 150 亿活跃参数的模型中。

对开发者而言,定价改变了其与专有前沿模型的实际对比关系。只要模型足以胜任特定工作负载,且运行成本显著更低——尤其是对单次任务可能消耗数十万乃至数百万 token 的智能体而言——它便无需在每一项基准测试中都胜出。

人工智能分析公司(Artificial Analysis)的价格-性能图表反映了这一点:MiMo-V2.6-Pro 位于其智能度-成本帕累托前沿图 左上象限正中央,恰好处于低成本与高性能之间的理想平衡点,进一步印证了小米的观点,即 V2.6 并非单纯追逐基准测试领先地位,而是致力于最大化每美元投入所能获得的实用能力。

OpenCode 迅速抓住了这一经济性优势, 并在 X 平台上宣布 MiMo-V2.6-Flash 将免费开放一周,且 Flash 与 Pro 两个版本亦同步上线其 Go 服务。

从‘氛围编程(vibe coding)’到‘氛围世界(Vibe World)’

小米演示了 MiMo 如何接收文本、图像或视频输入,并协调多个智能体共同创建可交互的 3D 世界、构建场景、实现交互逻辑、检查渲染结果并迭代优化最终输出。

其他演示还包括生成 Blender 物体与场景、操作桌面软件,以及通过视觉反馈控制模拟的 Franka Panda 机械臂。

该模型还适用于前端设计、Figma、演示文稿、SVG、视频制作和音乐创作等领域。

小米自家的 Pro 模型页面将这些能力定位为专业工作流功能,而非新奇演示,并将编程、办公事务、设计、研究、内容创作、网络安全及计算机操作列为该模型的目标应用领域。

两项研究案例研究进一步拓展了这一理念。在第一项中,小米的材料研究人员使用 MiMo-V2.6-Pro 审阅科学文献与专利,提出用于捕获 PFAS(“永久性化学物质”)的金属有机框架(MOF),运行计算模拟,并筛选出若干候选结构以供可能的湿实验验证。

在另一项研究中,该模型协助研究人员将李天岩(Li)与约克(Yorke)提出的 《周期三意味着混沌》(Period Three Implies Chaos) 中的主定理形式化为 Lean 4。小米表示,最终项目产出超过 6,000 行 Lean 源代码,并经 Lean 内核验证通过,且未留下任何未完成证明的占位符。

这些演示不应被误认为是该模型可自主开展可靠科学研究的证据。但它们指明了小米正为之优化的工作负载类型:即融合推理、软件、工具、感知与反复检验的长期项目,而非单次提示与响应。

小米开源的不仅限于模型权重

此次发布中最不寻常的部分,或许是小米随模型一同公开的内容。

该公司发布了 Pro 与 Flash 模型权重、技术报告、逾 7,000 个强化学习(RL)任务环境、端到端 RL 框架、可组合的微型测试套件(mini-harnesses),以及 MiMo-V2.6-Distill-Qwen-9B——一个由 MiMo RL 轨迹蒸馏而得的更小规模模型。

这已远不止是一次常规的模型权重发布。技术报告用数十页篇幅详述了环境生成、评分器构建、防奖励黑客(reward-hacking)机制、异步 rollout 基础设施,以及在同一训练轮次中混合不同智能体任务的机制。小米表示,其目标是向其他研究人员提供足够完整的整套技术栈,以便复现并拓展该工作。

对开源模型社区而言,此举的实际影响或许远超 MiMo-Pro 是否能在 Artificial Analysis 综合智能基准测试中保持数周或数月的榜首位置。倘若外部团队能在更小规模模型上复现小米部分 RL 性能提升,此次发布或将提供一份实用蓝图,指导如何在不从零训练另一个万亿参数基础模型的前提下,切实改进智能体行为。

来自小米日益完备的 AI 技术栈的更强有力挑战

更大的趋势已愈发难以忽视。小米始于基础模型,继而加入长视野编码智能体,再推进至自适应测试套件(harnesses),如今又公开了连接上述各组件的大量强化学习基础设施。

该公司尚未在所有基准测试中胜出,且许多智能体评估仍由厂商自行开展。此外,尽管每次生成 token 时仅激活其参数的一小部分,该万亿参数级 Pro 模型仍是一个需大量资源方可本地部署的庞大系统。

但这些局限性与一种新现实并存:小米当前拥有 Artificial Analysis 综合智能基准测试中排名最高的开源权重模型;其更小的 Flash 模型在若干智能体任务上已接近 Pro 模型表现,而 API 成本仅为后者的约三分之一;公司采用宽松许可策略;且其开源训练基础设施正持续扩充。

因此,对企业 AI 团队而言,当务之急并非判断 MiMo-V2.6 是否在所有方面均绝对优于每一款专有前沿模型——事实并非如此。

更实际的问题在于:一款可下载模型若能在关键工作负载上达到足够接近的性能水平——Pro 版本每百万输出 token 成本为 0.87 美元,Flash 版本仅为 0.28 美元——是否足以在企业智能体技术栈的至少一部分中,替代成本更高的专有模型?

借助 MiMo-V2.6,小米已为开发者提供了更充分的理由来开展此项评估。

JOTO 企业落地观察

  • 对企业部署而言,MiMo-V2.6-Flash以每百万输出token 0.28美元的成本,在DeepSWE、AutomationBench等长周期任务中达Pro版94%–97%性能,意味着企业可将高吞吐智能体工作流(如编程助手、文档处理)从Claude Opus或GPT-5.6等高价闭源API迁移至可下载、可私有化部署的开源模型,显著降低TCO。
  • 对智能体工程而言,小米首次公开端到端异步GRPO强化学习框架、7000+可复用RL任务环境及‘微型框架’(mini-harnesses),使开发者无需重训万亿参数模型即可在中小规模模型上复现其智能体行为优化路径,为构建稳定、可审计的生产级智能体提供了可落地的技术栈参考。
  • 对AI安全治理而言,小米系统性披露奖励黑客检测机制——包括冻结MoE路由器、部署独立‘黑客智能体’、屏蔽网络与Git历史访问,并将确认的黑客轨迹奖励置零,其<2%的残余率与在线组级评分(GRS/GAR)设计,为防范智能体绕过任务本质而‘作弊式达标’提供了可量化的工程实践范本。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.