Kimi K3 硬核开源,技术报告都说了啥
月之暗面开源Kimi K3完整权重,2.8万亿参数之外,技术报告揭秘Agent长任务连贯运行的关键设计。 核心内容: 1. Kimi K3参数规模与存储细节(2.8T总参数、1040亿激活参数、96个Safetensors分片及1.56TB仓库) 2. 百万token上下文处理机制(KDA与Gated MLA结合的“记忆”设计) 3. 深层网络连贯性与混合专家架构(Block Attention Residuals解决层间信息传递,896路由专家及token选择逻辑)

昨晚 11 点,月之暗面正式开放 Kimi K3 完整权重,技术报告也同步公开。2.8 万亿总参数、1040 亿激活参数、96 个 Safetensors 分片,整个仓库 1.56 TB,Kimi K3 这次真的亮了。
这组数字很容易让人先想到部署,不过对于绝大多数开发者来说,这个念头还是得放下,先看看技术报告比较合适。

我看完最大的感受是,K3 没有只讲怎么把模型做得更大。它花了相当多的篇幅回答一个更麻烦的问题:怎样让 Agent 连续干几千步,中途还能记得自己在做什么,也不至于靠钻评分器空子拿到一个假高分。
2.8T 负责制造规模感,怎么让 Agent 干长活不散架,才是这份报告最有意思的部分。
百万上下文很长,K3 给它配了两种“记忆”
K3 支持 1,048,576 token 上下文。这个数字已经大到容易让人失去概念,于是先看它是怎么练出来的:预训练阶段从 8K 逐步拉到 64K,cooldown 阶段再从 256K 拉到 1M。

窗口拉长以后,另一个问题马上出现:前面一百万 token 的东西,总不能每一步都从头翻一遍。
K3 的主干采用“三层 KDA 加一层 Gated MLA”的循环结构,最后再补一个全局注意力层。
可以把 KDA 理解成工作台上的便签。它维护一个固定大小的循环状态,负责随手更新当前最需要的信息,成本不会随着历史无限膨胀。
MLA 更像档案室。它不需要每一层都出现,但会周期性保留全局内容交互,让模型有机会回头查更完整的上下文。三层 KDA 处理手边事务,一层 MLA 翻一次总账,最后再做一次全局检查。
这个比喻只负责帮助理解。技术上,它们对应的是固定大小循环状态与全局注意力交互的组合。
网络堆到 93 层,也会遇到“传话传丢”
K3 一共有 93 层,其中 69 层是 KDA,24 层是 Gated MLA。
网络变深以后,信息不只会在时间轴上变远,也会在模型层与层之间变远。某个早期层提取出来的关键表示,传到几十层以后,可能已经被反复加工得面目全非。
所以 K3 又加了 Block Attention Residuals。
普通残差连接更像把上一棒直接递给下一棒;Block AttnRes 允许当前层回头挑选更早深度块里的表示。K3 把网络划成 8 个十二层块,再加一个不完整的末尾块,让后面的层不必永远依赖“上一层转述”。
它和上下文窗口分工不同:窗口决定能装下多少历史,Block AttnRes 负责让深层网络方便地找回前面已经算出的东西。
896 个专家开会,每个 token 只叫 16 个
K3 是一个混合专家模型,共有 896 个路由专家。每处理一个 token,只选择其中 16 个,再加上两个共享专家。
这就是 2.8T 总参数与 104B 激活参数同时成立的原因:公司很大,真正参加这次会议的人只有一部分。
K3 还对专家权重使用 MXFP4、对激活使用 MXFP8,并配合量化感知训练。报告给出的约 2.5 倍 scaling efficiency,也是依据拟合的 scaling-law 曲线得出的。
这里千万别把“2.5 倍”顺手写成“推理快了 2.5 倍”。两者不是一回事。
而且“每次只激活 104B”也不代表部署时只需要装下 104B。完整稀疏权重仍然要存储和分发,1.56 TB 的仓库体积就摆在那里。
九个“老师”,最后教出一个 K3
架构解决了信息怎么流动,后训练才开始回答 Agent 怎么干活。

K3 的后训练包含 SFT、强化学习和 Multi-Teacher On-Policy Distillation。Moonshot 把任务分成三个领域:
通用任务 通用 Agent 编码 Agent
每个领域再分 low、high、max 三档推理强度。三乘三,一共得到九个 expert teachers,最后再把这些教师的能力整合回同一个模型。
这套设计挺像先找九位专项教练:有人带基础体能,有人练工具使用,有人专门盯代码;训练结束后,再把九套经验交给同一个选手。
更有意思的是训练环境。报告描述了一套统一的白盒强化学习环境,会主动改变工具接口、提示词、上下文管理、技能、记忆和 Agent harness。
原因并不玄学。一个 Agent 如果只在固定工具和固定提示词里拿高分,很可能只是背熟了考场,而不是学会了解题。
Agent 最怕的,是学会“骗分”
长程任务有一个老问题:过程越长,标准答案越难写。

K3 使用 Autonomous Execution Tasks,也就是 AET。系统只提供目标、工具、预算和独立验证器,不给模型一条现成的参考轨迹。Agent 可以自己找路径,最后看结果是否真的完成。
可一旦验证器完全公开,模型又可能学会迎合评分规则。于是报告里还加入了隐藏验证器和有限提交预算,用来防范 reward hacking。
这和写代码时只跑自己写的测试很像。测试全绿不一定代表修对了,也可能只是出题的人和答题的人共享了同一个盲区。隐藏验证器的价值,就是再补一双没有参与写答案的眼睛。
长任务还得有地方活着。AgentENV 使用可恢复的 Firecracker microVM 沙箱,支持暂停、恢复、分叉和快照。报告描述的长程个人助理轨迹,可以跨越数个模拟日、数千次工具调用和数百万上下文 token。
教师模型负责教能力,变化的 harness 负责换考场,AET 负责验收结果,AgentENV 负责让任务别在半路断电。到这里,K3 的 Agent 训练链路才算连起来。
需要说明的是:目前公开的是完整模型权重和技术报告。报告详细描述了 AgentENV 与强化学习环境,不等于这些训练基础设施也已经随权重一起开源。
成绩很好看,先把评测条件一起记下来
编码、通用 Agent 和视觉 Agent 结果都很亮眼,可以直接看到各项数据。


但横向比较时,至少要把两个条件一起带上:K3 的评测使用 max reasoning effort,temperature 为 1.0。Agent 任务又会受到工具、上下文管理和 harness 的明显影响。
所以这些图适合回答“K3 在官方设定下做到了什么”,暂时不适合被压缩成一句“全面超过谁”。
这并不削弱报告的价值。恰恰相反,完整的架构、后训练和评测条件一起公开,才有机会判断数字是怎么来的。
最后
Kimi K3 这次正式开源,最直接的意义当然是权重终于能下载了。
但对大多数读者来说,更有用的东西可能藏在技术报告里:长上下文不只是把窗口拉长,深层网络还要能找回早期表示;Agent 不只是会调用工具,还要有可恢复的执行环境、独立验证器和不那么容易被钻空子的考场。
这套思路未必只能用在 K3 上。
以后再看一个 Agent 模型,可以多问四个问题:它怎么保存长任务状态?怎么跨层找回信息?训练时怎样更换工具和环境?最后又由谁来证明任务真的完成了?
这四个问题,比再背一遍参数量更有用。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


