Meta 发布 Muse Code 与 Muse Spark 1.2:以持久化后台智能体入局 AI 编程竞争
Meta 推出终端级 AI 编码智能体 Muse Code 及专用于编码的 Muse Spark 1.2 模型,主打异步后台智能体、本地可审计日志与双层级 API 定价(含数据换折扣的贡献者 tier),正式进军企业级编程智能体赛道。

Meta 今日 发布了 Muse Code,一款基于终端的 AI 编码智能体,目前处于测试阶段;同时发布的还有 Muse Spark 1.2,这是其 Muse Spark 前沿模型系列面向编码任务的更新版本——这一组合拳使该公司直接与 Anthropic 的 Claude Code、OpenAI 的 Codex,以及迅速崛起并已成为许多专业开发者交付软件主要方式的各类智能体式编码工具展开竞争。
“今日以测试版形式发布 Muse Code,”Meta 联合创始人兼首席执行官马克·扎克伯格(Mark Zuckerberg)在竞争对手社交网络 X 上发帖称 (使用其长期沿用的用户名 @finkd)。 “它是一款终端编码智能体,可在大型代码仓库中承担完整的软件工程任务:规划变更、编写代码、验证结果。”
此次发布标志着 Meta 迄今为止最认真地进军一个此前 largely 在场边观望的领域。
尽管 Anthropic 和 OpenAI 将其编码智能体打造为旗舰产品,而 Cursor 等初创公司则依托该工作流建立起数十亿美元规模的业务,Meta 长期以来的开发者叙事却始终围绕 Llama 展开——这是一套开源权重模型家族,Meta 已免费分发逾十亿次下载。
Muse Code 在多个层面改变了这一局面:它是一个完整工具套件,可通过单条 curl 命令安装于 macOS 或 Linux 系统,且与其驱动模型联合训练;此外,与支撑它的 Muse Spark 模型一样,该工具套件完全专有。
不过,扎克伯格在 X 上回应一则提问时暗示 ,Muse Spark 或许另有某款产品可能走向开源,并表示:“我很快将就此分享更多信息。”

截图来源:VentureBeat
开发者及潜在用户现可通过以下单行命令在终端中安装该工具——但请注意,若您尝试安装,则需首先使用 Meta 账户登录并提供账单信息,方可启动: curl -fsSL https://dev.meta.ai/install.sh | bash
持久化后台智能体与并行工作树
Muse Code 的核心架构押注是 Meta 所称的 异步后台智能体。
不同于大多数竞品工具为每项任务新建辅助智能体的做法,Muse Code 在整个会话期间持续维持一组 专用后台智能体处于活跃状态。
据 Meta 博客文章所述,这些智能体“在整个会话期间保持活跃,而非为单个任务临时生成,有助于避免重复的信息收集”,可自主执行后续步骤,并自行决定何时向主智能体汇报。
其实际价值在于更低延迟与更少人工干预:一个已熟悉代码仓库的智能体无需每次开发者提出新需求时都重新探索该仓库。
当任务足够庞大时,Muse Code 会分散至多个并行运行的子智能体,每个子智能体均在各自隔离的 git 工作树(worktree)中运行,从而确保开发者的本地工作副本永不被修改。
“在测试中,我们让它同时构建一款游戏的六个功能,全程无冲突。”扎克伯格在 X 上写道。
工作树隔离与并行子智能体在竞品工具中已有存在,但 Meta 正倚赖“持久性+并行性”的组合来形成差异化优势。
第二项显著设计选择是可审计性。每次模型调用、工具运行、审批操作及编辑操作均会在执行前追加至一份 本地事件日志 中——Meta 称该单一可信数据源可使运行时环境“精确重放且重启安全”。
若 Muse Code 在一项长时间运行的任务进行 20 小时后崩溃,它将精准恢复至中断点,无任何工作丢失,亦无需重新提示。对于曾因不透明的智能体运行而遭受挫折的工程负责人而言,一份完整的本地审计追踪记录,或将成为企业评估中最关键的功能。
Muse Code 还预装了若干“技能”,对竞品工具用户而言应颇为熟悉: /plan 将任务转化为需经审批的计划, /grill 对该计划进行压力测试直至其稳固可靠, /goal 推动智能体完成既定目标。
Muse Spark 1.2:与其专属工具套件联合训练
其底层为 Muse Spark 1.2,Meta 将其描述为面向编码任务的 Muse Spark 1.1 更新版本,具备“针对编码任务大幅增加的训练算力”及更广泛的训练环境多样性,在提升代码生成、复杂调试和代码库理解能力的同时,维持通用智能体能力。
此次更新直击 Muse 系列最薄弱的环节。今年 4 月 初代 Muse Spark 首次亮相时,使其在前沿推理与视觉基准测试中跃居全球前五;但在本市场最为关注的智能体式编码评测中表现落后,在 SWE-Bench Verified 测试中得分为 77.4,低于 Claude Opus 4.6 的 80.8 及 Gemini 3.1 Pro 的 80.6,且在 GDPval 对长周期工作任务的衡量指标上远逊于 GPT-5.4。
四个月后,一款专精编码的检查点(checkpoint)搭配定制化工具套件,成为 Meta 对上述差距的直接回应。
两项训练细节尤为突出。首先,Meta 将该模型与 Muse Code 自身联合训练,采用拒绝采样(rejection-sampled)的工具套件轨迹及针对目标、上下文压缩与子智能体的配方优化——这意味着该模型明确针对在此特定工具内实现最优性能而调优。此举呼应了行业整体趋势:不再将模型与工具套件视为可分离的产品。
其次,Meta 使用了自改进循环(self-improvement loop):Muse Spark 1.1 生成具挑战性的编码环境及指令遵循模板,随后依据这些要求对候选解决方案进行评分,从而为继任者构建可扩展的训练数据集。Meta 将此循环归功于 Muse Spark 1.2 在遵循复杂指令方面取得的可测量提升。
Meta 发布了基准测试图表,将 Muse Spark 1.2 与其他编码模型在 Terminal-Bench 2.1、DeepSWE 1.1 及 Meta 内部编码基准测试中的表现进行对比,并指引读者参阅单独的方法论报告获取详情——尽管公告正文本身未宣称任何排名,这在竞相高调宣传排行榜胜绩的领域实属罕见。图表解释了原因:结果显示其稳居强劲但明确的第二位。

Meta Spark 1.2 基准测试对比图表。图片来源:马克·扎克伯格/Meta
在 Terminal-Bench 2.1 测试中,运行于 Muse Code 中的 Muse Spark 1.2 得分为 82.9%,略高于 OpenAI 的 GPT-5.6 Terra(Codex 版本,81.8%)及 xAI 的 Grok 4.5(Grok Build 版本,81.6%),但落后于 Anthropic 的 Opus 5(Claude Code 版本,全力运行下领先达 86.7%)。
在 DeepSWE 1.1 测试中,Muse Spark 1.2 得分为 59.3%——位列第三,落后于 Opus 5(65.0%)及 GPT-5.6 Terra(64.8%)。最引人注目的是 Meta 自有的内部编码基准测试,其中 Muse Spark 1.2 的 70.6% 显著优于 GPT-5.6 Terra(65.4%)及 Gemini 3.6 Flash(63.9%),但仍比 Opus 5 的 79.4% 低近九个百分点——这异常坦率地承认:即便在 Meta 自行设计的测试中,Anthropic 的模型仍胜出。事实上,Claude 在全部三项图表中均位居榜首。
代际提升确凿无疑:Muse Spark 1.2 在 Terminal-Bench 上较 1.1 提升 6.7 分,在 DeepSWE 上提升 6.3 分。图表标签中一处隐含说明指出:1.1 的分数是在通用 mini-swe-agent 工具套件中测得,而 1.2 则运行于 Muse Code 中,因此部分提升应归功于新工具套件而非新模型。
该公司最引人注目的演示是一个长周期案例研究:Meta 将 Muse Spark 1.2 应用于 GPU 内核优化,并在 NVIDIA Hopper 硬件上持续运行超过 24 小时,调用工具逾 1,000 次。
该智能体在 Triton 环境中工作,且被禁止直接封装现有第三方内核库;它自行编写、编译并剖析代码,最终实现了 Meta 所称的对 KDA 和 MLA 内核基准实现的“显著改进”——其中包括真正非显而易见的优化,例如将门控累积衰减(gated cumulative decay)重新居中于数据块中点。
扎克伯格写道:“它在初始探索阶段之后持续发现显著改进。”若这一长达 24 小时的自主运行所实现的持续改进能在 Meta 的演示之外得到验证,将回应针对编程智能体最持久的批评之一:即它们在初始快速进步之后便趋于停滞或偏离目标。
您的数据换折扣?
定价结构可能是此次发布中最关键——也最受审视——的部分。Meta 通过其 Meta Model API 以两个层级提供 Muse Spark 1.2。
其中, 标准层级 定价为每百万输入 token 1.25 美元、每百万输出 token 4.25 美元(缓存输入为每百万 0.15 美元),且 Meta 承诺该层级上的提示词(prompts)与补全结果(completions)不会用于训练其模型。该层级不设长上下文溢价,速率限制为每团队每分钟 3,000 次请求及 400 万 token。与其他可通过 API 获取的主流 AI 模型相比,其价格处于中等水平。
而 贡献者层级 则体现了 Meta 与其竞争对手截然不同的战略:每百万输入 token 仅 0.10 美元、每百万输出 token 仅 0.20 美元——分别约为标准层级价格的 1/12 和 1/21,缓存输入成本近乎免费,仅为每百万 0.002 美元——但需明确授权 Meta 将您的提示词与补全结果用于训练未来 Meta 模型。这是目前市场上最便宜的选项,但您付出的代价是您的数据——如下文所述。
模型 | 输入(美元/百万) | 输出(美元/百万) | 总计(美元/百万) | 来源 |
Muse Spark 1.2 贡献者 | 0.10 美元 | 0.20 美元 | 0.30 美元 | |
MiMo-V2.5 Flash | 0.10 美元 | 0.30 美元 | 0.40 美元 | |
deepseek-v4-flash | 0.14 美元 | 0.28 美元 | 0.42 美元 | |
deepseek-v4-pro | 0.435 美元 | 0.87 美元 | 1.305 美元 | |
GPT-5.6 Luna | 0.20 美元 | 1.20 美元 | 1.40 美元 | |
MiniMax-M3 | 0.30 美元 | 1.20 美元 | 1.50 美元 | |
LongCat-2.0 — 限时促销 | $0.30 | $1.20 | $1.50 | |
Gemini 3.1 Flash-Lite | $0.25 | $1.50 | $1.75 | |
MiMo-V2.5 | $0.40 | $2.00 | $2.40 | |
Gemini 3.5 Flash-Lite | $0.30 | $2.50 | $2.80 | |
LongCat-2.0 — 标准版 | $0.75 | $2.95 | $3.70 | |
MiMo-V2.5 Pro(≤256K) | $1.00 | $3.00 | $4.00 | |
Muse Spark 1.1 / 1.2 | $1.25 | $4.25 | $5.50 | |
GLM-5.2 | $1.40 | $4.40 | $5.80 | |
Grok 4.5 | $2.00 | $6.00 | $8.00 | |
MiMo-V2.5 Pro(>256K) | $2.00 | $6.00 | 8.00美元 | |
Qwen3.8-Max | 2.00美元 | 6.00美元 | 8.00美元 | |
Gemini 3.6 Flash | 1.50美元 | 7.50美元 | 9.00美元 | |
Gemini 3.5 Flash | 1.50美元 | 9.00美元 | 10.50美元 | |
Gemini 3.1 Pro Preview(≤200K) | 2.00美元 | 12.00美元 | 14.00美元 | |
GPT-5.6 Terra | 2.00美元 | 12.00美元 | 14.00美元 | |
GPT-5.4 | 2.50美元 | 15.00美元 | 17.50美元 | |
Kimi K3 | 3.00美元 | 15.00美元 | 18.00美元 | |
Gemini 3.1 Pro Preview(>200K) | 4.00美元 | 18.00美元 | 22.00美元 | |
Claude Opus 5 | 5.00美元 | 25.00美元 | 30.00美元 | |
GPT-5.5 | 5.00美元 | 30.00美元 | 35.00美元 | |
GPT-5.5 Instant(chat-latest) | 5.00美元 | 30.00美元 | 35.00美元 | |
Sakana Fugu Ultra(≤272K) | 5.00美元 | 30.00美元 | 35.00美元 | |
GPT-5.6 Sol — 标准模式 | 5.00美元 | 30.00美元 | 35.00美元 | |
Claude Fable 5 / Claude Mythos 5 | 10.00美元 | 50.00美元 | 60.00美元 | |
GPT-5.6 Sol — 快速模式 | 10.00美元 | 60.00美元 | 70.00美元 |
这是扎克伯格正引导新用户加入的层级:他写道:“入门简单且成本低廉。只需一行命令安装 Muse Code,即可开始使用我们的贡献者层级。”
VentureBeat 在 Mac mini 上自行测试时,该单行安装程序如宣传所示正常运行——下载大小为 97 MB,并需登录——但代理在执行任何操作前即中止,报告称“未发现任何模型”,且付款“是完成账户设置所必需的。”
换言之,即使大幅折扣后的贡献者层级,也要求用户预先登记付款方式,Muse Code 才会执行任何任务:“低成本”准确无误,但并非“免费”。
Meta 将贡献者层级定位为降低原型设计与实验门槛的方案,“前提是允许在您的数据上进行训练。”
但这同时也意味着 Muse Code 的默认入门路径会将开发者的代码和提示输入 Meta 的训练管道——对于拥有专有代码库的企业而言,若要避免这一权衡,必须主动选择标准定价方案。
贡献者层级还设置了更为严格的速率限制(每分钟 60 次请求,而标准层级为每分钟 3,000 次),这明确表明其目标用户为个人开发者及小型实验,而非生产级工作负载。
这种做法具有典型的 Meta 风格:补贴访问权限、大规模采集数据,并利用这些数据缩小与前沿水平的差距。扎克伯格毫不掩饰这一雄心,将 Muse Spark 1.2 称为“我们迈向前沿的下一步,更大、更强大的模型即将到来。”
然而,对于需要或依法必须确保其代码安全的开发者与企业而言,这一权衡可能并非他们愿意或能够接受的。
不见 Llama 踪影
今日公告中明显缺失的是对开源的任何提及——这对于一家曾耗时三年将自身塑造为开放人工智能(open AI)旗手的公司而言,是一项引人注目的疏漏。
从 2023 年 2 月初代 LLaMA 发布起——其权重参数曾在数周内被泄露至 4chan,意外开启了在消费级硬件上运行高性能模型的运动——到具备商用许可的 Llama 2、专注于编程的 Code Llama,以及扎克伯格于 2024 年 7 月发布的参数量达 4050 亿的 Llama 3.1(发布时附有一篇题为《开源人工智能是前进之路》的宣言),Meta 向开发者传递的核心信息始终是:前沿级权重参数应可免费下载、自主托管并微调。
该策略奏效了:截至 2026 年初,Llama 系列已被 下载约 12 亿次,日均下载量约为 100 万次;自主托管为企业带来的成本削减幅度,VentureBeat 此前报道高达相较专有 API 供应商的 88%。
随后局势急转直下。Llama 4 于 2025 年 4 月发布, 评价褒贬不一 ,最终承认其基准测试结果存在造假;与此同时,来自深度求索(DeepSeek)、阿里巴巴(Alibaba)和智谱 AI(Zhipu AI)的中国开源权重模型竞争对手,在 2025 年底已占据 Hugging Face 下载量的约 41%,削弱了 Llama 对其亲手开创的这场运动的领导地位。此次坎坷的发布促使扎克伯格于 2025 年夏季对 Meta 的人工智能业务进行重组,成立 Meta 超级智能实验室(Meta Superintelligence Labs,MSL),并聘请 Scale AI 联合创始人亚历山大·王(Alexandr Wang)出任首席人工智能官。
Llama 时代实际上已于今年4月8日结束,当时 MSL 推出了初代 Muse Spark ——用王长平的话说,这是 Meta 发布过的“最强大的模型”——作为 Meta 的首款专有模型: 仅限云端运行,不提供可下载的权重文件,也不支持自托管,最初仅限于 Meta 自家应用及私有 API 预览版。
当时被直接问及 Llama 开发是否会继续时,Meta 发言人仅向 VentureBeat 表示:“我们当前的 Llama 模型将继续以开源形式提供”——但对未来的版本却刻意保持沉默。
王长平本人则表示 更大规模的模型已在开发中,“并计划将未来版本开源” ——但四个月过去,今日发布的版本却丝毫未推进这一承诺:既无权重文件,亦无许可证,且无论是官方博客文章还是扎克伯格的帖子,甚至一次都未使用“开源”(open)一词。
这一转向尤为鲜明,因为 Meta 的竞争对手正朝相反方向迈进。OpenAI 将其 Codex CLI 作为开源软件发布 ,采用宽松、对企业友好的 Apache 2.0 许可证,并随后推出其 gpt-oss 开源权重模型;谷歌的 Gemini CLI 工具包同样采用 Apache 许可证。
借助 Muse Code,Meta 的立场最接近 Anthropic——后者的 Claude Code 仍为专有软件;而这家曾主张开源是前进之路的公司,如今却要求开发者为一个无法审查的模型按 token 付费,或以其自身数据补贴该访问权限。
但 扎克伯格在 X 平台上的回复 ——AI 开发者 Luckey Farady 直接提问:“Muse Code 会开源吗?”他回应道:“我很快会就此分享更多信息”——仍为 Meta 回归开源 AI 赛道保留了一线希望。
此事为何重要
终端编码智能体(terminal coding agents)已成为企业级 AI 中增长最快的落地场景,而截至今日,该领域实质上一直由 Anthropic 和 OpenAI 两家主导,谷歌及一大批初创公司紧随其后。
Meta 的入局带来了真正不同的架构(持久化后台智能体、仅追加写入的本地事件日志)、一项可信的长周期演示,以及极具侵略性的定价策略。
有待解答的开放性问题,恰恰是基准测试图表无法回答的:Muse Spark 1.2 在真实代码仓库中是否真能匹敌 Claude 和 GPT 级别模型;开发者是否愿意将自身代码托付给 Meta;以及贡献者层级所提供的折扣是否足以令他们停止追问。Muse Code 今日起进入测试阶段;Muse Spark 1.2 已上线 Meta Model API,并扩大全球访问范围。
JOTO 企业落地观察
- 对企业部署而言,Muse Code 的‘贡献者层级’要求开发者授权 Meta 使用其提示与代码训练模型,意味着企业若选择低价路径,将面临代码资产外泄与合规风险;必须主动切换至标准 tier 并承担 18 倍以上 token 成本,这对金融、医疗等强监管行业构成实质性准入门槛。
- 对智能体工程而言,Muse Code 首次将‘持久化后台智能体’与‘并行 git worktree’深度耦合,使智能体在长周期任务中保持上下文连续性并避免本地污染,该架构设计为构建高可靠性工程智能体提供了可复用的工程范式,而非仅依赖单次调用优化。
- 对 AI 安全治理而言,其本地仅追加写入的事件日志机制支持精确重放与崩溃恢复,填补了当前智能体运行过程不可审计、不可追溯的关键缺口;但该日志仅限本地存储且未开放格式规范,企业无法将其接入 SIEM 或合规审计系统,实际治理能力受限于 Meta 的封闭工具链。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


