Meta发布Muse Spark 1.3:前沿性能受限于未开放的max配置,企业部署仍聚焦xhigh
Meta推出Muse Spark 1.3,在编程与智能体任务中显著提升,但最佳基准成绩来自尚未开放API的max配置;当前广泛可用的xhigh版本性价比高、成本可控,却非绝对前沿。开放权重计划仍模糊,企业需权衡性能、成本与可控性。

Meta最新的人工智能模型Muse Spark 1.3, 于昨日发布,在第三方基准测试中比其前代版本运行更快、性能更强——但存在一个限制条件。
“Muse Spark 1.3今日起全面推出,其前沿性能几乎廉价到无法计量,” Meta联合创始人兼首席执行官马克·扎克伯格(Mark Zuckerberg)在X平台发文称, 并称其为Meta迄今在编程与智能体(agentic)工作领域取得的“最大飞跃”。
该主张的两部分均有实质依据。Muse Spark 1.3相较于上月发布的1.2版本取得了显著进步, 尤其在长时间运行的智能体任务方面。开发者当前可访问的版本,也是独立模型排行榜顶端附近最具性价比的模型之一。目前可供广泛部署的版本亦属此列。
Meta最强的Muse Spark 1.3基准测试结果来自其max推理配置。Meta表示该版本仍在进行额外的安全性测试,将于“短期内”上线;第三方基准测试机构 Artificial Analysis 称其在一次有限合作伙伴预览中评估了max配置,且当前榜单上尚未列出任何为该配置提供API服务的供应商。
本周通过Muse Code工具套件及 Meta Model API 广泛推出的版本,则采用Meta此前已提供的推理设置,包括xhigh。
因此,对企业而言更相关的问题并非Muse Spark 1.3能否触及前沿水平,而是企业实际可部署的模型能逼近前沿多远——以及真实成本几何。
已发货模型表现优异,但并非基准测试领导者
Meta确实在其底层评估报告中披露了两种配置的结果,因此这并非公司刻意隐藏可部署模型的情形。但其发布材料显著突出了max变体,且部分最高分值正属于该配置。

Meta Muse Spark 1.3基准测试结果。图片来源:VentureBeat,使用OpenAI ChatGPT-Images-2.0生成
例如,Meta报告称,max配置在GDPval-AA v2上的得分为1,754 Elo,而xhigh为1,709;OSWorld 2.0得分为66.9对比57.2;JobBench得分为64.9对比61.2。
在某些测试中,二者差异微乎其微甚至出现反转:DeepSearchQA得分均为89.4;而在Terminal-Bench 2.1中,xhigh得分为89.2,max则为88.8。
Artificial Analysis 在其智能指数(Intelligence Index)中对Muse Spark 1.3 max评分为62,对正在发货的xhigh版本评分为61。后者与GPT-5.6 Sol max、Grok 4.6 high及Claude Opus 5 high并列。但Anthropic仍居排行榜首位:Claude Fable 5.1在max和xhigh配置下分别达66与65分,而Claude Opus 5在两种配置下均达63分。
换言之,Muse Spark 1.3 xhigh确实处于前沿模型集群之中,但它并非当前定义前沿的模型。
这与Muse Spark 1.2相比已是重大转变。VentureBeat对上月发布的报道指出,Meta当时推出了一款具备竞争力的编程挑战者模型,但总体仍落后于Anthropic的最佳模型。Muse Spark 1.2在Terminal-Bench 2.1上得分为82.9%,低于Opus 5的86.7%,且在Meta所呈现的其他主要编程对比测试中亦落后于Opus。
而借助1.3版本,Meta已不再仅仅是参与这场竞赛。在多项编程与智能体评估中,它正与OpenAI及Anthropic交替取胜。
Meta表示,该底层模型的操作也变得更简便。Muse Spark 1.3经训练可于长对话线程中维持多个工作流,利用工具收集上下文,识别自身计划中的空白,并在必要时向用户请求澄清,且在执行关键操作前予以确认。在Meta工程师的内部对比中,其在编程工作中使用的工具调用次数较1.2版本减少约20%,token用量减少25%。
对于需为成千上万乃至数百万次智能体循环付费的企业而言,这些行为层面的改进可能比再增加一个排行榜分数更为重要。
“几乎廉价到无法计量”并不意味着Meta下调了价格
Muse Spark 1.3并未获得API价格下调。Meta将标准定价完全维持在Muse Spark 1.2的水平:每百万输入token收费1.25美元,每百万输出token收费4.25美元,每百万缓存输入token收费0.15美元。
模型 | 输入(美元/百万) | 输出(美元/百万) | 总计(美元/百万) | 来源 |
0.10美元 | 0.20美元 | 0.30美元 | ||
MiMo-V2.5 Flash | 0.10美元 | 0.30美元 | 0.40美元 | |
DeepSeek-V4-Flash — 非高峰时段 | 0.22美元 | 0.66美元 | $0.88 | |
GPT-5.6 Luna | $0.20 | $1.20 | $1.40 | |
MiniMax-M3 | $0.30 | $1.20 | $1.50 | |
LongCat-2.0 — 限时促销 | $0.30 | $1.20 | $1.50 | |
DeepSeek-V4-Flash — 高峰时段 | $0.44 | $1.32 | $1.76 | |
MiMo-V2.5 | $0.40 | $2.00 | $2.40 | |
DeepSeek-V4-Pro — 非高峰时段 | $0.66 | $1.98 | $2.64 | |
LongCat-2.0 — 标准版 | $0.75 | $2.95 | $3.70 | |
MiMo-V2.5 Pro(≤256K) | $1.00 | $3.00 | $4.00 | |
Gemini 3.7 Flash — 截至2026年12月31日 | $0.75 | $3.75 | $4.50 | |
Gemini 3.8 Flash — 截至2026年12月31日 | 0.75美元 | 3.75美元 | 4.50美元 | |
DeepSeek-V4-Pro — 高峰时段 | 1.32美元 | 3.96美元 | 5.28美元 | |
Muse Spark 1.1 / 1.2 / 1.3 | 1.25美元 | 4.25美元 | 5.50美元 | |
GLM-5.3 | 1.40美元 | 4.40美元 | 5.80美元 | |
Grok 4.6 — 提示词(prompt tokens)少于20万 | 2.00美元 | 6.00美元 | 8.00美元 | |
MiMo-V2.5 Pro(>256K) | 2.00美元 | 6.00美元 | 8.00美元 | |
Qwen3.8-Max | 2.00美元 | 6.00美元 | 8.00美元 | |
Gemini 3.7 Flash — 自2027年1月1日起生效 | 1.50美元 | 7.50美元 | 9.00美元 | |
Gemini 3.8 Flash — 自2027年1月1日起生效 | 1.50美元 | 7.50美元 | 9.00美元 | |
GPT-5.6 Terra | 2.00美元 | 12.00美元 | 14.00美元 | |
Grok 4.6 — ≥200K 提示词(prompt tokens) | 4.00 美元 | 12.00 美元 | 16.00 美元 | |
GPT-5.4 | 2.50 美元 | 15.00 美元 | 17.50 美元 | |
Kimi K3 | 3.00 美元 | 15.00 美元 | 18.00 美元 | |
Claude Opus 5 | 5.00 美元 | 25.00 美元 | 30.00 美元 | |
Sakana Fugu Ultra(≤272K) | 5.00 美元 | 30.00 美元 | 35.00 美元 | |
GPT-5.6 Sol — 标准模式 | 5.00 美元 | 30.00 美元 | 35.00 美元 | |
Claude Fable 5 / Claude Mythos 5 | 10.00 美元 | 50.00 美元 | 60.00 美元 | |
Claude Fable 5.1 / Claude Mythos 5.1 | 10.00 美元 | 50.00 美元 | 60.00 美元 | |
GPT-5.6 Sol — 快速模式 | 10.00 美元 | 60.00 美元 | 70.00 美元 |
这使得扎克伯格所说的‘几乎便宜到无法计量’这句话,与其说是关于更低的 token 价格,不如说是关于 Meta 认为开发者能够利用这些 token 实现什么。
Artificial Analysis 为该论点提供了证据,但也带来了一个复杂因素。它测得 Muse Spark 1.3 xhigh 的输出速率为每秒 235.2 个 token,并估算每次 Intelligence Index 任务的成本为 0.55 美元。
在 Intelligence Index 上得分为 61,这使其成为目前所有已测模型中,在该智能水平上每项任务成本最低的模型。 最低 的每项任务成本(针对当前所有已测模型,在该智能水平上)。

Intelligence Index 与运行成本对比——人工分析 Intelligence Index(9 月 3 日至 26 日)。来源:Artificial Analysis
Muse Spark 1.2 每次 Artificial Analysis 任务仅需 0.40 美元,得分为 57。
尽管每 token 定价未变,该独立基准测试完成一项平均任务的成本因此 上升了 代际之间。Artificial Analysis 将此次上涨主要归因于在代理型评估(agentic evaluations)中输入 token 消耗量显著增加。
这并未直接反驳 Meta 关于 token 使用量降低 25% 的主张:Meta 描述的是其自身编码工作流中的对比,而 Artificial Analysis 测量的是一整套更广泛的推理与代理型任务。
但它说明了为何一旦模型以代理(agent)方式运行,“廉价”便变得模糊不清。token 费率、推理开销、交互轮数、工具调用次数及重试次数,均会影响实际完成工作的成本。
Meta 还保留了其异常低廉的 Contributor 订阅层级——每百万输入 token 收费 0.10 美元,每百万输出 token 收费 0.20 美元——条件是允许其将提示词(prompts)和补全结果(completions)用于训练。
正如 VentureBeat 在 Muse Spark 1.2 发布时所指出的那样,这对原型开发可能颇具吸引力,但对使用专有代码或敏感内部信息开展工作的企业而言,则会带来截然不同的数据治理考量。
王长河的‘Gemini 是谁?’一语落在一个异常接近的对比上
Meta 首席 AI 官 Alexandr Wang 在庆祝此次发布时表现得远不那么克制。
在 Artificial Analysis 公布 Muse Spark 测试结果后, Wang 在 X 平台转发了该结果,并附言:“我真的不愿这么说,但……Gemini 是谁?😱💨”
这一暗讽尤为尖锐,因为 谷歌于同日发布了 Gemini 3.8 Flash, 并将其定位在几乎完全相同的工作负载类别:长周期软件工程、自主代理及多步骤专业推理。谷歌称 3.8 是其迄今最强的推理与编码 Flash 模型,并表示这是该公司六周内发布的第三款 Flash 模型。
独立数据确实为 Wang 提供了一些可资利用的依据,但远非一击制胜。
Artificial Analysis 给出 Muse Spark 1.3 xhigh 的 Intelligence Index 得分为 61,单次任务成本为 0.55 美元;相比之下,Gemini 3.8 Flash 在高推理模式下的得分为 59,单次任务成本为 0.58 美元。因此,在这些特定设置下,Meta 在智能得分与任务成本两方面均略微领先谷歌。
谷歌在吞吐量方面则取得压倒性胜利。Artificial Analysis 测得 Gemini 3.8 Flash 高推理模式下的输出速率为约每秒 305 个 token,而 Muse Spark 为每秒 235 个 token——快约 30%。Gemini 目前的原始 API 标价也更低:谷歌推出限时优惠价,每百万输入 token 收费 0.75 美元,每百万输出 token 收费 3.75 美元;而 Meta 的对应价格为 1.25 美元与 4.25 美元。
该促销性谷歌定价将于 12 月 31 日到期,此后将上调至每百万输入 token 1.50 美元、每百万输出 token 7.50 美元。
结果呈现出前沿模型经济性如今已变得多么紧张。Meta 当前在此项独立对比中以 Intelligence Index 两分优势及每次基准任务三美分的成本优势胜出;而谷歌在其发布推广期间则提供明显更高的输出吞吐量及更便宜的原始 token 价格。
Wang 的‘Gemini 是谁?’是一句有趣的高管式垃圾话(trash talk)。对企业架构师而言,答案更接近:Gemini 是速度更快的选择;而根据此项独立测量,Muse 当前则是略强的高开销代理模型。
Meta 日趋演变的开放权重立场
对部分开发者而言,更具实质意义的问题或许与当下的基准测试竞赛关系甚微。
今年 8 月 Meta 推出 Muse Code 与 Muse Spark 1.2 时, VentureBeat 曾指出, 该公司已大幅偏离曾令 Llama 普及开来的开放权重策略。
Muse Code 与 Spark 1.2 均为专有、API 交付型产品——对于一家曾多年主张开放 AI 才是前进之路的公司而言,此举姿态鲜明。
五天后,Meta 再次转变方向。
8 月 10 日,它以 Apache 2.0 许可证发布了参数量为 300 亿的 Muse Glimmer。扎克伯格还表示:‘未来几周内,我们还将开放 Muse Spark 1.2 的权重。’路透社亦单独报道了 Meta 计划发布 Spark 1.2 权重的消息。
如今,Meta 却转而以另一款专有模型形式推出了 Muse Spark 1.3。
这尚不足以构成食言——‘未来几周’合理涵盖超过三周的时间段。但今日的公告反而使路线图变得更加模糊,而非更加清晰。
Meta 新发布的帖子中不再提及 Muse Spark 1.2。它仅称其路线图包括‘Muse Spark 开放权重发布’,却未指明版本号、发布日期、模型规模或许可证类型。扎克伯格同样在 X 平台上表示,‘Muse Spark 开放权重发布’即将来临。
对于那些因可下载权重意味着可自托管、可定制及可掌控推理经济性而选择标准化采用 Llama 的团队而言,这种模糊性可能比 Spark 在综合基准测试中多获得一分更为重要。
Muse Spark 1.3 表明,Meta 如今能够以前所未有的速度迭代专有前沿模型。其发布的 xhigh 配置速度快、定价具竞争力,且在独立排名中比其前代更接近榜首。max preview 则表明,当获准投入更多推理算力时,Meta 还能进一步推动该系列模型的发展。
下一关考验则有所不同:Meta 能否将这种迭代速度转化为企业真正可依循规划的路线图——包括使其最强能力广泛可部署,并兑现其已公开承诺的开放权重版 Spark 模型发布。
JOTO 企业落地观察
- 对企业部署而言,Muse Spark 1.3 xhigh虽未达max配置的峰值性能,但其每任务0.55美元的成本与Intelligence Index 61分的组合,使其成为当前高智能水平下最具经济性的可商用代理模型之一,适合规模化智能体循环场景。
- 对智能体工程实践而言,该模型在长对话线程中支持多工作流、自主识别计划空白并请求澄清,且工具调用减少20%、token用量降低25%,这些行为优化直接降低真实交互开销,比单纯提升Elo分数更具落地价值。
- 对AI安全治理与FDE落地而言,Meta保留Contributor层级(允许数据回传训练)与未明确开放Spark权重的模糊路线图,凸显企业在采用专有API模型时面临的数据主权风险与长期技术锁定隐患,尤其对处理敏感代码或内部知识的团队构成实质性约束。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


