Meta 发布 Apache 2.0 许可的 30B 多模态智能体模型 Muse Glimmer,支持 24GB 消费级硬件本地运行
Meta 推出开源权重模型 Muse Glimmer(29.6B 参数),采用 Apache 2.0 许可证,专为本地自主智能体设计,支持文本-图像交错输入、工具调用与错误恢复,并可在 24GB VRAM 设备上量化运行。

Meta 今日 发布了 Muse Glimmer,一款拥有 300 亿参数的开源权重模型 专为在消费级硬件上直接运行自主 AI 智能体而设计——将通常依赖云基础设施的智能体工作负载迁移至高端 Mac 和 PC 上。
与该模型功能同样值得关注的是其授权方式。Glimmer 采用宽松、行业标准的 Apache 2.0 开源许可证发布——这是该公司自今年 4 月以专有模型 Muse Spark 取代其开源权重 Llama 系列以来,首次完全开源发布。 Muse Spark。
事实上,Muse Glimmer 今日发布的许可证比 Llama 曾采用的许可证更为宽松。Llama 的定制化社区许可证多年来因诸多限制(例如每月用户数上限为 7 亿)而饱受批评;而 Apache 2.0 则无此类限制,允许不受限制的商业使用、修改和再分发。 更多 比Llama曾采用的许可证更为宽松。Llama定制的社区许可证因其7亿月活跃用户上限等限制条款而遭到多年批评;而Apache 2.0许可证则无此类限制,允许不受限制的商业使用、修改和再分发。
模型权重 现已在 Hugging Face 上提供。王仲远(Alexandr Wang)表示,本周内将通过 Ollama、LM Studio、vLLM、SGLang、Together AI、Fireworks AI 和 OpenRouter 推出支持;针对 llama.cpp、MLX 和 ExecuTorch 的优化集成将在未来几天上线;Meta 的博客文章还将 Unsloth 列为本地运行时合作伙伴,并指出可使用 PyTorch 的 TorchTitan 进行微调。该公司表示正与 AMD、Arm、Dell、Intel 和 Nvidia 合作,以优化跨设备性能,并已发布 开发者文档 ,涵盖自定义智能体框架。
“今天,我们还开放了 Muse Glimmer 的权重——这是一款出色的 300 亿参数稠密模型,可本地运行,”Meta 联合创始人兼首席执行官马克·扎克伯格(Mark Zuckerberg)在其 X 平台(长期使用的账号 @finkd)上发帖写道。“不久后,我们还将发布 Muse Spark 1.2 的权重,这是我们最新的基础模型。Meta 是开源的坚定支持者,我为这些发布感到自豪。”
此次承诺发布的 Muse Spark 1.2 将带来更大转变:它正是 Muse Code 背后的前沿模型 Muse Code——即 Meta 五天前发布的终端编程智能体;而直至今日,整个 Muse 系列均为专有模型。扎克伯格在 Muse Code 发布时曾暗示,他“很快将分享更多关于开源的信息”。如今我们已知其所指为何。
对开发者和企业而言,本地推理的实际意义远不止于计算发生的位置。一个处理文件、截图、开发环境及其他敏感上下文的智能体,可在不持续将这些信息发送至远程推理服务的情况下执行相关工作流。本地部署还可从推理循环中消除网络可用性依赖及按 token 计费的 API 成本——尽管组织仍需承担硬件、电力、部署及管理成本。
一款围绕智能体循环构建的 300 亿参数模型
Meta 并未主要将 Glimmer 定位为通用聊天机器人,而是围绕自主智能体执行的操作序列对其进行训练:制定计划、调用工具、解读结果、持续工作,以及在出错时恢复。
“与更大规模的模型一样,Muse Glimmer 可通过规划、工具调用、自我结果验证及故障恢复,作为功能完备的智能体运行,”Meta 首席 AI 官王仲远(Alexandr Wang)在 X 平台的一条 帖子 中宣布该发布,并补充称该模型“可在 24GB VRAM 下运行而不损失智能体可靠性。”
据 Hugging Face 上的 模型卡片显示,Glimmer 是一款稠密因果 Transformer 模型,总参数量约为 296 亿,分布在 52 层中,其中包括一个专用的约 18 亿参数 ViT-G/14 视觉感知编码器。它支持交错输入文本与图像,输出文本,支持 100 多种语言,并声明上下文长度为 131,072 个 token 或更长,知识截止日期为 2026 年 1 月 4 日。
这种组合旨在使智能体能够同时解读截图、图表和文档,并对文本进行推理及调用外部工具。Glimmer 提供低、中、高和超高四种推理设置——通过系统提示词设定——因此应用程序可根据任务需求调节推理强度;Meta 表示,该模型适用于包括 OpenClaw 和 Hermes Agent 在内的各类智能体框架。
该模型是 Meta 更大规模旗舰模型的蒸馏版本:据该公司 技术博客文章所述,Glimmer 使用 logits 蒸馏法,以 Muse Spark 的输出为数据进行预训练;随后在更长上下文、更侧重智能体行为且包含更丰富推理轨迹的数据集上进行中期训练;最后,在通用、推理、编程及智能体等领域,通过监督式微调、在线策略蒸馏及强化学习进行后期训练。
Meta 通过一个本地 Home Assistant 工作流演示了该成果:在一段演示视频中,Glimmer 自主通过工具调用发现网络中的 Home Assistant 实例,查询设备 API,从零开始编写响应式 HTML/CSS/JavaScript 仪表盘,并部署本地服务器以验证自身工作成果。这比单一问答基准测试更贴近企业智能体部署的实际运行场景——该模型必须在与外部系统交互的同时维持计划,并检查自身操作是否产生预期结果。
将智能体压缩至 24GB
硬件故事是本次发布的核心。
Meta 表示,该 300 亿参数模型在全精度下需要超过 55GB 内存——超出任何单块消费级 GPU 的容量。
因此,该公司开发了约 4 比特量化版本,将语言模型权重压缩至 20GB 以下,为运行智能体所需的其他内存组件留出空间:KV 缓存、视觉感知编码器以及一个配套的推测解码模型,全部可容纳于 24GB 或 32GB 内存范围内。
实际意义上,这意味着量化版本可在消费级机器上运行——尽管仅限于高端配置。面向 24GB 的 K-Quant-17GB 配置可适配单块高端消费级显卡,例如英伟达(Nvidia)的 RTX 3090 或 RTX 4090(两者均配备 24GB VRAM);而面向 32GB 的 K-Quant-Dynamic 版本则匹配新款 RTX 5090 的 32GB 显存。在 Mac 方面,Apple Silicon 的统一内存承担了 VRAM 的角色,因此配备 32GB 或更多内存的 MacBook Pro 或 Mac Studio 可容纳完整堆栈——Meta 已在搭载 M4 Max 和 M5 Max 芯片的 MacBook Pro 上自行进行了速度测试。然而,典型的 8GB 或 16GB 笔记本电脑仍无法运行,而全精度 BF16 版本(Meta 标定为 64GB)则仍属于数据中心 GPU 及顶配 Mac Studio 的范畴。
Meta 报告称,其面向 32GB 硬件的 K-Quant-Dynamic 版本在 15 项基准测试中的平均准确率下降仅为 0.2%,而面向 24GB 硬件的 K-Quant-17GB 配置则为 1%。这些数据为 Meta 自行测量结果,并非独立评估。
Meta 还采用 DFlash 推测解码技术应对本地智能体另一大难题:延迟。该技术不再逐个生成 token,而是由一个更小的 DFlash “起草者”模型一次性提出 16 个 token 的区块,再由主模型并行验证,从而更快地生成完全相同的输出。
Meta 表示,此举将 Nvidia RTX 5090 上的平均生成速度从每秒 74.9 个 token 提升至每秒 233.4 个 token——提升幅度达 3.1 倍。Apple M5 Max 的生成速度则从每秒 26.6 个 token 提升至每秒 50.2 个 token(提升 1.8 倍),M4 Max 从每秒 23.7 个 token 提升至每秒 37.8 个 token(提升 1.5 倍)。测试采用批处理大小为 1 和贪心解码(greedy decoding),其中 Apple 系统通过 ExecuTorch 测量,RTX 5090 则通过 llama.cpp 测量。
对于智能体(agent)类应用而言,这些倍数提升比聊天类应用更为关键:单个用户请求可能触发多次模型调用、多次工具调用以及多次验证步骤,而每一阶段累积的延迟会迅速使原本能力强大的智能体变得不具实用性。
Glimmer 进入了一个日益激烈的本地模型(local-model)市场竞争格局。
Meta 并非进入一片空白领域。开发者目前已拥有该尺寸级别内性能出色的开源权重(open-weight)模型,其中最突出的是 Google 的 Gemma 4 系列和阿里巴巴的 Qwen3.6-27B——两者均将自身定位为面向推理、多模态理解及智能体工作负载(agentic workloads)的模型。Meta 自己的基准测试表格直接将 Glimmer 与这两者进行对比。

Muse Glimmer 基准测试对比图表。图片来源:Meta
在多项智能体测试中,Glimmer 在三者对比中领先,包括 MCP Atlas(75.5)、DeepSearch QA(74.6)、τ³-Banking(23.5)、WildClawBench(47.6)和 GAIA2(43.3)。在 Meta 的评估中,其 SWE-Bench Pro 得分为 51.2,而 Gemma4-31B 为 36.9,Qwen3.6-27B 为 50.2。
但 Glimmer 并未全面胜出。在 Meta 自行开展的对比中,Qwen 在 OSWorld-Verified(75.6 对比 Glimmer 的 65.9)、TerminalBench 2.1(60.7 对比 51.7)、SkillsBench、GDPval-AA(1141 对比 953)以及大多数多模态基准测试中均领先。在 SWE-Bench Verified 中,Glimmer 得分为 76.0,略低于 Qwen 的 77.2。Gemma 在 GPQA Diamond 和 Humanity's Last Exam 两项测试中领先。
诚实地解读这些数据,Glimmer 更引人关注之处在于其作为一款专用于本地智能体的模型,而非作为一项普适性性能领先的证据。对企业开发者而言,实际问题是:其在智能体可靠性、量化质量、工具兼容性及解码速度等方面的综合表现,能否从基准测试结果切实转化为持续稳定的现实世界工作流。
模型
开发者 / 来源
AA 分数
参数量 / 上下文长度
最低可追踪 API 价格
访问方式
许可证
最强适用场景
Moonshot AI;中国
60
总计 2.8T 参数 / 激活 104B 参数;上下文长度 1M
通过 Kimi、Fireworks 或 Modal 提供的输入 $3.00 / 输出 $15.00(定价)
Kimi K3 定制许可证。年营收超 2000 万美元的大型模型即服务(model-as-a-service)运营商需另行签署协议
大型产品可能需标注“Kimi K3”字样。
前沿长视野编码
多模态研究及复杂工具驱动型智能体
Z.ai / 智谱 AI;中国
53
753B 参数 / 激活 40B 参数;上下文长度 1M
通过 DeepInfra FP4 提供的输入 $0.75 / 输出 $2.40(定价)
MIT 许可证
长视野编码与智能体
百万 token 分析,支持可调节推理能力
DeepSeek;中国
52
284B 参数 / 激活 13B 参数;上下文长度 1M
通过 DeepInfra 提供的输入 $0.09 / 输出 $0.18(定价)
麻省理工学院(MIT)
• 极其经济的推理能力 • 编程智能体、终端任务与工具调用
MiniMax;中国
45
4280亿参数 / 230亿活跃参数;100万token
0.23美元 / 0.96美元(通过CoreWeave,定价)
;
MiniMax社区许可证。商用需署名;年营收超2000万美元的公司需获得授权。包含禁止性使用条款。
• 原生支持文本、图像与视频处理 • 长上下文编程及“协作”智能体
小米(Xiaomi);中国
43
1.02万亿参数 / 420亿活跃参数;100万token
0.35美元 / 0.70美元(通过GMI,定价)
麻省理工学院(MIT)
复杂软件工程
跨越数千次工具调用的智能体
Thinking Machines Lab;美国
42
9750亿参数 / 410亿活跃参数;权重中含100万token
0.95美元 / 4.05美元(通过DeepInfra FP8,定价)
Apache 2.0
可定制的文本、图像与音频基础模型
针对编程、检索增强生成(RAG)与工具调用系统微调的模型
英伟达(NVIDIA);美国
38
5500亿参数 / 550亿活跃参数;权重中最多含100万token
0.37美元 / 1.08美元(通过Blackbox AI,定价)
OpenMDW-1.1;允许商业用途及衍生模型权利
复杂智能体与长上下文推理
高精度检索增强生成(RAG)、代码、数学与科学能力
Mistral AI;法国
30
128B 稠密参数;256K 上下文长度
1.50 美元 / 7.50 美元(通过 Mistral)定价)
修改版 MIT 许可证。合并月收入超过 2000 万美元的公司必须获取商业许可证,或使用 Mistral 的服务。
代码智能体与函数调用
多模态指令遵循
Google DeepMind;美国
30
30.7B 稠密参数;256K 上下文长度
在 Google AI Studio 的有限免费层级上免费提供;通过 CoreWeave 收费,低至 0.10 美元 / 0.34 美元(定价)
Apache 2.0
紧凑型多模态推理与代码能力
可控的本地或私有服务器部署
OpenAI;美国
24
117B / 5.1B 激活参数;131K 上下文长度
0.03 美元 / 0.17 美元(通过 CoreWeave)定价)
众多第三方 API
Apache 2.0
推理
结构化输出与工具
微调及单块 80GB GPU 部署
Cohere;加拿大
23
218B / 25B 激活参数;128K 输入上下文长度
在 Cohere 当前追踪的端点上免费提供(定价)
Apache 2.0
企业级RAG与基于事实的引用标注• 多语言智能体与文档处理
Meta;美国
尚未评分
29.6B稠密参数量,含视觉编码器;上下文长度超131K
发布当日未找到公开的按用量计费托管价格
全精度权重、量化版本、推测解码器(drafter)及感知编码器均采用Apache 2.0许可证
在24–32GB内存系统上持续运行的本地智能体
工具调用、错误恢复、编程能力以及屏幕/文档理解能力
Meta Glimmer进一步扩充了美国公司所发布的真正开源、前沿级模型这一仍十分有限的名单。
过去两年间,中国公司在开源AI领域一直引领步伐,包括深度求索(DeepSeek)、阿里巴巴Qwen团队、月之暗面(Moonshot AI)的Kimi、智谱(Zhipu)的GLM以及MiniMax 以MIT和Apache 2.0许可证发布前沿级开源模型 其发布节奏远超西方实验室。
使用数据印证了这一点:截至2026年5月,中国开源权重模型在OpenRouter平台消耗的token总量占比约 61%,其中使用量排名前五的模型中有四个来自中国实验室——而此前开源权重模型的领军者Meta Llama则完全跌出排行榜。
美国的反例仍屈指可数:OpenAI的 gpt-oss-120b与gpt-oss-20b,于2025年8月以Apache 2.0许可证发布,系该公司自GPT-2以来首次开放权重;Google的Gemma系列,虽属开源权重模型,但采用Google自定义的更严格许可协议而非经开放源代码促进会(OSI)批准的许可证;以及Thinking Machines公司的Inkling。
Glimmer与gpt-oss构成最直接的对比:二者均采用Apache 2.0许可证,均支持可调节的推理努力程度,且均面向自托管部署。
但gpt-oss模型为纯文本模型,采用稀疏混合专家(sparse mixture-of-experts)架构,主要针对推理与工具调用设计——gpt-oss-20b可在约16GB内存中运行,而gpt-oss-120b则面向单块80GB数据中心GPU。
Glimmer则开辟了不同路径:它是一个具备原生视觉输入能力的稠密模型,围绕智能体循环(agent loop)端到端训练,并随附专为24GB消费级设备优化的量化变体及推测解码器(speculative-decoding drafter)。
倘若扎克伯格兑现承诺,开放Muse Spark 1.2的权重,Meta将把一款真正的美国旗舰级前沿模型投入开源流通——这是目前尚无任何美国实验室在该层级实现过的。
安全性仍是部署架构的一部分
赋予本地模型工具访问权限,所引发的安全问题不同于部署本地聊天机器人——而Meta自身的安全指标显示,Glimmer在各项能力上并非普遍强于其同行。
在CI Memories隐私基准测试中(数值越低表示违规率越低),Glimmer得分为26.4,Gemma为12.1,Qwen为53.4;在Siren AgentDojo提示注入测试中,Glimmer的攻击成功率高达28.4%,高于Gemma的25.6%与Qwen的40.3%——但Glimmer在三者中效用得分最高,达94.2。
Meta表示,其依据 先进人工智能扩展框架(Advanced AI Scaling Framework) 对Glimmer进行了评估,并判定该模型未达到该框架对“前沿AI”(Frontier AI)的定义,因其整体能力普遍弱于Muse Spark。其准备就绪团队(Preparedness Team)在化学/生物、网络及失控风险三大类别中,将Glimmer评定为中等或更低风险——后两类风险等级的判定依据是Glimmer整体弱于Muse Spark 1.0(后者获得相同评级)。
尽管如此,该公司仍建议将Glimmer作为配备防护机制的更广泛系统的一部分进行部署,包括对不可逆操作实施人工确认(human-in-the-loop confirmation)。这一警示对于本地智能体尤为重要:数据保留在设备本地可降低对云基础设施的暴露风险,但仅靠本地执行本身并不能解决提示注入、权限过度授予或智能体执行意外操作等问题。
Apache 2.0许可证权重与快速发展的运行时生态系统
Meta此次发布全精度BF16权重、两种4比特量化变体、DFlash推测解码器(drafter)及感知编码器——全部采用Apache 2.0许可证。可供下载的模型不附带Meta官方API定价,因此总成本取决于本地硬件或开发者所选第三方托管服务。采购团队需注意一个细节:与大多数“开源”模型发布一样,此处开放的是权重——Meta并未公开训练数据或训练代码。
更广泛的含义在于,Meta正将开发者工作站视为自主智能体的可信部署目标,而不仅限于实验小型语言模型的场所。Glimmer的30B参数规模与24GB内存目标,使其部署可行性延伸至高端消费级硬件;而Apache 2.0许可证则赋予开发者(及其法务部门)前所未有的修改与部署自由度。
下一重考验在于,其基准测试优势能否在更复杂的现实软件仓库、企业级工具及长期运行的智能体会话等混乱环境中持续保持。若能通过,则Glimmer最具深远影响的部分或许并非又一组基准测试分数——而在于,一类此前预期只能依托云API运行的智能体,正日益具备在开发者办公桌下那台机器上本地化运行并开展工作的能力。
JOTO 企业落地观察
- 对企业部署而言,Glimmer 的 Apache 2.0 许可及 24GB 可运行量化版本,首次使企业无需云 API 即可将具备屏幕理解、工具调用与故障恢复能力的智能体部署于标准高端工作站,显著降低数据外泄风险与 token 成本,但需承担硬件运维与安全防护责任。
- 对智能体工程而言,Glimmer 端到端围绕智能体循环(规划→工具调用→验证→恢复)训练,并配套 DFlash 推测解码器与 ViT-G/14 视觉编码器,为构建响应式、多步交互型本地智能体提供了开箱即用的稠密架构范式,而非依赖 LLM+编排框架的松耦合方案。
- AI 安全治理方面,Meta 明确将 Glimmer 定位为中等风险模型,其 CI Memories 隐私得分(26.4)劣于 Gemma(12.1),且提示注入攻击成功率(28.4%)高于 Gemma,表明本地化不等于安全性提升,必须叠加人工确认、权限最小化与操作审计等防护机制。


