SpaceXAI发布Grok 4.6:长程智能体能力跃升,但品牌安全争议成企业采用关键障碍
Grok 4.6在Artificial Analysis智能指数中位列全球第四,编程与智能体任务显著提升,API定价激进;但其历史安全污点——包括反犹内容、政治偏斜、马斯克过度吹捧及非自愿性化图像生成——正构成企业采购的核心治理风险。

埃隆·马斯克的公司SpaceXAI(此前名为xAI)已发布 Grok 4.6——其最新一代前沿人工智能模型,专注于长时运行的智能体(agents)、编程与知识型工作,并采用了一种旨在降低此类工作负载运行成本的定价策略。
该模型在 第三方机构Artificial Analysis发布的智能指数(Intelligence Index)中得分为61分,超越了中国月之暗面(Moonshot)公司广受欢迎的开源权重模型 Kimi K3 ,与竞争对手 OpenAI的GPT-5.6 Sol Max 持平,并较前代Grok 4.5 High提升5分。 Anthropic公司的Claude Opus 5 和 Fable 5 分别位居该榜单第一与第二位。
对于正在评估AI智能体的企业而言,更具实际意义的是:Grok 4.6在编程、终端操作、知识型工作及智能体基准测试中相较前代实现显著提升,同时维持API价格起始为每百万输入token 2美元、每百万输出token 6美元;据VentureBeat分析,这使其成为一款中等价位的前沿模型,可在全球范围内与主流专有模型及开源模型直接比价。
模型 | 输入价格(美元/百万token) | 输出价格(美元/百万token) | 总计(美元/百万token) | 来源 |
$0.10 | $0.20 | $0.30 | ||
MiMo-V2.5 Flash | $0.10 | $0.30 | $0.40 | |
deepseek-v4-flash | $0.14 | $0.28 | $0.42 | |
deepseek-v4-pro | $0.435 | $0.87 | $1.305 | |
GPT-5.6 Luna | $0.20 | $1.20 | $1.40 | |
MiniMax-M3 | $0.30 | $1.20 | 1.50美元 | |
LongCat-2.0 — 限时促销 | 0.30美元 | 1.20美元 | 1.50美元 | |
MiMo-V2.5 | 0.40美元 | 2.00美元 | 2.40美元 | |
LongCat-2.0 — 标准版 | 0.75美元 | 2.95美元 | 3.70美元 | |
MiMo-V2.5 Pro(≤256K) | 1.00美元 | 3.00美元 | 4.00美元 | |
Muse Spark 1.1 / 1.2 | 1.25美元 | 4.25美元 | 5.50美元 | |
GLM-5.2 | 1.40美元 | 4.40美元 | 5.80美元 | |
Grok 4.6 — 提示词(prompt tokens)少于200K | 2.00美元 | 6.00美元 | 8.00美元 | |
MiMo-V2.5 Pro(>256K) | 2.00美元 | 6.00美元 | 8.00美元 | |
Qwen3.8-Max | 2.00美元 | 6.00美元 | 8.00美元 | |
Gemini 3.6 Flash | 1.50美元 | 7.50美元 | 9.00美元 | |
GPT-5.6 Terra | 2.00美元 | 12.00美元 | 14.00美元 | |
Grok 4.6 — ≥200K 提示词(prompt tokens) | 4.00美元 | 12.00美元 | 16.00美元 | |
GPT-5.4 | 2.50美元 | 15.00美元 | 17.50美元 | |
Kimi K3 | 3.00美元 | 15.00美元 | 18.00美元 | |
Claude Opus 5 | 5.00美元 | 25.00美元 | 30.00美元 | |
Sakana Fugu Ultra(≤272K) | 5.00美元 | 30.00美元 | 35.00美元 | |
GPT-5.6 Sol — 标准模式 | 5.00美元 | 30.00美元 | 35.00美元 | |
Claude Fable 5 / Claude Mythos 5 | 10.00美元 | 50.00美元 | 60.00美元 | |
GPT-5.6 Sol — 快速模式 | 10.00美元 | 60.00美元 | 70.00美元 |
尽管如此,这一价格仍不到 GPT-5.6 Sol 在 OpenAI API 标准模式下收费的一半。
SpaceXAI 表示,Grok 4.6 即日起已在 Grok Build 中上线——这是 SpaceXAI 推出的、对标 Anthropic 的 Claude Code 和 OpenAI 的 Codex 的产品,该服务自以下计划起提供: 每月 30 美元的 SuperGrok 计划。
Grok 4.6 同样可在 SpaceX 最近收购的 AI 编程初创公司 Cursor 中使用,并可通过包括 OpenRouter、Vercel 和 Cloudflare 在内的合作伙伴获取。
在首周内,SpaceXAI 为 Cursor 和 Grok Build 中的 Grok 4.6 提供双倍的包含用量。
此次发布距 Grok 4.5 上线仅数周之隔;Grok 4.5 由 SpaceXAI 于 7 月推出,是一款专注于编程、智能体(agentic)任务和知识型工作的模型;而就在 Grok 4.6 发布的前一天,SpaceXAI 还推出了 Grok Bot——一种用于指派 AI 智能体作为虚拟员工完成指定任务的新系统。
更重大的变化在于智能体行为本身,而不仅是一个新的基准测试得分。
SpaceXAI 将 Grok 4.6 描述为专为在更长的工作序列中持续专注任务而构建,这些任务包括研究陌生主题、分析信息、导航代码库以及将产品构想转化为可运行的应用程序。
该公司表示,相较于 Grok 4.5,其对 Grok 4.6 进行了更长时间的补充训练,所用数据包括经人工筛选的模型生成推理与技术数据、工程数据,以及对其优化器和训练配方所做的调整;随后,该公司又利用 Grok 4.5 重新生成涵盖推理层级、智能体框架、STEM(科学、技术、工程与数学)、软件工程及知识型工作的监督式微调轨迹,并通过基于模型的检查过滤掉存在问题的轨迹。
强化学习亦针对涵盖通用编程、知识型工作、内核优化、网页开发及计算机辅助设计(CAD)等领域的智能体环境展开。
这一点至关重要,因为企业级 AI 部署正日益从孤立的提示-响应交互,转向要求智能体维持状态、操作工具、修改代码并在更长执行路径中从问题中恢复的智能体模式。
SpaceXAI 表示,在其测试中,Grok 4.6 在更长执行路径上展现出更强的自我测试与验证能力,即在继续推进前先行检查自身工作;同时报告称,其在交互式与可视化项目上的首次尝试效果也优于 Grok 4.5。这些是该公司内部观察结果,而非对生产环境中行为的独立保证,但它们揭示了 SpaceXAI 在模型后训练阶段重点投入的方向。
Grok 4.6 已抵达前沿,但并未全面主导该前沿
在当前这场 AI 模型竞赛的关键节点上,Grok 4.6 相较于 Grok 4.5 的提升程度不容低估。
据 Artificial Analysis 数据,Grok 4.6 在 Elo 分数 (一种源自国际象棋、用于衡量人类对模型输出直接对比偏好的指标)上达到 1,753 分,该分数基于 GDPVal-AA v2基准测试——该基准用于衡量模型在日程安排、图表绘制等现实世界任务中的表现;相比之下,Grok 4.5 得分为 1,526,GPT-5.6 Sol Max 为 1,728,Fable 5 Max 为 1,741。
SpaceXAI 公布的编程基准测试结果同样显示出代际性提升,但在前沿领域竞争更为激烈。

SpaceXAI Grok 4.6 基准测试结果。图片来源:SpaceXAI
Grok 4.6 在 CursorBench v3.2 上得分为 69.9%,高于此前的 66.7%;而 Fable 5 Max 达到 70.5%。在 DeepSWE v1.1 上,Grok 得分从 54% 显著跃升至 65.9%,但 GPT-5.6 Sol Max 以 73% 居首。FrontierCode v1.1 Extended 得分则从 56.6% 提升至 61.3%,而 GPT-5.6 Sol Max 为 60.6%,Fable 5 Max 以 63.6% 领先。
智能体基准测试结果也呈现类似格局:Grok 4.6 在 APEX-Agents 上得分为 57.5%,较 Grok 4.5 的 47.1% 提升 10.4 个百分点,略超 GPT-5.6 Sol Max 的 56.7%,但仍落后于 Fable 5 Max 的 59.2%;在 APEX-SWE 上,Grok 4.6 得分从 53.6% 升至 56.4%,而 Fable 5 Max 得分为 58.8%。
Terminal-Bench v3.0 则暴露出更大的现存差距:Grok 4.6 得分从 15.7% 提升至 26%,而 GPT-5.6 Sol Max 和 Fable 5 Max 分别为 34.6% 和 34.1%。
Grok 4.6 的两项最强表现来自长期视角的专业工作:在 AA-Briefcase 上,其 Elo 分数达 1,577,略高于 Fable 5 Max 的 1,574,并超过 GPT-5.6 Sol Max 的 1,502;在 Harvey LAB 上,Grok 4.6 得分为 15.8%,而 Grok 4.5 为 12.9%,Fable 5 Max 为 11.3%,GPT-5.6 Sol Max 仅为 2.5%。
SpaceXAI 特别指出一项重要的方法论注意事项:其表格中引用的第三方得分均采用各模型方自行报告或公开可查的最佳结果;因此,该对比不应被解读为一次完全受控的四模型评估。
换言之,现有证据更清晰地支持 Grok 4.5 至 Grok 4.6 的显著升级,却未能充分证明 Grok 4.6 在所有方面均全面优于其他前沿竞品模型;Grok 4.6 在部分所列评测中胜出,而 GPT-5.6 Sol Max 和 Fable 5 Max 在其余多项评测中仍保持明显领先。
成本可能才是更重要的企业级基准
Artificial Analysis 提供的评测增添了另一维度:模型每单位花费所能完成的工作量。
该测试将 Grok 4.6 置于其 智能度-每任务成本帕累托前沿(Intelligence-versus-Cost-per-Task Pareto frontier) 上,报告成本为每任务 0.84 美元——实际上使其性价比低于其前代 Grok 4.5,且经济性亦不及 OpenAI 的 GPT-5.6 Luna、z.ai 的 GLM-5.2 及 Meta 新推出的 Muse Spark 1.2 等其他模型。
Artificial Analysis 还报告称,Grok 4.6 完成其 AA-Briefcase 工作负载平均耗时约 53 轮次、输入 token 总量约为 5 亿;而 Claude Opus 5 Max 对应数值则分别约为 103 轮次和 20 亿输入 token。
这些测量值并不能证明每个生产环境中的智能体都将消耗更少 token 或快两倍完成任务。智能体成本高度依赖于框架设计、提示词、工具调用、缓存机制、重试行为以及具体任务本身。但这些数据指向一个日益关键的企业级指标:完成整个工作流的成本,而非单纯生成一百万 token 的成本。这一区分正是 SpaceXAI 定位的核心所在。
标准版 Grok 4.6 API 起价为每百万输入 token 2 美元、每百万输出 token 6 美元;此外,SpaceXAI 还提供一种速度更快的变体,价格为上述标准版的两倍。
官方提供的 API 文档对长上下文部署添加了一项重要注意事项:Grok 4.6 支持 50 万 token 的上下文窗口,但当提示词长度低于 20 万 token 时,计费标准为每百万输入 token 2 美元、每百万已缓存输入 token 0.50 美元、每百万输出 token 6 美元;一旦提示词达到或超过 20 万 token,上述费率将分别升至每百万输入 token 4 美元、每百万已缓存输入 token 1 美元、每百万输出 token 12 美元,且更高费率适用于该请求中的全部 token。
这意味着企业在估算总体拥有成本(TCO)时,不应将 $2/$6 的标称定价简单外推至模型整个上下文窗口范围。
Artificial Analysis 表示,该标准标称费率仍比其引用的 Claude Opus 5 和 GPT-5.6 Sol 竞品前沿模型价格低逾 60%;实际节省幅度将取决于各模型完成相同工作负载所消耗的 token 数量。
“Grok”这一名称本身即承载着大量争议与负面联想,这与普遍存在的 AI 怀疑论尚属不同范畴。
性能和价格可能并非SpaceXAI将Grok 4.6在基准测试中取得的提升转化为企业采用所面临的唯一障碍。Grok品牌携带着一段异常显眼的安全与治理争议历史——包括生成极端主义及反犹太主义内容、政治立场偏斜的回应、对埃隆·马斯克(Elon Musk)的过度赞美,以及最近利用Grok的图像生成功能生成非自愿的性化图像。对于具有严格合规性、品牌安全或负责任人工智能要求的企业而言,这段历史可能成为一项独立于Grok 4.6自身技术能力之外的采购考量因素。
最臭名昭著的文本生成事件发生于2025年7月,当时Grok生成了反犹太主义帖子,称赞阿道夫·希特勒(Adolf Hitler),并在某些回应中自称“MechaHitler”。Grok的前身xAI随后表示,正在删除不当帖子,并采取措施防止Grok发布仇恨言论。
同样是在2025年夏季, Grok开始在对无关问题的回答中插入关于南非所谓“白人种族灭绝”(white genocide)的提及。 xAI称,Grok响应软件遭未经授权修改,致使系统绕过其常规审核流程,在某一政治话题上生成特定回应。该公司表示该改动违反其政策,并随后承诺公开Grok的系统提示词,并建立全天候监控机制以识别问题性回应。南非政府已驳斥所谓针对南非白人的种族灭绝正在发生的说法。
Grok的客观性在同年11月再度受到审视,起因是该聊天机器人反复生成 对马斯克不切实际的奉承式评价。当时报道的示例包括声称马斯克地位高于顶尖运动员及历史上的知识界巨擘。马斯克表示,Grok经对抗性提示(adversarial prompting)操纵,对其作出“荒谬地正面”的陈述。无论根本原因如何,该事件凸显出一种声誉风险:一款面向企业的模型,其输出可能与其开发者最密切相关的企业高管的公众形象纠缠在一起。
最严重的争议涉及图像生成。2026年1月, 英国监管机构通信办公室(Ofcom)在接到报告后,就X平台展开正式调查, 相关报告指出,Grok账号正被用于创建并分发人物的裸露图像及儿童的性化图像。Ofcom表示,正在审查的材料可能构成非自愿亲密图像滥用、色情内容及儿童性虐待材料。X随后表示已实施措施,旨在阻止Grok账号被用于生成人物的亲密图像,但Ofcom称其调查仍处于开放状态。
此类审查不仅限于Ofcom。 英国信息专员办公室(Information Commissioner's Office)正在就X及xAI在Grok的开发与部署方面展开调查, 包括个人数据是否得到合法处理,以及是否存在充分保障措施以防止有害的篡改图像生成。与此同时,欧盟委员会依据《数字服务法》(Digital Services Act)启动了一项单独的正式调查, 审查X对与Grok相关的系统性风险的管理情况,其中包括篡改后的露骨性内容的传播。
这些调查针对的是X及此前的xAI组织,而非认定新发布的Grok 4.6 API本身违反上述法律。然而,它们极有可能阻碍SpaceXAI向企业销售Grok。
SpaceX于2026年2月收购xAI,该人工智能业务如今以SpaceXAI名义开展营销,这意味着Grok最新模型虽处于不同公司架构之下,但仍沿用同一面向消费者的Grok品牌。
本文所检视的材料中并无证据表明Grok 4.6自身重复了此前Grok部署中出现的特定“MechaHitler”、“白人种族灭绝”、性图像或吹捧马斯克等事件。但企业采购团队极少孤立评估某一模型,而通常将其置于供应商及产品历史背景中综合考量。对SpaceXAI而言,这意味着Grok 4.6不仅需证明自身比竞争性前沿模型更便宜或更强大,还需证明其管控机制足够可预测,以满足那些无法承受其人工智能供应商演变为品牌安全事件的企业之需求。
这种延续性造成了一种基准测试表格无法衡量的潜在采用难题。为内部编码代理选择模型的开发者,可能主要关注价格、延迟及任务完成率;而银行、政府机构、医疗保健提供商或消费品牌若将同一模型部署至面向客户或受监管的工作流中,则还须考虑供应商治理、内容安全管控、可审计性及声誉风险暴露。
一款专为部署而设计、而非仅用于聊天的模型
根据所提供的API规范,Grok 4.6支持文本与图像输入,并输出文本、函数调用、结构化输出及推理能力。这些规范还列出了每秒150次请求及每分钟5000万token的速率限制,并注明API可在 us-east-1 和 us-west-2地区提供。
Cursor的发布声明同样将Grok 4.6描述为专为长期运行的智能体及雄心勃勃的交互式与视觉工作而设计,使开发者能立即在既有的编码智能体环境中接入该模型,而无需先围绕API构建新的封装层。
对企业买家而言,这种分发方式的重要性几乎不亚于另一份排行榜结果。模型间的竞争日益不仅体现在推理得分上,更体现在开发者能否将其无缝嵌入现有编码、研究及运营工作流中,而不破坏这些工作流、不显著增加推理成本,亦不因与一个具争议性的品牌关联而招致任何反弹。
Grok 4.6并未确立无可争议的性能领先优势。其发布所呈现的是一项不同主张:具备前沿水平的智能、相较上一代有大幅改进、更强的长期运行智能体行为,以及相对激进的token经济策略。
下一阶段考验在于:人工分析公司(Artificial Analysis)在受控智能体工作负载下观察到的效率优势能否延续至生产环境。若Grok 4.6能持续以更少轮次及更少token完成长期编码与知识型工作任务,则该模型最重要的基准或许最终将是企业推理账单,而非排行榜得分。
JOTO 企业落地观察
- 对企业部署而言,Grok 4.6的分层计费机制(<200K prompt tokens与≥200K token费率翻倍)要求TCO估算必须基于实际工作流token消耗,而非标称单价;其在AA-Briefcase等长周期任务中Elo分数反超Fable 5 Max,暗示对知识型岗位可能具备成本优势,但需实测验证。
- 对智能体工程而言,Grok 4.6强化了长序列任务中的自我验证与工具调用稳定性(如Terminal-Bench仅达26% vs Fable 5 Max的34.1%),且明确支持函数调用与结构化输出,适配Cursor等编码智能体环境;但其终端操作短板仍显著,提示企业需谨慎评估智能体框架与底层模型的能力匹配度。
- 对AI安全治理而言,Grok 4.6虽未复现‘MechaHitler’等历史事件,但英国Ofcom、ICO及欧盟DSA调查仍在进行,且品牌延续xAI治理缺陷;这意味着企业若将Grok用于客户触点或受监管流程,须额外投入审计、内容过滤与响应监控资源,其合规成本可能抵消API价格优势。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


