Grok 4.7 发布:编程能力提升但 token 消耗激增,真实任务成本成关键瓶颈
Grok 4.7 在 Terminal-Bench 等编程基准测试中显著提升,维持 2/6 美元每百万 token 定价,但实测显示其输出 token 消耗比前代高125%、比 GPT-6 Astra 高196%,单任务成本反超部分高价模型,企业需回归真实工作负载验证 ROI。

SpaceXAI 今天早些时候 发布了 Grok 4.7,这是其最新一代面向编程与专业知识工作的模型,在基准测试(尤其是编程任务,即 Terminal Bench)中性能得到提升,强化学习训练周期更长,并引入了一套新的防护堆栈,旨在提升系统在持续数小时的复杂任务中的可靠性。 Terminal Bench),一个更长的强化学习运行周期,以及一套新的防护堆栈,旨在使系统在可能持续数小时的任务中更加可靠。
对开发者而言,此次发布最具实质意义的部分或许恰恰是未发生变化的内容:价格。Grok 4.7 的起始定价为每百万输入/输出 token 2 美元/6 美元,与仅一个多月前发布的 Grok 4.6 完全相同。 Grok 4.6,发布于仅一个多月前。
但对于正在决定将智能体(agentic)工作负载路由至哪个模型的工程团队而言,真正关键的数字或许根本不是 token 单价,而是综合考虑推理 token、工具调用及长时间运行的智能体循环后,成功完成一项任务的实际成本。针对 Grok 4.7 的全新独立测试使这一区分尤为关键。
SpaceXAI 还提供一种加速变体,其 token 处理速度更高,价格为原版的两倍(4 美元/12 美元),但尚未公布每秒处理 token 数量的具体数值,且截至本文发布时,尚无独立的吞吐量实测数据。
VentureBeat 前沿模型每百万 token API 成本对比表快照——2026 年底
模型 | 输入(美元/百万) | 输出(美元/百万) | 总计(美元/百万) | 来源 |
0.10 美元 | 0.20 美元 | 0.30 美元 | ||
MiMo-V2.5 Flash | 0.10 美元 | 0.30 美元 | 0.40 美元 | |
DeepSeek-V4.1-Flash — 非高峰时段 | 0.15 美元 | 0.60 美元 | 0.75 美元 | |
GPT-5.6 Luna | 0.20 美元 | 1.20 美元 | 1.40 美元 | |
MiniMax-M3 | 0.30 美元 | 1.20 美元 | 1.50 美元 | |
LongCat-2.0 — 限时促销 | 0.30 美元 | 1.20 美元 | 1.50 美元 | |
DeepSeek-V4.1-Flash — 高峰时段 | 0.30 美元 | 1.20 美元 | 1.50美元 | |
MiMo-V2.5 | 0.40美元 | 2.00美元 | 2.40美元 | |
DeepSeek-V4-Pro — 非高峰时段 | 0.66美元 | 1.98美元 | 2.64美元 | |
LongCat-2.0 — 标准版 | 0.75美元 | 2.95美元 | 3.70美元 | |
MiMo-V2.5 Pro(≤256K) | 1.00美元 | 3.00美元 | 4.00美元 | |
Gemini 3.7 Flash — 至2026年12月31日 | 0.75美元 | 3.75美元 | 4.50美元 | |
Gemini 3.8 Flash — 至2026年12月31日 | 0.75美元 | 3.75美元 | 4.50美元 | |
DeepSeek-V4-Pro — 高峰时段 | 1.32美元 | 3.96美元 | 5.28美元 | |
Muse Spark 1.1 / 1.2 / 1.3 | 1.25美元 | 4.25美元 | 5.50美元 | |
GLM-5.3 | 1.40美元 | 4.40美元 | 5.80美元 | |
Grok 4.7 — ≤200K提示词(prompt tokens) | 2.00美元 | 6.00美元 | 8.00美元 | |
MiMo-V2.5 Pro(>256K) | 2.00美元 | 6.00美元 | 8.00美元 | |
Qwen3.8-Max | 2.00美元 | 6.00美元 | 8.00美元 | |
Gemini 3.7 Flash——自2027年1月1日起生效 | 1.50美元 | 7.50美元 | 9.00美元 | |
Gemini 3.8 Flash——自2027年1月1日起生效 | 1.50美元 | 7.50美元 | 9.00美元 | |
GPT-5.6 Terra | 2.00美元 | 12.00美元 | 14.00美元 | |
Grok 4.7——输入提示词数>200K | 4.00美元 | 12.00美元 | 16.00美元 | |
Grok 4.7 Fast(Cursor)——输入≤256K | 4.00美元 | 12.00美元 | 16.00美元 | |
GPT-5.4 | 2.50美元 | 15.00美元 | 17.50美元 | |
Kimi K3 | 3.00美元 | 15.00美元 | 18.00美元 | |
Grok 4.7 Fast(Cursor)——输入长度超256K,最高达500K | 6.00美元 | 18.00美元 | 24.00美元 | |
Claude Opus 5 | 5.00美元 | 25.00美元 | 30.00美元 | |
Sakana Fugu Ultra(≤272K) | 5.00美元 | 30.00美元 | 35.00美元 | |
GPT-5.6 Sol——标准模式 | 5.00美元 | 30.00美元 | 35.00美元 | |
Claude Fable 5 / Claude Mythos 5 | 10.00美元 | 50.00美元 | 60.00美元 | |
Claude Fable 5.1 / Claude Mythos 5.1 | 10.00美元 | 50.00美元 | 60.00美元 | |
GPT-6 Astra——标准模式 | 10.00美元 | 50.00美元 | 60.00美元 | |
GPT-5.6 Sol——快速模式 | 10.00美元 | 60.00美元 | 70.00美元 | |
GPT-6 Astra——快速模式 | 20.00美元 | 100.00美元 | 120.00美元 |
AI编程平台 Cursor该平台最近被SpaceXAI收购,同时也为Grok 4.7提供Fast档位服务,价格为标准代币价格的两倍——即每100万输入/输出代币收费4美元/12美元——并将Fast设为Pro及更高级别订阅计划的默认选项。
Cursor未公布每秒代币数(tokens-per-second)的具体数值,也未明确宣称吞吐量提升恰好为2倍。对于超过256K代币的输入,Cursor对标准版Grok 4.7收取4美元/12美元,对Fast档位收取6美元/18美元,上限为该模型最大上下文窗口500K。
据SpaceXAI称,该模型目前已在Cursor、Grok Build及Grok API中上线,并可通过第三方编码框架、模型路由器和云平台使用。GitHub则正分阶段在Copilot Pro、Pro+、Max、Business及Enterprise等各版本中逐步部署Grok 4.7,支持范围涵盖VS Code、Visual Studio、Copilot CLI、GitHub云端代理、JetBrains、Xcode与Eclipse。
这种组合——即在未提高基础代币价格的前提下宣称更高能力——构成了SpaceXAI核心推广主张。在其发布资料中,该公司将Grok 4.7描述为其迄今面向编程与知识工作能力最强的模型,称其可“在困难任务上持续工作更长时间”,并能更审慎地验证自身输出结果。
一款为耗时数小时的工作而训练的更大规模模型
SpaceXAI表示,Grok 4.7采用了一款比Grok 4.6更新且规模更大的基础模型,并经过更长时间的强化学习训练,所用任务分布难度更高,且加权侧重于需耗时数小时方能完成的问题。该公司还表示,其改进了长上下文管理能力,并针对SpaceXAI最新发布的、以智能体(agentic)AI为核心的Grok Bot框架对模型进行了专项优化训练。 近期发布的、聚焦智能体AI的Grok Bot框架。
这一侧重点对于将模型评估为智能体而非聊天界面的企业用户而言至关重要。一款能在冗长编程会话中持续专注、组装文档、操作终端或完成多步骤业务流程的模型,其运行需求与主要针对孤立提示(isolated prompts)优化的模型截然不同。
Grok 4.7在常见第三方基准测试中相较前代取得了显著提升,但仍落后于美国竞争对手OpenAI、Anthropic乃至Google推出的最新模型。
基准测试 | Grok 4.6 | Grok 4.7 | 提升幅度 |
Terminal-Bench 4.0 | 20.3% | 38.0% | +17.7个百分点 |
EEBench | 53.0% | 64.0% | +11.0分 |
HealthBench Professional | 48.5% | 56.7% | +8.2分 |
CursorBench 4.0 | 40.4% | 46.3% | +5.9分 |
DeepSWE v1.1 | 65.2% | 71.0% | +5.8分 |
Harvey Legal Agent Benchmark | 15.8% | 19.6% | +3.8分 |
AA Briefcase v1.1 | 1,546 | 1,657 | +111 Elo |
GDPval | 1,605 | 1,695 | +90 Elo |
A正如开发者兼作家Dan McAteer在X平台上的发文所言:“糟糕透顶的在 Terminal-Bench(即其整体相较前代提升幅度最大的终端使用基准测试)上。
第三方人工智能模型评估机构 Artificial Analysis 将 Grok 4.7 在其“xHigh” 推理努力度设置下于该基准测试中测得约 26% 的得分,而 OpenAI 的 GPT-6 Astra xHigh 为 59.6%,Anthropic 的 Claude Opus 5 在最大努力度下约为 49%。
在 CursorBench 4.0 上,Grok 4.7 在 xHigh 努力度下的得分为 46.3%,高于 Grok 4.6 High 的 40.4%。在 SpaceXAI 的对比中,GPT-5.6 Sol Max 得分为 41.7%,而 Fable 5.1 Max 达到 51.8%。在 DeepSWE v1.1 上,Grok 4.7 达到 71.0%,而 Grok 4.6 为 65.2%。
不过,其他人对该版本发布表示印象深刻。广受欢迎的专注人工智能新闻的 X 平台用户 @haider1 称 CursorBench 数据“实际上荒谬”,指出 Grok 4.7 xHigh 得分 46.3%,单任务成本约为 6.01 美元,而排行榜中显示的 Fable 5.1 Medium 得分为 46.8%,单任务成本为 7.05 美元,GPT-5.6 Sol Max 得分为 41.7%,单任务成本为 8.23 美元。他还强调了 Grok 4.7 相较 Grok 4.6 在大致相当成本下的性能提升
低廉的 token 价格并不必然意味着最低的单任务成本
Artificial Analysis 当前的测试为标价叙事增加了一项重要限定条件:Grok 4.7 xHigh 在 Intelligence Index 任务中平均使用约 81,000 个输出 token,而 Grok 4.6 High 为 36,000 个 ,GPT-6 Astra Max 则为 27,000 个。
Artificial Analysis 表示,这代表其输出 token 使用量比 Grok 4.6 高出约 125%,比 GPT-6 Astra 高出约 196%。
Artificial Analysis 还 现已填充以美元计价的单任务成本结果:Grok 4.7 xHigh 每 Intelligence Index 任务约 3.74 美元,Grok 4.7 High 则为 2.73 美元。其方法论纳入输入、缓存、推理及答案 token 成本,而非仅简单比较 API 列表价格。作为参照,当前相同对比将 GPT-5.6 Sol Max 定为每任务约 1.99 美元,尽管其输入/输出列表价格显著更高(分别为每百万 token 4 美元与 20 美元)。
这逆转了对 API 价目表的直观解读。 一款每 token 收费更低的模型,在完成最终工作负载时仍可能更昂贵 ,前提是它需要多得多的推理 token 才能达成目标。而这种差异在企业级规模下会迅速变得显著。
按公布的每百万 token 2 美元/6 美元费率计算,一项每月消耗 100 亿输入 token 和 20 亿输出 token 的工作负载,将产生约 32,000 美元的月度模型费用,即每年 384,000 美元;若每月消耗 500 亿输入 token 和 100 亿输出 token,则相同费率下月费用约为 160,000 美元,即每年 192 万美元(尚未计入平台特定费用)。这些仅为示意性用量计算,并非对典型 Grok 部署的估算,但它们说明了为何 token 效率在生产规模下会累积成为基础设施预算问题。
因此,对首席工程师而言,周一早上的关键要点十分明确:在具有代表性的内部任务上对 Grok 4.7 进行基准测试,并跟踪每次成功完成任务的成本、token 消耗量、延迟、重试次数以及所需人工干预次数,同时参考 API 费率。
安全机制迎来全新堆栈
SpaceXAI 还表示,Grok 4.7 引入了一套全新的防护堆栈,在 LatchBio 的生物安全基准测试中取得 62.4% 的结果,并称该模型在 HackerBench v0.3 评估中仅允许 3.3% 的高风险双重用途提示通过。这些是公司自行报告的安全结果,应视作如此,直至接受更广泛的独立测试验证。
对于本季度评估 Grok 4.7 的工程团队而言,实际测试标准并非其 2 美元/6 美元的 API 费率是否在纸面上低于竞争对手,而是该模型能否以更少的美元支出、更少的重试次数以及更少的工程师人工干预,完成组织实际的编码与知识型工作任务。Grok 4.7 的基准测试提升为团队开展此项评估提供了理由;而生产环境中的实际追踪数据将决定其低廉的 token 价格是否能转化为完成工作的更低账单。
JOTO 企业落地观察
- 对企业部署而言,Grok 4.7 的低价策略不等于低成本——其在 Intelligence Index 任务中平均消耗 81,000 输出 token(Grok 4.6 仅 36,000),意味着同等工作量下年费用可能从 38 万美元跃升至近 200 万美元,企业必须用内部真实编码任务做端到端成本追踪,而非依赖 API 单价。
- 对智能体工程而言,该模型专为数小时级复杂任务优化,并强化长上下文与 Grok Bot 框架适配,但高 token 消耗暴露了 agentic 循环中‘验证-重试-工具调用’链路的低效性;工程团队需重点监测重试次数与人工干预频次,而非仅关注单次响应质量。
- 对 AI 安全治理而言,SpaceXAI 声称新防护堆栈在 HackerBench v0.3 中仅放行 3.3% 高风险提示,但该结果属自测数据,且未披露对抗性测试或红队评估细节;安全团队不可直接采信,应将其纳入现有 MTTD/MTTR 流程,在真实代码生成与终端操作场景中交叉验证拦截有效性。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


