JOTO
Contact us
← AI 智库
效率工具

Grok 4.7 发布:编程能力提升但 token 消耗激增,真实任务成本成关键瓶颈

2026 年 9 月 21 日

Grok 4.7 在 Terminal-Bench 等编程基准测试中显著提升,维持 2/6 美元每百万 token 定价,但实测显示其输出 token 消耗比前代高125%、比 GPT-6 Astra 高196%,单任务成本反超部分高价模型,企业需回归真实工作负载验证 ROI。

Grok 4.7 pairs coding gains with the same affordable pricing — but high token consumption threatens real-world ROI

SpaceXAI 今天早些时候 发布了 Grok 4.7,这是其最新一代面向编程与专业知识工作的模型,在基准测试(尤其是编程任务,即 Terminal Bench)中性能得到提升,强化学习训练周期更长,并引入了一套新的防护堆栈,旨在提升系统在持续数小时的复杂任务中的可靠性。 Terminal Bench),一个更长的强化学习运行周期,以及一套新的防护堆栈,旨在使系统在可能持续数小时的任务中更加可靠。

对开发者而言,此次发布最具实质意义的部分或许恰恰是未发生变化的内容:价格。Grok 4.7 的起始定价为每百万输入/输出 token 2 美元/6 美元,与仅一个多月前发布的 Grok 4.6 完全相同。 Grok 4.6,发布于仅一个多月前。

但对于正在决定将智能体(agentic)工作负载路由至哪个模型的工程团队而言,真正关键的数字或许根本不是 token 单价,而是综合考虑推理 token、工具调用及长时间运行的智能体循环后,成功完成一项任务的实际成本。针对 Grok 4.7 的全新独立测试使这一区分尤为关键。

SpaceXAI 还提供一种加速变体,其 token 处理速度更高,价格为原版的两倍(4 美元/12 美元),但尚未公布每秒处理 token 数量的具体数值,且截至本文发布时,尚无独立的吞吐量实测数据。

VentureBeat 前沿模型每百万 token API 成本对比表快照——2026 年底

模型

输入(美元/百万)

输出(美元/百万)

总计(美元/百万)

来源

0.10 美元

0.20 美元

0.30 美元

Meta

MiMo-V2.5 Flash

0.10 美元

0.30 美元

0.40 美元

Xiaomi

DeepSeek-V4.1-Flash — 非高峰时段

0.15 美元

0.60 美元

0.75 美元

DeepSeek

GPT-5.6 Luna

0.20 美元

1.20 美元

1.40 美元

OpenAI

MiniMax-M3

0.30 美元

1.20 美元

1.50 美元

MiniMax

LongCat-2.0 — 限时促销

0.30 美元

1.20 美元

1.50 美元

LongCat

DeepSeek-V4.1-Flash — 高峰时段

0.30 美元

1.20 美元

1.50美元

DeepSeek

MiMo-V2.5

0.40美元

2.00美元

2.40美元

小米(Xiaomi)

DeepSeek-V4-Pro — 非高峰时段

0.66美元

1.98美元

2.64美元

DeepSeek

LongCat-2.0 — 标准版

0.75美元

2.95美元

3.70美元

LongCat

MiMo-V2.5 Pro(≤256K)

1.00美元

3.00美元

4.00美元

小米(Xiaomi)

Gemini 3.7 Flash — 至2026年12月31日

0.75美元

3.75美元

4.50美元

谷歌(Google)

Gemini 3.8 Flash — 至2026年12月31日

0.75美元

3.75美元

4.50美元

谷歌(Google)

DeepSeek-V4-Pro — 高峰时段

1.32美元

3.96美元

5.28美元

DeepSeek

Muse Spark 1.1 / 1.2 / 1.3

1.25美元

4.25美元

5.50美元

Meta

GLM-5.3

1.40美元

4.40美元

5.80美元

Z.AI

Grok 4.7 — ≤200K提示词(prompt tokens)

2.00美元

6.00美元

8.00美元

xAI

MiMo-V2.5 Pro(>256K)

2.00美元

6.00美元

8.00美元

小米(Xiaomi)

Qwen3.8-Max

2.00美元

6.00美元

8.00美元

QwenCloud

Gemini 3.7 Flash——自2027年1月1日起生效

1.50美元

7.50美元

9.00美元

Google

Gemini 3.8 Flash——自2027年1月1日起生效

1.50美元

7.50美元

9.00美元

Google

GPT-5.6 Terra

2.00美元

12.00美元

14.00美元

OpenAI

Grok 4.7——输入提示词数>200K

4.00美元

12.00美元

16.00美元

xAI

Grok 4.7 Fast(Cursor)——输入≤256K

4.00美元

12.00美元

16.00美元

Cursor

GPT-5.4

2.50美元

15.00美元

17.50美元

OpenAI

Kimi K3

3.00美元

15.00美元

18.00美元

Moonshot AI

Grok 4.7 Fast(Cursor)——输入长度超256K,最高达500K

6.00美元

18.00美元

24.00美元

Cursor

Claude Opus 5

5.00美元

25.00美元

30.00美元

Anthropic

Sakana Fugu Ultra(≤272K)

5.00美元

30.00美元

35.00美元

Sakana AI

GPT-5.6 Sol——标准模式

5.00美元

30.00美元

35.00美元

OpenAI

Claude Fable 5 / Claude Mythos 5

10.00美元

50.00美元

60.00美元

Anthropic

Claude Fable 5.1 / Claude Mythos 5.1

10.00美元

50.00美元

60.00美元

Anthropic

GPT-6 Astra——标准模式

10.00美元

50.00美元

60.00美元

OpenAI

GPT-5.6 Sol——快速模式

10.00美元

60.00美元

70.00美元

OpenAI

GPT-6 Astra——快速模式

20.00美元

100.00美元

120.00美元

OpenAI

AI编程平台 Cursor该平台最近被SpaceXAI收购,同时也为Grok 4.7提供Fast档位服务,价格为标准代币价格的两倍——即每100万输入/输出代币收费4美元/12美元——并将Fast设为Pro及更高级别订阅计划的默认选项。

Cursor未公布每秒代币数(tokens-per-second)的具体数值,也未明确宣称吞吐量提升恰好为2倍。对于超过256K代币的输入,Cursor对标准版Grok 4.7收取4美元/12美元,对Fast档位收取6美元/18美元,上限为该模型最大上下文窗口500K。

据SpaceXAI称,该模型目前已在Cursor、Grok Build及Grok API中上线,并可通过第三方编码框架、模型路由器和云平台使用。GitHub则正分阶段在Copilot Pro、Pro+、Max、Business及Enterprise等各版本中逐步部署Grok 4.7,支持范围涵盖VS Code、Visual Studio、Copilot CLI、GitHub云端代理、JetBrains、Xcode与Eclipse。

这种组合——即在未提高基础代币价格的前提下宣称更高能力——构成了SpaceXAI核心推广主张。在其发布资料中,该公司将Grok 4.7描述为其迄今面向编程与知识工作能力最强的模型,称其可“在困难任务上持续工作更长时间”,并能更审慎地验证自身输出结果。

一款为耗时数小时的工作而训练的更大规模模型

SpaceXAI表示,Grok 4.7采用了一款比Grok 4.6更新且规模更大的基础模型,并经过更长时间的强化学习训练,所用任务分布难度更高,且加权侧重于需耗时数小时方能完成的问题。该公司还表示,其改进了长上下文管理能力,并针对SpaceXAI最新发布的、以智能体(agentic)AI为核心的Grok Bot框架对模型进行了专项优化训练。 近期发布的、聚焦智能体AI的Grok Bot框架

这一侧重点对于将模型评估为智能体而非聊天界面的企业用户而言至关重要。一款能在冗长编程会话中持续专注、组装文档、操作终端或完成多步骤业务流程的模型,其运行需求与主要针对孤立提示(isolated prompts)优化的模型截然不同。

Grok 4.7在常见第三方基准测试中相较前代取得了显著提升,但仍落后于美国竞争对手OpenAI、Anthropic乃至Google推出的最新模型。

基准测试

Grok 4.6

Grok 4.7

提升幅度

Terminal-Bench 4.0

20.3%

38.0%

+17.7个百分点

EEBench

53.0%

64.0%

+11.0分

HealthBench Professional

48.5%

56.7%

+8.2分

CursorBench 4.0

40.4%

46.3%

+5.9分

DeepSWE v1.1

65.2%

71.0%

+5.8分

Harvey Legal Agent Benchmark

15.8%

19.6%

+3.8分

AA Briefcase v1.1

1,546

1,657

+111 Elo

GDPval

1,605

1,695

+90 Elo

A正如开发者兼作家Dan McAteer在X平台上的发文所言:“糟糕透顶的在 Terminal-Bench(即其整体相较前代提升幅度最大的终端使用基准测试)上。

第三方人工智能模型评估机构 Artificial Analysis 将 Grok 4.7 在其“xHigh” 推理努力度设置下于该基准测试中测得约 26% 的得分,而 OpenAI 的 GPT-6 Astra xHigh 为 59.6%,Anthropic 的 Claude Opus 5 在最大努力度下约为 49%。

在 CursorBench 4.0 上,Grok 4.7 在 xHigh 努力度下的得分为 46.3%,高于 Grok 4.6 High 的 40.4%。在 SpaceXAI 的对比中,GPT-5.6 Sol Max 得分为 41.7%,而 Fable 5.1 Max 达到 51.8%。在 DeepSWE v1.1 上,Grok 4.7 达到 71.0%,而 Grok 4.6 为 65.2%。

不过,其他人对该版本发布表示印象深刻。广受欢迎的专注人工智能新闻的 X 平台用户 @haider1 称 CursorBench 数据“实际上荒谬”,指出 Grok 4.7 xHigh 得分 46.3%,单任务成本约为 6.01 美元,而排行榜中显示的 Fable 5.1 Medium 得分为 46.8%,单任务成本为 7.05 美元,GPT-5.6 Sol Max 得分为 41.7%,单任务成本为 8.23 美元。他还强调了 Grok 4.7 相较 Grok 4.6 在大致相当成本下的性能提升

低廉的 token 价格并不必然意味着最低的单任务成本

Artificial Analysis 当前的测试为标价叙事增加了一项重要限定条件:Grok 4.7 xHigh 在 Intelligence Index 任务中平均使用约 81,000 个输出 token,而 Grok 4.6 High 为 36,000 个 ,GPT-6 Astra Max 则为 27,000 个。

Artificial Analysis 表示,这代表其输出 token 使用量比 Grok 4.6 高出约 125%,比 GPT-6 Astra 高出约 196%。

Artificial Analysis 还 现已填充以美元计价的单任务成本结果:Grok 4.7 xHigh 每 Intelligence Index 任务约 3.74 美元,Grok 4.7 High 则为 2.73 美元。其方法论纳入输入、缓存、推理及答案 token 成本,而非仅简单比较 API 列表价格。作为参照,当前相同对比将 GPT-5.6 Sol Max 定为每任务约 1.99 美元,尽管其输入/输出列表价格显著更高(分别为每百万 token 4 美元与 20 美元)。

这逆转了对 API 价目表的直观解读。 一款每 token 收费更低的模型,在完成最终工作负载时仍可能更昂贵 ,前提是它需要多得多的推理 token 才能达成目标。而这种差异在企业级规模下会迅速变得显著。

按公布的每百万 token 2 美元/6 美元费率计算,一项每月消耗 100 亿输入 token 和 20 亿输出 token 的工作负载,将产生约 32,000 美元的月度模型费用,即每年 384,000 美元;若每月消耗 500 亿输入 token 和 100 亿输出 token,则相同费率下月费用约为 160,000 美元,即每年 192 万美元(尚未计入平台特定费用)。这些仅为示意性用量计算,并非对典型 Grok 部署的估算,但它们说明了为何 token 效率在生产规模下会累积成为基础设施预算问题。

因此,对首席工程师而言,周一早上的关键要点十分明确:在具有代表性的内部任务上对 Grok 4.7 进行基准测试,并跟踪每次成功完成任务的成本、token 消耗量、延迟、重试次数以及所需人工干预次数,同时参考 API 费率。

安全机制迎来全新堆栈

SpaceXAI 还表示,Grok 4.7 引入了一套全新的防护堆栈,在 LatchBio 的生物安全基准测试中取得 62.4% 的结果,并称该模型在 HackerBench v0.3 评估中仅允许 3.3% 的高风险双重用途提示通过。这些是公司自行报告的安全结果,应视作如此,直至接受更广泛的独立测试验证。

对于本季度评估 Grok 4.7 的工程团队而言,实际测试标准并非其 2 美元/6 美元的 API 费率是否在纸面上低于竞争对手,而是该模型能否以更少的美元支出、更少的重试次数以及更少的工程师人工干预,完成组织实际的编码与知识型工作任务。Grok 4.7 的基准测试提升为团队开展此项评估提供了理由;而生产环境中的实际追踪数据将决定其低廉的 token 价格是否能转化为完成工作的更低账单。

JOTO 企业落地观察

  • 对企业部署而言,Grok 4.7 的低价策略不等于低成本——其在 Intelligence Index 任务中平均消耗 81,000 输出 token(Grok 4.6 仅 36,000),意味着同等工作量下年费用可能从 38 万美元跃升至近 200 万美元,企业必须用内部真实编码任务做端到端成本追踪,而非依赖 API 单价。
  • 对智能体工程而言,该模型专为数小时级复杂任务优化,并强化长上下文与 Grok Bot 框架适配,但高 token 消耗暴露了 agentic 循环中‘验证-重试-工具调用’链路的低效性;工程团队需重点监测重试次数与人工干预频次,而非仅关注单次响应质量。
  • 对 AI 安全治理而言,SpaceXAI 声称新防护堆栈在 HackerBench v0.3 中仅放行 3.3% 高风险提示,但该结果属自测数据,且未披露对抗性测试或红队评估细节;安全团队不可直接采信,应将其纳入现有 MTTD/MTTR 流程,在真实代码生成与终端操作场景中交叉验证拦截有效性。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.