JOTO
Contact us
← AI 智库
大语言模型

刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地

2026 年 9 月 23 日

OpenAI 正式发布 GPT-6 Sol 和 Luna,API 价格降至前代约一半:Luna 输入 0.1 美元/百万 Token(约 0.7 元人民币)、输出 0.5 美元(约 3.5 元)。其定价已低于 DeepSeek V4.1 Flash 闲时未命中缓存价格,直击后者核心低价优势。Sol 主打专业任务与 Agent 场景,Luna 聚焦高频规模化工作,二者均继承 Astra 的对齐与事实准确性改进,并强化缓存复用机制。

GPT-6 Sol 与 Luna 正式发布,价格直逼 DeepSeek

就在刚刚,OpenAI 正式发布 GPT-6 Sol 和 GPT-6 Luna,API 价格降至上一代的一半左右。其中,Luna 每百万 Token 输入 0.1 美元、输出 0.5 美元,约合人民币 0.7 元和 3.5 元。

GPT-6 Luna 官方定价信息图
GPT-6 Luna 官方定价信息图

作为对照,DeepSeek V4.1 Flash 闲时的缓存未命中输入价为每百万 Token 1 元,输出价为 4 元,高峰时段则升至 2 元和 8 元。按照普通新请求计算,Luna 已经更便宜,也没有峰谷定价带来的成本波动。

DeepSeek 依然握有自己的价格王牌。它的闲时缓存命中输入只要每百万 Token 0.02 元,远低于 Luna。V4.1 Flash 的综合能力也明显更高,拥有 100 万 Token 上下文,并支持图文理解、工具调用和思考模式。

然而,在缓存未命中的普通请求中,Luna 已经率先把 DeepSeek 模型拉进了同一价格区间,这也意味着 DeepSeek 最具辨识度的低价标签,从此有了一个实力强劲的海外对手。

Astra 冲上限,Sol 和 Luna 抢市场

刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地 配图 2
刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地 配图 3

本月早些时候,OpenAI 发布了 GPT-6 Astra,并将其称为公司目前能力最强、对齐程度最高的模型。Astra 面向高难度和高价值任务,但每百万 Token 10 美元输入、50 美元输出的价格,决定了它很难成为日常工作中的默认选项。

Sol 和 Luna 承担的是另一项任务。OpenAI 表示,两款模型沿用了与 Astra 相近的训练方法,将 Astra 在专业工作、事实准确性、编程、计算机操作和对齐方面的进展,带到速度更快、价格更低的产品层级。

新的 API 定价令人出乎意料。GPT-6 Sol 从 GPT-5.6 Sol 促销期的每百万 Token 4 美元输入、20 美元输出,降至 2 美元和 10 美元;GPT-6 Luna 从 0.2 美元和 1.2 美元,降至 0.1 美元和 0.5 美元。

GPT-6 Sol 与 Luna 定价对比图
GPT-6 Sol 与 Luna 定价对比图

对于这波降价,OpenAI 将其归因于推理基础设施和缓存效率的改善,并称目的是为了直接让利用户。OpenAI CEO Sam Altman 在发布后强调,真正重要的指标是完成一项任务要花多少钱,而在这个维度上,他认为市场上目前没有产品能够匹敌 Sol 和 Luna。

产品分工也随之变得清晰。Astra 继续负责最高能力上限,Sol 面向需要较强推理、编程和 Agent 能力的主流专业任务,Luna 则用极低价格承接高频、规模化工作。OpenAI 此次争夺的重点,已经从榜单上的最高分延伸到每一美元能够完成多少工作。

官方公布的成绩显示,GPT-6 Sol 的主要竞争力集中在专业工作和 Agent 任务上。在测试跨销售、营销、运营、客服、财务和人力资源等工作流的 AutomationBench 中,GPT-6 Sol 以 xhigh 推理强度取得 33.2% 的成绩,高于 Claude Opus 5 最大推理强度下的 26.9%,单项任务成本却只有后者的 9%。

AutomationBench 测试结果对比图
AutomationBench 测试结果对比图

它还超过了低推理强度的 GPT-6 Astra,并以远低于 Claude Fable 5.1 的成本取得更高分数。

Agents’ Last Exam 测试结果对比图
Agents’ Last Exam 测试结果对比图

Agents’ Last Exam 覆盖 55 个细分行业,主要考察长链路且具有实际经济价值的专业任务。GPT-6 Sol 在最大推理强度下得到 56.4%,超过 Claude Opus 5 在该评测中的最高成绩,单项任务成本低了约 60%。

事实准确性也有明显改善。OpenAI 使用用户曾标记事实错误的匿名真实对话进行内部测试,GPT-6 Sol 的错误数量约为 GPT-5.6 Sol 的一半,并开始接近 Astra 的可靠性。

事实准确性内部测试结果图
事实准确性内部测试结果图

GPT-6 Luna 在较高推理强度下,则以大约百分之一的成本追平 GPT-5.6 Sol。

编程和电脑操作更强,OpenAI 也开始卷白菜价了

编程是 Sol 最重要的应用场景之一。OpenAI 披露,内部研究人员使用编程 Agent 的规模正在快速增长,若按照 API 价格计算,中位数研究人员每天消耗的 Token 价值已经超过 600 美元,位于第 90 百分位的研究人员则超过 7000 美元。Agent 接手的任务越长,推理成本对使用频率的限制就越明显。

在考察代码能否直接合并进真实项目的 FrontierCode 中,GPT-6 Sol 相比上一代明显进步,并以更低成本追平 Claude Fable 5.1 xhigh。

FrontierCode 测试结果对比图
FrontierCode 测试结果对比图

在真实代码库的软件工程测试 DeepSWE v1.1 中,Sol 最大推理强度得分为 68.8%,距离 Claude Fable 5 的最高成绩 69.9% 只差 1.1 个百分点,单项任务成本约低 80%。对比之下,DeepSeek V4.1 Flash 的得分是 74.2%。

DeepSWE v1.1 测试结果对比图
DeepSWE v1.1 测试结果对比图

GPT-6 Luna 在同一评测中得到 66.6%,与 Claude Opus 5 和 Fable 5 中等推理强度的表现相近,但任务成本分别低 93% 和 96%。它未必适合承担最复杂的软件工程项目,却可能成为代码检查、批量修改、轻量开发和多 Agent 并发任务中更经济的执行模型。

计算机操作方面,Astra 仍然是 OpenAI 能力最强的选择,但 Sol 和 Luna 进一步改善了成本效率。在 OSWorld 2.0 离线测试中,Sol xhigh 得到 60.5%,与 Claude Opus 5 medium 的 60.3% 基本相当,单项任务成本低约 80%;Luna 最大推理强度的成绩超过 GPT-5.6 Sol medium,成本只有后者的十分之一。

OSWorld 2.0 测试结果对比图
OSWorld 2.0 测试结果对比图

模型的交流方式也继承了 Astra 的调整。OpenAI 称,Sol 和 Luna 会减少术语、古怪措辞及价值较低的细节,回答整体略短,同时更清楚地说明自己检查过什么、没有检查什么。对于需要连续协作的编程和技术任务,表达是否可靠,正在与单次回答是否漂亮变得同样重要。

模型发布后我们也迎来了网友的首批实测,很快呈现出两种截然不同的评价。开发者 Flavio Adamo 提前试用 GPT-6 Sol 后表示,过去在 GPT-5.6 上通常需要约一小时的任务,如今经常可以在约 20 分钟内完成,Token 消耗还不到原来的一半。

Flavio Adamo 实测反馈截图
Flavio Adamo 实测反馈截图
威尼斯运河快艇游戏 Three.js 成品演示动图
威尼斯运河快艇游戏 Three.js 成品演示动图

我们用 GPT-6 Sol 实测威尼斯运河快艇游戏时,模型最终交付了可以直接游玩的 Three.js 成品,桥洞闯关、倒计时、航迹尾流、水面反射和追逐镜头等核心功能均能正常运行,且审美还是相当不错的。

威尼斯运河快艇游戏运行效果动图
威尼斯运河快艇游戏运行效果动图

Bridgebench 的 3D 火箭发射测试更直接地展示了价格差距。

Bridgebench 火箭发射测试对比图
Bridgebench 火箭发射测试对比图
Bridgebench 火箭发射测试运行效果动图
Bridgebench 火箭发射测试运行效果动图

视觉质量上的结论却没有那么乐观。aipulsedaily 使用同一提示词让 GPT-6 Sol 与 Claude Opus 5.5 构建纽约 Three.js 场景,认为 Opus 5.5 更完整地呈现了街道、出租车、屋顶、布鲁克林大桥和中央公园,还增加了部分细节;Sol 的结果更接近静态画面,缺少相机移动和持续渲染循环。

纽约 Three.js 场景对比动图
纽约 Three.js 场景对比动图

Bridgebench 在另一组同提示词测试中也认为,Opus 5.5 的视觉品味和设计完成度明显更高。

Bridgebench 视觉对比图
Bridgebench 视觉对比图
Bridgebench 视觉对比动图
Bridgebench 视觉对比动图

不过考虑到 Opus 5.5 的 API 价格,我只能说,要啥自行车呢?毕竟性能、价格、速度本就是不可能三角,GPT-6 Sol 和 Luna 的卖点在于用可接受的能力,换取数量级上的成本和速度优势。

对于追求单次最佳效果的创意任务,Claude 仍可能更有吸引力;对于需要同时派出大量 Agent、反复迭代或长期运行的工作流,OpenAI 的价格优势会迅速累积。

DeepSeek 的价格护城河,迎来 OpenAI 的挑战

刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地 配图 19
刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地 配图 20
刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地 配图 21
刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地 配图 22

Artificial Analysis 也给出了更克制的观察。其 Intelligence Index 和 Coding Agent Index 显示,GPT-6 Sol 与 Luna 的总体智能水平和 GPT-5.6 系列大致持平,部分项目进步,也有部分项目回退,真正显著的变化来自成本下降。

按照该机构测算,GPT-6 Sol max 完成一次 Intelligence Index 任务的成本约为 1.06 美元,比 GPT-5.6 Sol max 的 1.99 美元低近一半;GPT-6 Luna max 约为 0.07 美元,比上一代的 0.18 美元低约 60%。

两款模型的输出 Token 用量反而略有增加,Sol 从约 2.9 万升至 3.1 万,Luna 从 4.1 万升至 5.1 万,价格下降仍然抵消了用量增加。

Intelligence Index 任务成本对比图
Intelligence Index 任务成本对比图

Token 单价之外,OpenAI 还更新了 GPT-6 的提示词缓存。系统会提高默认缓存命中率,让 Agent 更充分地复用已有上下文,缓存输入读取可获得 90% 的折扣。

开发者现在可以在控制台查看缓存比例和变化,也能检查哪些提示词未能命中缓存。推理强度和可用工具可以在对话中途调整,同时保留此前上下文的缓存;新的显式断点则允许开发者决定提示词前缀在哪里结束,以便优化复用范围。

对于持续读取代码库、文档和历史对话的 Agent 而言,缓存节省的费用可能比公开单价下降更重要。

另外,GPT-6 Sol 和 Luna 从今天起面向 Plus、Pro、Business、Enterprise 和 Edu 用户登陆 ChatGPT Work 与 Codex,Free 和 Go 用户可在桌面应用中使用 GPT-6 Luna。

两款模型暂未进入 ChatGPT 的普通 Chat 对话,相关权限会在当天逐步开放,通常来说,Codex 的开放速度会更快一些。API 用户已经可以通过 gpt-6-solgpt-6-luna 调用新模型。

OpenAI 产品负责人 Tibo Sottiaux 还宣布,Plus、Pro 和 Business 账户将获得一次预存的使用额度重置,让订阅用户能够在现有周期内多使用一轮额度。

GPT-6 Astra 发布时,OpenAI 展示的是模型能力能够抵达多高的位置。但万万没想到的是,Sol 和 Luna 上线后,OpenAI 也开始考虑智能密度的经济效益。

一方面,随着 Luna 的普通输入和输出价格进入 DeepSeek V4.1 Flash 的区间,两者的价格鸿沟已经被明显缩小;

另一方面,OpenAI 背后还有 ChatGPT Work、Codex 和 API 组成的、更完善的产品体系,价格接近以后,产品入口、工具支持、运行稳定性和开发者生态都会重新影响选择。

DeepSeek 用低价让整个行业重新计算 Token 的价值,OpenAI 则把这种压力带进了全球前沿模型的核心战场。接下来,低价不会再是某一家公司的招牌,而会成为所有头部模型都绕不开的必答题。

刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地 配图 24

JOTO 企业落地观察

  • 企业部署 AI 智能体时,需重新评估「能力-成本-延迟」三角关系:GPT-6 Luna 的极低单价使长链路 Agent 编排的边际成本大幅降低,但其在复杂 3D 渲染等高保真任务上的表现弱于竞品,意味着企业需按任务类型做模型路由策略,而非统一选用单一主力模型。
  • AI 安全治理面临新挑战:当 Luna 等低价模型被用于高频、并发的轻量级 Agent 任务时,其输出 Token 用量上升趋势(Luna 从 4.1 万升至 5.1 万)可能放大日志审计、内容合规审查与数据泄露风险面,需在调用层强制嵌入实时过滤与用量熔断机制。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.