JOTO
Contact us
← AI 智库
大语言模型

GPT-6 Sol、Luna 发布:永久半价

2026 年 9 月 23 日

GPT-6 Sol 和 Luna 正式发布,API 输入输出价格永久降至原价约50%;Sol 定位复杂编程与专业工作,Luna 侧重快速日常任务。二者在 Agents’ Last Exam、DeepSWE 1.1、OSWorld 2.0 等基准测试中以显著成本优势逼近或超越竞品最高档位模型。新增缓存机制使读取成本降至10%,并支持动态调整推理档位与工具范围。

GPT-6 Sol 与 Luna 永久降价

刚刚,GPT-6 Sol 和 GPT-6 Luna 发布,API 永久降价:

每百万 tokens输入输出:旧价
GPT-6 Sol$4 → $2$20 → $10
GPT-6 Luna$0.20 → $0.10$1.20 → $0.50

并且,这些模型的能力大幅提升,且相比 Anthropic 有巨量的价格优势(故意的)。

AutomationBench:横轴成本,纵轴得分
AutomationBench:横轴成本,纵轴得分

并且 Tibo 还宣布,所有 Plus、Pro、Business 账户将获得一次 banked reset

Tibo 的发布补充
Tibo 的发布补充

工作流与编程

Sol、Luna 使用了与 Astra 类似的训练方法,分别定位复杂编程与专业工作、快速且大规模的日常任务。Astra 继续提供家族内最高能力;推理和缓存效率的改善同时降低了服务成本。

GPT-6 家族
GPT-6 家族

Agents’ Last Exam 测试 55 个细分行业的长流程专业任务。Sol(max)拿到 56.4%,超过本次评测中 Opus 5 的最高成绩,每个任务便宜 60%

Agents’ Last Exam
Agents’ Last Exam

FrontierCode 1.1 Main 同时检查代码正确性、测试质量、改动范围、代码风格和仓库规范。Sol 相比前代明显提升,并以更低成本达到 Fable 5.1(xhigh)的水平。

FrontierCode 1.1 Main
FrontierCode 1.1 Main

DeepSWE 1.1 包含 113 个原创软件工程任务,覆盖 91 个仓库、5 种语言,使用统一的 Agent 框架运行:

  • Sol(max):68.8%,距 Fable 5 的最高成绩 69.9%(xhigh)差 1.1 个百分点,每个任务便宜约 80%

  • Luna(max):66.6%,与 Opus 5、Fable 5 的 medium 档位相近,成本分别低 93%96%

DeepSWE 1.1
DeepSWE 1.1

以上 GPT 数据来自研究环境或 API,对手数据来自公开报告;缺少 Fable 5.1 成绩的项目沿用了 Fable 5。图中的 low、medium、high、xhigh、max 为不同推理投入档位。

Computer Use

OSWorld 2.0 离线集中,Sol(xhigh)得分 60.5%,Opus 5(medium)为 60.3%,Sol 每个任务便宜约 80%。Luna(max)超过 GPT-5.6 Sol(medium),成本约为它的 1/10

OSWorld 2.0 离线集,采用部分完成得分
OSWorld 2.0 离线集,采用部分完成得分

这组数据采用 2026 年 8 月 8 日版本,指标是 partial reward,按任务各部分的完成情况给分。

事实准确性测试使用匿名化的真实对话,样本来自用户曾指出旧模型答错的问题。Sol 的错误约减少一半,接近 Astra 的水平;Luna 在较高推理档位上,以约 1/100 的评测成本达到 GPT-5.6 Sol 的可靠性

困难问题上的事实错误率,越低越好
困难问题上的事实错误率,越低越好

缓存大幅降价

GPT-6 提高了默认缓存命中率,复用请求开头相同上下文的中间计算结果。命中的输入读取价格为普通输入的 10%,写入缓存为普通输入的 1.25 倍

每百万 tokensGPT-6 SolGPT-6 Luna
缓存读取$0.20$0.01
缓存写入$2.50$0.125

开发者新增了几项控制:

  • 查看命中情况。 Prompt Caching Dashboard 显示缓存占比和变化,诊断工具定位输入、参数、工具及历史消息变化造成的缓存损失。

  • 中途调整推理档位。 在后续上下文追加配置更新,提高或降低 reasoning effort,保留此前缓存。

  • 开关当前可用工具。 保持工具定义稳定,通过工具选择范围等机制调整可用工具,复用前缀。

  • 设置显式断点。 指定缓存前缀的结束位置,把动态内容放在后面。

GitHub 提供的使用数据是:过去几个月,OpenAI 模型的数十亿次请求中,需要重新处理的 prompt tokens 占比下降了 超过 50%,Copilot 因而响应更快。

可用范围、API 与订阅额度

对于付费的 Plus、Pro、Business、Enterprise、Edu 用户现已可用,可在 ChatGPT Work 和 Codex 获得 Sol、Luna;而对于 Free、Go 用户可以在桌面应用中试用 Luna。

在 API 中,模型模型名为 gpt-6-solgpt-6-luna。两者均支持文本、图片输入及文本输出,上下文窗口 105 万 tokens,最大输入 92.2 万、最大输出 12.8 万

GPT-6 API 文档节选
GPT-6 API 文档节选

JOTO 企业落地观察

  • 企业部署智能体系统时,GPT-6 Sol/Luna 的成本结构变化意味着可将更多预算分配给长流程任务编排与多步骤验证,而非单纯压缩单次调用开销;但需注意其能力边界仍集中于编程与办公场景,非通用决策类任务。
  • AI 安全治理需关注新缓存机制引入的隐式状态依赖——当多个请求共享缓存前缀时,历史消息变更可能引发未预期的中间状态复用,这对审计日志完整性与因果可追溯性提出更高要求。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.