Anthropic 发布 Claude Sonnet 5.5:中端模型性能逼近 Opus,单任务成本降30%
Anthropic 推出 Claude Sonnet 5.5,生成速度提升超30%,单任务总成本最多降低30%,主要源于更少 token 消耗与工具调用。其在 GDPval-AA 等基准上得分接近 Opus 5.5,编程能力反超,且已通过 Box、Zendesk、Slack 等企业验证。

Anthropic 今日 宣布 将发布 Claude Sonnet 5.5,这是其面向中端市场的主力AI模型的一次更快、更高效升级。
在该公司开展的多项测试中,Sonnet 5.5 的性能惊人地接近其更昂贵的兄弟型号—— Opus 5.5(Anthropic 新推出的旗舰模型) ,该模型于上周刚刚发布,从而为企业提供了另一种替代方案,使其无需为顶级前沿模型付费。
Anthropic 表示,Sonnet 5.5 的输出生成速度比 Claude Sonnet 5 快逾 30%,且完成一项任务的总成本最多可降低 30%,主要原因在于其使用的 token 数量更少、调用工具的次数更少,而非 API 标价更低。VentureBeat 已联系 Anthropic,就该公司具体如何衡量此次提速展开问询,待收到回复后将更新报道。
与此同时,Anthropic 将 Sonnet 5.5 的应用程序编程接口(API)价格维持在其直接前代产品 Sonnet 5m 的水平,即每百万输入/输出 token 分别为 2 美元/10 美元;缓存读取 token(重复发送相同信息作为输入)享有每百万 0.20 美元的折扣。缓存写入成本亦有所降低,为每百万 token 2.50 美元。
相比之下,Opus 5.5 的价格为每百万输入 token 4 美元、每百万输出 token 20 美元,缓存写入为每百万 token 5 美元。
换言之,Anthropic 的宣传重点正日益转向完成某项工作的成本,而不仅仅是处理单个 token 的价格。
Anthropic 将更多 Opus 能力注入 Sonnet
Anthropic 将 Sonnet 5.5 描述为最适合执行定义相对明确的日常工作任务:软件调试、编程、文档生成、演示文稿与电子表格制作,以及界面设计或优化。Opus 5.5 仍是该公司针对模糊性或开放式工作(需持续判断力)的首选方案。
但 Anthropic 自身的评估结果表明,这两类模型在某些工作负载下的性能差距已大幅缩小。
在 GDPval-AA(一项衡量模型在真实职业任务中表现的基准测试)上,Anthropic 报告称 Sonnet 5.5 得分为 1844,几乎与 Opus 5.5 的 1846 持平,且显著高于 Sonnet 5 的 1449。在 AA-Briefcase 上,Sonnet 5.5 得分为 1811,而 Opus 5.5 为 1822。 AA-Briefcase,Sonnet 5.5 得分为 1811,而 Opus 5.5 为 1822。
该模型在 OSWorld 2.1(Anthropic 开发的部分计算机使用能力评估)中达到 80.1%,低于 Opus 5.5 的 81.8%,但远高于 Sonnet 5 的 57%。在 Chartography(一项视觉图表识别测试)中,Sonnet 5.5 得分为 61.6%,Opus 5.5 为 64.4%,而 Sonnet 5 仅为 15.6%。
Anthropic 表示,该模型在编程方面尤为出色。在代理式编程基准测试 Terminal-Bench 4.0 上,其报告 Sonnet 5.5 得分为 70.6%,而 Sonnet 5 为 10.3%,Opus 5.5 在所报告设置下为 66.4%。在 CursorBench 4.0 上,Sonnet 5.5 达到 55.5%,略低于 Opus 5.5 的 57.8%。
基准测试结果不应被视作所有实际生产工作负载的直接代理,Anthropic 自身亦表示,Opus 5.5 在困难、开放式工作上仍明显更强。
然而,经济性可能比排行榜排名更重要。
Anthropic 表示,在多项评估中,Sonnet 5.5 以低(Low)或中(Medium)努力度运行时,其得分可超越 Sonnet 5 在最佳状态下的得分,而每项任务的成本约为后者的十分之一 。在 FrontierCode 上,其表示 Sonnet 5.5 以高(High)努力度运行时的得分比 Sonnet 5 在同等设置下的得分高出约 10 分,而每项任务的成本约为后者的十五分之一。。在 FrontierCode 上,其表示 Sonnet 5.5 以高(High)努力度运行时的得分比 Sonnet 5 在同等设置下的得分高出约 10 分,而每项任务的成本约为后者的十五分之一。
Claude Code 及 Anthropic 的消费者应用将默认采用中(Medium)努力度设置,而 Claude 平台则默认采用高(High)努力度。较低设置以牺牲部分推理深度为代价,换取更低延迟和更少 token 消耗;较高设置则允许模型花费更长时间检查并优化其输出。
客户反馈步骤减少、智能体响应更快
Anthropic 还向 VentureBeat 提供了早期客户测试数据,为这些效率主张在企业工作流内部的实际意义提供了更具实践性的图景。
Box 公司 AI 产品副总裁 Yashodha Bhavnani 表示,Sonnet 5.5 重新核查了源文档,并发现了其前代模型遗漏的错误。
Bhavnani 表示:“与上一代模型相比,Sonnet 5.5 准确率更高、速度快 2.4 倍,且总 token 使用量减少 12%。”
Zendesk 在数百个支持案例(涵盖客户回复及升级决策)中测试了该模型。AI 总监 Abhinay Kathuria 表示,工单处理速度 提升了 20% ,且该模型所作错误决策少于 Zendesk 当前在生产环境中使用的 Claude 模型。
Slack 也观察到了类似模式。首席工程师 Curtis Allen 表示,Sonnet 5.5 在公司几乎所有离线 Slackbot 评估中均优于 Sonnet 5,且未做任何提示词(prompt)修改;同时所需步骤更少,输出 token 数量大约 减少了 14%。
对于编程智能体而言,步骤数量的减少可能尤为重要。Lovable 公司联合创始人兼首席技术官 Fabian Hedin 表示,其评估发现 Sonnet 5.5 所需的工具调用次数约减少 三分之一,shell 执行次数约减半 完成编码任务。
Base44 发现,在 118 个真实应用程序构建中,Sonnet 5.5 在平均每次构建仅需 3.6 次迭代的情况下,即达到了与 Opus 5 相当的结果,而 Opus 5 需要 7.7 次迭代;同时,Sonnet 5.5 在所比较的模型中产生的失败工具调用次数最少。
这些数字凸显了企业部署 AI 智能体时一个日益重要的考量因素:token 价格仅揭示了故事的一部分。每一次不必要的工具调用、失败操作及重试,都会增加延迟、基础设施成本,并为自主工作流偏离正轨再添一次机会。
围绕日常前沿模型的价格战正日趋激烈。
Sonnet 5.5 的发布也正值面向低于最昂贵前沿层级模型的市场竞争日益白热化之际。
OpenAI 上周发布了 GPT-6 Sol。 目前其标准 API 定价与 Sonnet 5.5 相同,均为每百万输入 token 2 美元、每百万输出 token 10 美元,另加每百万缓存输入 0.20 美元、每百万缓存写入 2.50 美元。
OpenAI 将 Sol 定位于复杂编码与智能体工作流,并为其配备 105 万 token 的上下文窗口。
谷歌则在 headline 价格上同时压低了这两家公司的报价,推出了 Gemini 3.8 Flash。该模型目前以优惠价提供,至 2026 年底均为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元;谷歌表示,自 2027 年 1 月 1 日起,标准定价将分别上调至每百万输入 token 1.50 美元、每百万输出 token 7.50 美元。
近期,中国电子巨头及快速崛起的 AI 研究实验室 小米(Xiaomi)发布了其前沿级 MiMo-V2.6-Pro 模型及中端 Flash 模型。 这些模型采用宽松且对企业友好的 MIT 许可证发布,意味着企业与开发者如今可免费下载这些模型,并按自身需求自由定制,无需向小米支付任何费用;通过 API 调用时,它们仍是全球范围内最具性价比的模型之一。
模型 | 输入(美元/百万) | 输出(美元/百万) | 总计(美元/百万) | 来源 |
0.10 美元 | 0.20 美元 | 0.30 美元 | ||
MiMo-V2.6-Flash | 0.14 美元 | 0.28 美元 | 0.42 美元 | |
GPT-6 Luna | 0.10 美元 | 0.50 美元 | 0.60 美元 | |
DeepSeek-V4.1-Flash — 非高峰时段 | 0.15 美元 | 0.60 美元 | 0.75 美元 | |
MiMo-V2.6-Pro | 0.435 美元 | 0.87 美元 | 1.305 美元 | |
MiniMax-M3 | 0.30 美元 | $1.20 | $1.50 | |
LongCat-2.0 — 限时促销 | $0.30 | $1.20 | $1.50 | |
DeepSeek-V4.1-Flash — 高峰时段 | $0.30 | $1.20 | $1.50 | |
DeepSeek-V4-Pro — 非高峰时段 | $0.66 | $1.98 | $2.64 | |
LongCat-2.0 — 标准版 | $0.75 | $2.95 | $3.70 | |
Gemini 3.7 Flash — 截至2026年12月31日 | $0.75 | $3.75 | $4.50 | |
Gemini 3.8 Flash — 截至2026年12月31日 | $0.75 | $3.75 | $4.50 | |
DeepSeek-V4-Pro — 高峰时段 | $1.32 | $3.96 | $5.28 | |
Muse Spark 1.1 / 1.2 / 1.3 | $1.25 | $4.25 | $5.50 | |
GLM-5.3 | $1.40 | $4.40 | $5.80 | |
Grok 4.7 — ≤200K 提示词(prompt tokens) | 2.00 美元 | 6.00 美元 | 8.00 美元 | |
Qwen3.8-Max | 2.00 美元 | 6.00 美元 | 8.00 美元 | |
Gemini 3.7 Flash — 自2027年1月1日起生效 | 1.50 美元 | 7.50 美元 | 9.00 美元 | |
Gemini 3.8 Flash — 自2027年1月1日起生效 | 1.50 美元 | 7.50 美元 | 9.00 美元 | |
GPT-6 Sol | 2.00 美元 | 10.00 美元 | 12.00 美元 | |
Claude Sonnet 5.5 | 2.00 美元 | 10.00 美元 | 12.00 美元 | |
Grok 4.7 — >200K 提示词(prompt tokens) | 4.00 美元 | 12.00 美元 | 16.00 美元 | |
Grok 4.7 Fast(Cursor)—— ≤256K 输入 | 4.00 美元 | 12.00 美元 | 16.00 美元 | |
GPT-5.4 | 2.50 美元 | 15.00 美元 | 17.50 美元 | |
Kimi K3 | 3.00 美元 | 15.00 美元 | 18.00美元 | |
Claude Opus 5.5 | 4.00美元 | 20.00美元 | 24.00美元 | |
Grok 4.7 Fast(Cursor)——输入长度超256K,最高达500K | 6.00美元 | 18.00美元 | 24.00美元 | |
Sakana Fugu Ultra(≤272K) | 5.00美元 | 30.00美元 | 35.00美元 | |
Claude Opus 5.5——快速模式 | 8.00美元 | 40.00美元 | 48.00美元 | |
Claude Fable 5 / Claude Mythos 5 | 10.00美元 | 50.00美元 | 60.00美元 | |
Claude Fable 5.1 / Claude Mythos 5.1 | 10.00美元 | 50.00美元 | 60.00美元 | |
GPT-6 Astra——标准模式 | 10.00美元 | 50.00美元 | 60.00美元 | |
GPT-6 Astra——快速模式 | 20.00美元 | 100.00美元 | 120.00美元 |
这意味着Anthropic并非仅靠提供最便宜的token来赢得本轮竞争。相反,Sonnet 5.5提出了更广泛的效率论点:即使其每token定价保持不变,一个能在更少推理步骤、更少token及更少工具调用次数内完成任务的模型,仍可实现更低的总体运营成本。
该论点也标志着与最初Sonnet 5发布时的转变。Anthropic于6月以每百万token输入2美元、输出10美元的优惠价格推出Sonnet 5,随后于8月将该价格定为永久价格,而非按原计划上调至3美元/15美元。
更强的网络能力带来更严格的限制
性能提升伴随着一项显著的安全性变更:Sonnet 5.5是Anthropic首款采用与其最高能力系统相同网络安全防护机制发布的Sonnet系列模型。
Anthropic表示,常规软件开发和漏洞修复应能继续正常运行,但部分高风险网络安全请求将自动回退至Sonnet 5。该公司计划扩展其“网络验证计划”(Cyber Verification Program),以便经批准的防御人员可访问Sonnet 5.5、Opus 5.5及其Mythos系列模型中更高级的能力。
Anthropic还正在引入旨在防止其所谓 “模型蒸馏攻击” 在此类攻击中,攻击者试图通过以工业级规模查询目标模型来复现其能力。 批评者 指出 许多现代开源大语言模型(open LLMs)的训练数据源自他人生成的内容;而Anthropic公司此前已未经众多作者及版权持有者的明确同意或支付报酬,大规模摄入受版权保护的数据——因此,Anthropic在伦理与道德层面均处于弱势地位,难以主张仅凭自身模型输出衍生出新模型的行为属于某种犯罪或错误。
Sonnet 5.5 是首款搭载专为阻止推理过程提取而设计的分类器的 Sonnet 系列模型;同时,Anthropic 正在扩展其“受保护思维”(preserved thinking)系统,以确保推理过程无法脱离创建该推理的账户而被分离。生物学相关防护措施与 Sonnet 5 保持一致。
可在所有主流云平台获取
Claude Sonnet 5.5 将通过 Anthropic 公司以及 Amazon Web Services、Google Cloud 和 Microsoft Azure 提供,并支持零数据留存(zero-data-retention)。开发者可通过 Claude 平台使用模型标识符 claude-sonnet-5-5访问该模型。
Anthropic 表示 Claude Haiku 5.5——面向高吞吐量尤其是对成本高度敏感的工作负载——将在未来数周内推出。
然而,对于企业开发者而言,Sonnet 5.5 可能才是该系列中更具影响意义的部分:这并非因为 Anthropic 大幅下调了其 API 费率,而是因为该公司正努力使中端层级模型的性能足够接近高端层级模型,从而令大量工作负载不再需要升级至更高层级。
JOTO 企业落地观察
- 对企业部署而言,Sonnet 5.5 的核心价值在于‘任务级成本压缩’——Box、Zendesk 等客户实测显示其在不改提示词前提下,token 使用量减少12%–14%、步骤数减少约1/3,意味着企业可将原需 Opus 的日常任务迁移至 Sonnet 层级,显著降低 API 账单与基础设施负载。
- 对智能体工程而言,Sonnet 5.5 在 Terminal-Bench 和 CursorBench 中工具调用频次大幅下降(如 Lovable 测得调用减1/3、shell 执行减半),直接缩短智能体执行链路、减少失败重试风险,为构建高可靠自动化工作流(如工单处理、代码生成)提供了更稳健的中端基座。
- 对 AI 安全治理而言,Sonnet 5.5 首次在 Sonnet 系列中启用与 Opus 同级的网络安全防护,并引入防推理提取分类器及‘受保护思维’机制,表明 Anthropic 正将高端模型的安全架构向下渗透;但其未解决训练数据版权争议,安全强化与伦理短板并存,企业需审慎评估合规边界。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


