突发!Sonnet 5.5发布:智能超越Fable5.1和GPT-6 Astra,设计品味审美接近opus 5.5
Anthropic发布Claude Sonnet 5.5,速度比Sonnet 5快30%以上,单任务成本最多降低30%。它在Terminal-Bench 4.0编程评测中得分70.6%,远超Sonnet 5的10.3%;在GDPval-AA知识工作测试中仅比Opus 5.5低2分,显著优于Sonnet 5。该模型支持零数据留存,已上线AWS、Google Cloud与Azure。
Claude 5.5家族新成员
Anthropic发布Claude Sonnet 5.5,速度比Sonnet 5快30%以上,大部分工作的成本最多降低30%。
它是Claude 5.5家族的第二个模型,是Claude Opus 5.5的低成本、高速度搭档。
Opus 5.5面向需要仔细判断的复杂工作;Sonnet 5.5最擅长边界清晰的日常任务、修bug,以及制作文档、幻灯片和电子表格。
它在设计上,审美和品味同Opus 5.5接近,相对于Sonnet 5有巨大提升。

双A测试智能分数max档位表现非常凶残,直接超越Fable 5.1和GPT-6 Astra。
Claude Haiku 5.5面向大批量、成本敏感的应用,将在未来几周加入这个家族。
性能表现
Sonnet 5.5在Terminal-Bench 4.0上得分70.6%,Sonnet 5是10.3%。这是一项智能体编程评测。
它在长程任务和图像理解上表现也不错。
它是第一个只看截图就通关《宝可梦 红》的Sonnet模型。
在各个领域,Sonnet 5.5都超过Sonnet 5,有些地方幅度很大。
在若干评测中,Max强度下的Sonnet 5.5表现与Opus 5.5相当。
不过官方也说明,基准分数只反映模型能力的一个侧面。
在Anthropic自己的测试和外部测试者的测试中,面对需要持续判断的复杂开放式工作,Opus 5.5依然明显更强。

官方用图表画出了每个模型在各个强度档位下的得分和单任务成本。
强度调高,模型通常工作更久,单任务成本更高,分数一般也更高。
点越靠近图的左上角,每一美元换来的能力就越多。
在多项基准上,Sonnet 5.5在Low或Medium强度下,就超过了Sonnet 5的最高分,单任务成本只有后者的十分之一左右。
它和Opus 5.5搭配最合适的场景是低强度档位,这时单任务成本更低。
在更高档位,两者表现可以相当,成本也相近。

编程能力跃升
Sonnet 5.5在编程上的进步最明显。
在FrontierCode上,High强度下,它比同档位的Sonnet 5高10分,单任务成本约为后者的十五分之一。

CursorBench测试的是Cursor真实编程会话里的任务。它的最佳成绩和Opus 5.5相差约两分。


早期测试者说,它理解代码库的速度很快。
它的效率也让测试者印象深刻。
在正面对比中,它比Sonnet 5更常把多个工具调用合并在一起,步骤更少,成本更低。
知识工作能力
GDPval-AA测试模型在9个主要行业、44种职业中的真实任务。

Sonnet 5.5只比Opus 5.5低两分,几乎持平,比Sonnet 5高出约400分。
它在计算机使用和图表识别上接近Opus 5.5。
在长程知识工作上,它明显超过Sonnet 5和GPT-6 Sol。
早期测试者还提到一些难以量化的改进。
他们觉得它是更自然的对话伙伴,在设计上有一套。它会给用户界面增加细节打磨,还能照着幻灯片模板做出几乎不用改的演示文稿。
一项内部测试中,Anthropic给它一家上市公司的季度财报材料和电话会议记录,加上一份幻灯片模板,要求做一份10页的运营回顾。
两位专家评审后认为,它的初稿可以直接发送。
协作与响应特性
和Opus 5.5一样,Sonnet 5.5比上一代模型写得更清楚。
早期测试者说,它比Sonnet 5更适合做协作伙伴。
速度快,也适合在较简单的任务上快速迭代。
成本与速度优势
Sonnet 5.5的定价和Sonnet 5相同:每百万输入token 2美元,每百万输出token 10美元,每百万token缓存读取0.20美元。
但完成同样的工作,它通常需要少得多的token。
官方测试显示,单个任务的成本最多比上一代低30%。
输出速度比Sonnet 5快30%以上,是目前最快的Sonnet模型。
价格对比(每百万token):
| Claude Sonnet 5.5 | Claude Opus 5.5 | |
|---|---|---|
| 缓存读取 | $0.20 | $0.20 |
| 缓存写入 | $2.50 | $5 |
| 输入token | $2 | $4 |
| 输出token | $10 | $20 |
调整强度档位,可以在成本、速度和整体质量之间取舍。
Claude Code和Claude的各个应用默认强度是Medium,Claude Platform默认是High。
强度低时,Claude回答更快,用的token更少,适合日常工作。
强度高时,Claude推理更久,检查工作也更仔细。
安全增强:蒸馏防护
蒸馏攻击指攻击者用成千上万个虚假账号,大规模提取模型能力。
Sonnet 5.5比上一代强得多,是第一个上线时带有防止推理提取的安全分类器的Sonnet模型。
Sonnet 5.5还扩展了保留式思考,让Claude的思考内容无法脱离创建它的账号。
大多数开发者不会感觉到变化。
如果你在账号之间迁移对话,包括在Claude Code里中途切换账号,官方文档里有一篇文章专门说明这项改动。
部署与使用方式
和Opus 5.5、Sonnet 5一样,Claude Sonnet 5.5支持零数据留存。
Claude Sonnet 5.5现已在所有平台上线,包括Amazon Web Services、Google Cloud和Microsoft Azure。
开发者可以在Claude Platform上用claude-sonnet-5-5开始使用。
如果你之前运行Sonnet时关闭了思考,迁移到Sonnet 5.5前需要改用新的between_tools设置,它会让前置思考保持关闭。
详细看官方使用指南:https://claude.dev/blog/building-with-claude-sonnet-5-5/
JOTO 企业落地观察
- 企业若将Sonnet 5.5用于RAG知识工程中的高频问答服务,可在不牺牲质量前提下显著压降token消耗与延迟,尤其适配Medium强度档位下的日常知识检索场景。
- 该模型在CursorBench等真实编程会话中逼近Opus 5.5的表现,意味着企业在构建AI原生开发助手时,可基于任务复杂度动态路由:简单补全与文档生成交由Sonnet 5.5,复杂逻辑重构仍交由Opus 5.5,形成成本可控的混合推理架构。
- 其内置的蒸馏防护与保留式思考机制,降低了企业私有化部署中因账号共享导致的推理泄露风险,为FDE驻场共创中多角色协同调试提供了更安全的上下文隔离基础。
- “设计品味审美接近Opus 5.5”这一特性,表明其在UI生成、PPT排版等非结构化产出任务中具备稳定风格一致性,有利于企业统一品牌视觉资产的自动化生产流程建设。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


