刚刚,Claude Opus 5正式发布。实际体感总体智能水平逼近Claude Fable 5,但价格仅为后者的一半,绝大部分跑分超过fable 5,简单理解,opus 5更擅长编程,Fable 5是通用型选手,跑分只能说明部分问题
我来个快速总结:
Opus 5专为日常高频使用设计,运行效率远超其他模型。与前代Opus 4.8相比,它在保持成本不变的情况下,性能实现了巨大飞跃。它在类似或更低的每任务成本下,优于其他模型:
在核心的软件工程任务上,Opus 5表现惊艳。在Frontier-Bench评估中,Opus 5超越了所有其他模型,以更低的单任务成本将Opus 4.8的性能翻了一倍以上。
在CursorBench 3.2测试中,开启最大努力程度的Opus 5得分与Fable 5的峰值仅差0.5%,但单任务成本只有一半。
在高级和最高设定下,它在给定成本下的表现也完胜所有对手。唯一落后于Mythos 5的领域是网络安全任务。
知识工作和解决问题能力同样迎来了碾压式的升级。在要求模型解决全新问题的ARC-AGI 3评估中,Opus 5的得分是第二名模型的三倍。
在衡量完整业务任务处理能力的Zapier自动化测试中,同等成本下Opus 5的通过率大约是第二名的1.5倍,哪怕在最低努力设定下,它通过的任务数也比任何其他模型都要多。
在OSWorld 2.0电脑操作基准测试里,Opus 5在任何成本下都超越了所有模型,仅仅花了三分之一的成本就打破了Fable 5的最佳成绩。
科研领域的进步同样显著。Opus 5在结构生物学、有机化学和生物信息学等所有生命科学评估中全面超越Opus 4.8。特别是在推断分子结构等有机化学任务上,得分提高了10.2个百分点。在预测蛋白质序列变异影响方面,得分也提高了7.7个百分点。视觉输出能力也得到了大幅度强化。
Opus 5最大的特点在于极强的自我验证和迭代能力。在早期测试中,研究人员故意给了Opus 5一张机器零件图纸并要求其用代码重建3D模型,同时切断了它直接查看图纸的途径。Opus 5立刻自己写了一个计算机视觉管道,从原始像素中提取几何图形,完美重建了零件。同样条件下的竞品尝试了五次全部失败。
在修复知名开源项目漏洞时,Opus 5精准挖出了根本原因并修复了社区补丁遗漏的边缘情况,竞品仅仅修复了表面症状就草草交差。一家交易公司的工程师让Opus 5为新交易所构建市场数据流,由于缺乏实时数据验证,Opus 5直接自己搭了一个测试工具来检查代码解析是否正确。以前的模型面对这种任务完全无从下手。
根据A厂自动化行为审计,Opus 5 是迄今为止最符合一致性的模型。与的其他模型相比,它表现出最低的鲁莽或欺骗行为率:
Opus 5目前已在全平台上线。定价与Opus 4.8完全一致,输入每百万Token收费5美元,输出每百万Token收费25美元。追求速度的开发者可以使用Fast模式,运行速度提升2.5倍,价格按基础费率两倍计算。
随同Opus 5一起发布的还有两项API更新。现在开发者可以在对话中途更改Claude可用的工具,这不会让提示词缓存失效。API还加入了自动回退机制,如果请求被安全分类器拦截,系统会自动将请求路由到其他最佳可用模型,彻底避免请求被直接阻断。在通用访问权限下,Opus 5没有数据保留要求。
Opus 5提示词编写
为了让开发者彻底榨干Opus 5的潜力,官方同步发布了全新的提示词编写指南。
我挑一些重点说一说,
Opus 5极其擅长处理复杂的多文件重构和端到端代码任务。它在代码审查时精准度极高,能找出大量真实的Bug。如果你在提示词里要求它保守一点,它会严格遵从指令导致漏报Bug。正确做法是让它报告所有问题,之后再手动过滤。
对于视觉任务,Opus 5极度擅长图表理解和前端视觉复刻。以前为旧模型设计的视觉提示词技巧现在基本作废。给模型配备裁剪和视觉验证的工具,比单纯让模型思考要划算得多。
Opus 5默认的话痨属性非常明显。降低努力程度参数只会减少它的思考量,并不能有效缩短可见的输出文本。你需要直接给出指令要求它保持简短,生成的商业文档也需要明确要求它不要填充废话。执行任务时,Opus 5喜欢实时播报进度。你可以明确规定它只需在发现重要信息或改变方向时才进行简短汇报。
千万不要在提示词里要求Opus 5仔细检查或者进行最终验证。它本身就会自动纠错和验证,多余的指令只会让它过度验证,白白浪费Token。对于范围明确的小任务,必须严格限制它的工作边界,防止它自我发挥增加不必要的步骤。
Opus 5极其喜欢召唤子智能体。对于大型独立任务这绝对是提效利器,但用在小任务上会让成本翻倍。如果你的系统支持子智能体,必须设定明确的调用上限。
当模型在高级或更低设定下关闭思考模式时,可能会出现副作用。模型偶尔会把工具调用代码直接写进文本里,或者泄露内部XML标签。最简单的解决办法是允许它在调用工具前说一句话,并添加一条全局指令禁止它输出任何内部XML标签,注意全局指令中不要具体点名某种标签的名称,模糊处理效果最好。
详细提示词指南看这里:
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
总体来看,鉴于fable 5各种限制,opus 5应该可以敞开用,感觉codex 接下来又要重置了
--end--
