JOTO
联系我们
← AI 智库
大语言模型

Anthropic 发布 Claude Opus 5:面向编码、智能体与企业工作流的高性价比旗舰模型

2026 年 7 月 24 日 · VentureBeat AI · 12 分钟阅读

Anthropic 推出 Claude Opus 5,以 Opus 4.8 同价实现近 Fable 5 的智能水平,主打编程、智能体任务与企业级工作流,在 Frontier-Bench 等基准中性能翻倍、成本减半,强调 token 效率与可验证自主性。

Anthropic launches Claude Opus 5, a cheaper AI model for coding, agents and enterprise workflows

Anthropic 发布了Claude Opus 5 ,该公司称该模型能以一半成本提供其顶级模型Claude Fable 5 几乎全部的智能水平——此次发布标志着AI竞赛正从原始能力转向日常使用的经济性。

该模型即日起在Anthropic所有平台上提供,定价为每百万输入token 5美元、每百万输出token 25美元,与其前代产品 Opus 4.8保持一致。它将成为Anthropic高端消费级服务 Claude Max的新默认模型,也是 Claude Pro上可选用的最强模型。

这一定位是刻意为之。Anthropic并未宣称 Opus 5 是其最智能的模型——这一头衔仍属于 Fable 5,且竞品系统在某些领域仍具优势。相反,该公司提出了一个更微妙但对企业买家可能更重要的论点:最具经济重要性的AI工作发生在中等难度区间,此时以高效、低成本交付的近前沿智能,优于以高昂成本交付的前沿智能。

“Opus 5作为你的日常主力模型,是你交付复杂任务并待其完成后进行审阅的模型,”Anthropic一位发言人接受VentureBeat采访时表示,描述了该公司当前产品线的分层结构:“Fable 5用于你最具雄心的工作,即持续数天的自主项目,此前没有任何模型能够承担……Sonnet 5用于规模化运行的工作,其速度与每次调用的成本决定了哪些功能可以上线;Haiku 4.5则用于子智能体及即时响应。”

Claude Opus 5基准测试结果与Fable 5及竞品AI模型的对比

纸面上,结果令人瞩目。Anthropic表示 Opus 5 在编程与知识型工作评估(包括 Frontier-BenchGDPval-AA)中创下新的业界最佳成绩。在 Frontier-Bench v0.1——一项面向智能体终端编程的基准测试中,Opus 5得分为43.3%,超过Opus 4.8的18.7%逾一倍,亦大幅领先Fable 5的33.7%——且单任务成本更低,据该公司称。在面向新颖问题求解能力评估的 ARC-AGI 3中,Anthropic报告Opus 5得分是次优模型的三倍。在计算机使用基准测试 OSWorld 2.0中,该公司称该模型以略高于三分之一的成本超越了Fable 5的最佳成绩。

这些数据附带了坦率的免责声明,而此类坦率本身在惯于使用最高级形容词的行业中便已引人注目。Anthropic承认 Opus 5 在网络安全任务与生物学研究方面仍落后于竞品模型 Mythos 5,且一款OpenAI系模型仍在某项智能体编程基准测试中保持领先。

更具揭示性的免责声明来自Anthropic自身,当被问及 Opus 5 在哪些方面仍不及 Fable 5时。该发言人的回答实质上坦率承认了基准测试所能及与不能及之处。

“Opus 5胜出的评测项目均为具有明确结果的限定性任务,而这正是其最强项。但这些评测未衡量的是任务持续时间,”该发言人告诉VentureBeat。“换言之:Opus 5是评测所能覆盖任务的最佳工具,而Fable 5则是当任务超出评测范围时你所选择的模型。”

Fable 5则‘适用于最长、最自主的任务,此时模型需在数小时乃至数天内,面对密集的源材料,在大量相互关联的步骤中保持连贯性’,该发言人建议客户‘在代表性工作负载上同时运行两者:一项限定性任务与一项长周期任务。’这种‘限定性任务’与‘长周期自主性’的框架,或将成为2026年模型差异化的核心轴线,因为基准测试日趋饱和,而剩余最难问题涉及的是持续多日的智能体工作,而非离散型谜题。”

为何token效率正成为企业AI支出的真实主战场

贯穿此次发布的是一条Anthropic显然希望买家领会的主题: Opus 5 Opus 5 不仅得分高,而且单位美元得分更高。该模型配备可调节的“努力程度”(effort)设置,允许客户在智能性与推理速度及 token 消耗之间进行权衡;Anthropic 的图表强调的是特定成本下的性能表现,而非仅关注峰值性能。

早期客户以不同寻常的具体性呼应了这一观点。法律领域人工智能公司 Harvey 表示,据其应用研究主管 Niko Grupen 称,Opus 5 在平均生成 token 数量减少 26% 的情况下,实现了与 Opus 4.8 最大推理模式相当的性能。Fundamental Research Lab 的 Richard Pham 表示,在难度较高的金融建模任务中,该模型平均准确率高出九个百分点,“同时使用的回合数(turns)和工具调用(tool calls)约为此前模型的三分之一,耗时减少 60%。”

自动化平台 Zapier 首席执行官 Wade Foster 表示,Opus 5 在其公司 AutomationBench 排行榜上登顶,“且所消耗的 token 数量并未超过此前各代 Claude 模型”,完整运行了一整套从始至终的客户流失预防工作流。“此前各模型均未通过;Opus 5 达到了 100%”,他说道。开发 Devin 编程代理的公司 Cognition 首席执行官 Scott Wu 表示,在 FrontierCode 1.1 基准测试中,“Claude Opus 5 以一半成本达到了接近 Fable 级别的性能”,尤其在调试与根本原因分析方面表现突出。

对效率的强调反映了商业现实:企业级 AI 支出已不再属于实验性质,而推理成本——即大规模实际运行这些模型的价格——已成为董事会层面的关键支出项目。 

Anthropic 的业务高度集中于 API 和企业级应用;根据 Contrary Research于 2026 年 2 月发布的一项分析,截至 2025 年底,Claude 占据企业级大语言模型市场约 40% 的使用份额;仅 Claude Code 一项的年化收入已达约 10 亿美元。对于一家按 token 计费的公司而言,一个能以更少 token 完成更多任务的模型并非锦上添花,而是核心产品本身。

自验证型 AI 代理及其对自动化隐性成本的影响

除数据之外,Anthropic 正在销售一种行为叙事:即 Opus 5 会验证自身工作,并持续迭代直至成功。该公司提供了若干来自测试的示例,读起来宛如关于机器固执的小寓言。

在一项 Frontier-Bench 任务中,模型被要求仅凭一张故意无法查看的图纸重建某个机械部件的 3D CAD 模型。Anthropic 表示,Opus 5 并未失败,而是自行编写了一套计算机视觉流水线,从原始像素中提取几何结构——且反复执行该操作,而其他竞争模型在五次尝试中均未能解决该任务。在另一案例中,面对一个流行开源包管理器中的真实缺陷,该模型不仅定位了根本原因,还修复了一个社区自身补丁所遗漏的边界情况;而某竞争模型仅修补了表象症状便宣告成功。该公司称,一家交易公司的工程师曾使用 Opus 5 在单次会话中构建了一个新交易所的市场数据馈送系统;由于缺乏实时馈送可供验证,该工程师观察到模型自行构建了一套测试框架来检验其解析代码。

客户也在实际应用中描述了类似行为。Stripe 公司资深软件工程师 Cristian Rivera 表示,他曾在一个周末将该模型委任为“其开发环境的首席幕僚”:“它自行构建了监控系统,驱动每一台服务器,并仅在需做出判断性决策时才将我拉入。”

这正是企业真正关心的能力,值得深入探讨其原因所在。一个仅能输出看似合理结果的模型,与一个能验证自身输出的模型之间的差距,正是演示原型与可部署系统之间的差距。当前企业级 AI 的大部分隐性成本在于人工审核——工程师检查机器的工作成果。一个能可靠自查其工作的模型可压缩此类成本,这恰恰解释了为何客户反复强调的是更少的回合数、更少的迭代次数以及更短的耗时,而非更高的原始分数。

Anthropic 安全策略的内部逻辑:能力缺口、分类器与模型回退机制

此次发布也展示了 Anthropic 日益复杂的整体安全方法——其中如今包含刻意不向其模型教授某些技能。该公司表示,其自动化行为审计发现 Opus 5 是迄今最符合对齐原则的模型,整体错位行为得分为 2.3,低于 Opus 4.8, Sonnet 5Fable 5,其欺骗性行为发生率最低,且最难被诱导滥用。

在能力层面,Anthropic 表示其刻意避免针对网络任务训练 Opus 5 ,一如对待 Opus 4.8 所做的那样。但该模型仍在此类任务上取得提升——这是通用能力增强带来的副作用——如今在发现软件漏洞方面已几乎与 Mythos 5 相当。然而,其在利用漏洞方面仍明显落后:在 Anthropic 的 OSS-Fuzz 评估中,Opus 5 发现漏洞的比率为 79.4%,接近 Mythos 5 的 80%,但在开发漏洞利用程序方面仅成功应对 4 项挑战,远低于 Mythos 5 的 13 项。这种不对称性——防御相关发现能力强、进攻相关利用能力弱——似乎是刻意设计的结果,相关安全防护措施亦遵循相同逻辑。Anthropic 预计 Opus 5 的网络安全分类器触发频率将比 Fable 5 低约 85%。

当分类器触发时, Claude.ai, Claude Code以及 Claude Cowork 中的请求默认回退至 Opus 4.8 ——由此引发一个显而易见的问题:若某请求对一个模型而言风险过高,为何对另一个模型却可接受?发言人表示:“回退所用模型能力水平较低,因此有害用途的风险也相应更低”,并补充道:“系统会在触发时向用户发出提示消息,该消息在聊天界面中可见。”

该逻辑虽可辩护,却揭示了 2026 年 AI 安全的实际运作方式:风险并非仅由问题本身决定,而是由问题与作答系统能力的乘积共同决定。在生物学领域,计算逻辑则相反。Opus 5 现已成为 Anthropic 当前面向公众提供的最具科学研发能力的通用模型——在其内部化学基准测试中得分比 Opus 4.8 高出 10.2 个百分点;不过发言人承认,“Mythos 5 在长期、开放式任务(如自主药物设计活动)方面仍是更强的模型。”

此次发布背后的商业博弈:3800 亿美元估值与巨额算力押注

此次发布恰逢 Anthropic 商业势头空前强劲——同时也肩负空前责任之时。路透社 2 月报道称,该公司在最新一轮融资中估值约为 3800 亿美元 ,此前一段时期内,据 Contrary Research 分析,其年化收入从 2024 年底约 10 亿美元攀升至 2025 年底预计的 90 亿美元,内部目标 reportedly 达 200 亿至 260 亿美元(2026 年)。这些目标依托于巨额基础设施投入,其中包括一项 据报价值 300 亿美元的 Azure 算力协议 以及与谷歌云(Google Cloud)和英伟达(Nvidia)达成的合作安排——此类支出能否成立,仅取决于企业客户是否持续扩大使用规模。

正是在此背景下,Opus 5 的定价策略才显得合理:在将价格维持在 Opus 4.8 水平的同时,关键智能体(agentic)基准测试性能大致翻倍,实质上相当于单位能力成本大幅下调,旨在拓宽经济上可行的自动化工作负载范围。此前在 Opus 4.8 成本/成功比下处于边际状态的每一项任务,在 Opus 5 下均变得可行;而每一项可行的任务,都会带来持续性的 token 收入。

监管环境也日趋复杂。本周,一名美国法官最终批准了 Anthropic 公司与图书作者就版权问题达成的 15 亿美元和解协议,据路透社报道,此举为该公司早期训练数据引发的诉讼画上了句点。而今年 6 月,路透社援引 Axios 报道称,美国政府已采取行动 阻止外国用户访问 Anthropic 最先进模型——这提醒人们,前沿人工智能如今已与出口政策深度交织,进而影响哪些客户能够购买何种产品。

本周五同步发布的还有:一种“快速模式”(Fast mode),其运行速度约为默认速度的 2.5 倍,但基础价格为默认价格的两倍;API 上的自动回退路由(automatic fallback routing);以及对话中途更改工具时不再使提示缓存(prompt cache)失效——这一细微功能,智能体(agent)开发者可能比任何基准测试结果都更看重。与此前各代 Opus 模型一致,Opus 5 对通用访问不设数据留存要求;发言人主动向那些具有“严格零数据留存要求”的客户强调了这一点。开发者即日起可通过 Claude API 以 claude-opus-5 的名称访问该模型。

有两个问题将决定此次押注能否成功:其一, Opus 5 的效率主张 能否经受住大规模生产工作负载的实际检验;其二,企业客户是否会接受这样一个世界——在其中,安全分类器(safety classifiers)而非用户,有时决定由哪个模型作答。但本周五发布所传递的更深层信息是:人工智能行业的重心已然转移。三年来,各研究实验室竞相比拼其最佳模型在理想状态下的巅峰表现;而借助 Opus 5,Anthropic 转而竞逐一项不那么炫目却远为丰厚的目标:一款非常优秀的模型,如何以一半价格、日复一日地稳定交付价值。在一个前沿边界持续移动的市场中,Anthropic 押注真正的财富,恰恰蕴藏于这前沿之后。


本文由 JOTO AI 智库从已授权的 VentureBeat AI 同步并整理。

原始来源:VentureBeat AI

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
致电我们
+86 (021) 6566 1628
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。