Claude Opus 5发布:只给4句话,它自己干了8小时
Anthropic于7月24日发布Claude Opus 5,该模型在保持低价的同时接近Fable 5性能。其核心突破在于长程任务自主性:仅凭4句提示,8小时内生成7万行代码,完成含昼夜循环的420万格3D地图浏览器,并能主动补全工具链、修复边缘缺陷、构建测试环境。评测显示其任务交付能力提升,但事实幻觉率升至50%,高风险能力仍受限。
Opus 5的核心突破:从响应指令到推进任务
Anthropic 在 7 月 24 日发布 Claude Opus 5。官方的说法很直白:它接近更高端的 Fable 5,但价格只有一半;在 Claude Max 里,它也已经成为默认模型。
不过,最能说明这次变化的,不是发布会上的排行榜,而是 Anthropic 首席产品官 Mike Krieger 分享的一次实测。
4 句话 → 8 小时 → 7 万行代码
420 万格地图 → 6 秒内加载 → 60fps
Krieger 小时候喜欢《运输大亨》。他让 Opus 5 为旧存档做一个网页版 3D 浏览器,好让自己走进地图里,看列车照常运行。提示词只有四句话。
8 小时后,模型写出了约 7 万行代码:420 万格的世界能在 6 秒内加载,并保持 60 帧运行。更有意思的是,它还在没有被要求的情况下补上了昼夜循环。
这不是一场严格对照实验,而是负责人公开分享的单次案例,不能直接外推到所有任务。但它清楚地指向了一个变化:模型不再只等你把工作拆成十几步,而是能在较长时间里自己发现“下一步该做什么”。

它不是“写得更快”,而是“更会把活干完”
过去用 AI 做复杂项目,人的主要工作常常不是提需求,而是当项目经理:拆任务、催进度、对结果、找漏项,再把错误退回去重做。
Opus 5 想把其中一部分“脚手架”吸收到模型内部。Anthropic 给出的三个官方案例很有代表性:
- 看不到图,它先给自己造眼睛。任务要求根据机械零件图重建 FreeCAD 3D 模型,却故意不给模型直接看图的工具。Opus 5 先从原始像素写了一套视觉处理流程,再完成重建。
- 修 bug,不只盖住表面。面对一个流行开源包管理器的真实问题,它不仅找到根因,还补上了社区原修复遗漏的边缘情况。
- 没有真实数据,它先造测试台。为一家交易公司接入新交易所行情时,现场没有可用的实时 feed,模型便自己搭建测试工具,验证解析逻辑。
用更日常的话说:以前的 AI 像一个聪明但需要盯着的实习生;这次它更像会主动做复核的执行者。它仍然会犯错,但你不必为每一步都写成操作手册。
为什么“4句话”比跑分更重要
跑分告诉我们模型“能不能”,长任务案例才更接近现实里的“能不能交付”。这会影响的不只是程序员。
- 老师可以先给课程目标、学生水平和验收标准,让模型产出教案、练习与分层讲解,再要求它检查难度是否连贯。
- 内容创作者可以交付选题、受众和事实边界,让模型完成资料整理、结构、初稿与引用核对,而不是每一步重新对话。
- 创业团队则要重新审视产品护城河:如果产品价值主要来自“把模型包起来、多放几个代理互相检查”,底层模型正在吃掉这部分价值。真正难替代的,会更接近客户、私有上下文、可信流程和行业判断。
我们的编辑判断是:提示词没有消失,只是从“逐步遥控”转向“目标、边界和验收”。四句话之所以有效,不代表随便说四句话都有效;它说明,在目标足够清楚的任务上,模型开始承担更多过程管理。
更强,也更便宜,但要看“成功一次多少钱”
Opus 5 的 API 定价与 Opus 4.8 相同:每百万输入 token 5 美元、输出 token 25 美元。Fast 模式约快 2.5 倍,价格翻倍。开发者还能从 low、medium、high、xhigh、max 五档 effort 中,选择更省 token,或让模型多想一会儿。
独立评测机构 Artificial Analysis 给出了更有用的补充:Opus 5(max)在其 Intelligence Index 得分 61,与 Fable 5 的 60 基本持平;但完成一项评测任务的平均成本是 2.03 美元,并不是所有较低 effort 档都占优。
所以别只看“每百万 token 多少钱”。对真正的工作,应该比较:完成一次合格任务用了多少轮、返工几次、人工接管多久,以及最后有没有通过验收。便宜但总失败的模型,往往最贵。


别急着神化:它在事实问题上仍会自信犯错
同一份 Artificial Analysis 报告还有一个不那么好看的结果:在 AA-Omniscience 事实知识评测中,Opus 5 的准确率比 Opus 4.8 提高了 7 个百分点,但它在不确定时更愿意回答,幻觉率反而上升 14 个百分点,达到 50%。
这两个结果并不矛盾。一个模型可以更会规划、写代码和使用工具,同时仍会在事实缺口上给出听起来很完整的错误答案。尤其是医疗、法律、财务、新闻与公司信息,仍应要求一手来源,并让人检查关键结论。
另外,Anthropic 明确说明:Opus 5 在高风险双用途能力上仍落后于 Mythos 5,网络安全等特定请求可能被分类器拦截或回退到 Opus 4.8。自动回退能让流程不中断,却不会替你承担验收责任。
AI 开始替你推进工作以后,最稀缺的能力不是“会不会提问”,而是能不能说清目标、边界和验收。
过去一年,我们习惯把大模型理解成“更聪明的聊天框”。Opus 5 给出的新信号是:前沿模型正在从回答问题,转向持续推进任务。
它还没有可靠到可以放任,也没有万能到四句话能解决所有问题。但当模型开始自己检查、自己纠错、自己寻找下一步,人的角色就会往上移动:定义什么值得做,什么绝不能做,以及怎样才算真正完成。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


