7月17日,Boris Cherny发了条推。就是那个写出Claude Code第一行代码的人,现在是Claude Code的负责人。

推文就两句话:"我每天都在跟其他公司的工程师聊,听到的永远是同一件事:有一个人用Claude把产出干到了10倍,但组织的其他人还没跟上。看了这么多团队采纳AI,我发现大家走的都是同样的4步。"
然后他把这4步画成了一张表,用Claude Code的Artifact功能发布的——不是PDF,不是博客,就是一个网页链接。几个小时里,21万浏览、近3000个赞、4700多次收藏。收藏数比点赞数还高,这个信号很说明问题:大家不是看个热闹,是存下来准备对照自查的。
我把那张表翻来覆去看了几遍,越看越觉得,这可能是今年把"企业AI落地"这件事说得最清楚的一张图。因为它没谈愿景,全在谈瓶颈。
五个状态,四步台阶
推文说4步,表里其实是五个状态,编号从0到4。为什么多一个0?因为Step 0根本不算采纳,是还没进门。原表就是六列:阶段和你的角色、agent数量、什么样子、瓶颈在哪、配套产品、护栏。我照原文整理成中文:
| 0: Gated | |||||
| 1: Assisted | |||||
| 2: Parallel | |||||
| 3: Supervised autonomy | |||||
| 4: AI-native |

原表在每两行之间还各夹着一条过渡说明——"怎么从这步爬到下一步",那才是四步台阶的"台阶"本体,下一节单独说。
Step 0这一行我见得太多了。做过国企和大客户交付的都懂:不是工程师不想用,是门就没开。瓶颈那格写得相当不客气——只盯每token成本、不看产出,决策桌上缺真正懂技术的声音——对号入座的公司应该不少。
角色的演变串起来看更有意思:结对的人,到编排者,到经理的经理,到用意图掌舵的VP。这不是工具升级路线,这是职业生涯的浓缩版——只不过以前走完这条路要十几年,现在表里暗示你几年内就得走完。
升级的钥匙不是更聪明的模型
这张表里我认为最值钱的一个论断:从每一步到下一步,需要的都不是更强的模型。
从0到1,跟工程一点关系没有:高层和采购拍板对齐、把卡点往上捅,配一套让Claude安全落地的框架。从1到2,靠的是一套你敢信的自我验证循环——测试、build、lint,加上真实开发环境里的E2E,这些老古董决定了你敢不敢同时放10个agent出去,再加auto mode和自动code review。从2到3,靠的是给Claude一条自己拉上下文的路:让它读代码、读wiki、读历史讨论,把工作拆成loop和routine,让Claude去启动Claude。从3到4,靠的是把领域专属场景的自动化做出规模——代码迁移、fuzzing、功能开发、反馈修复,一类一类来。
有条日文引用推里总结了一句话,我觉得翻译过来正好:"敢撒手的范围,等于验证体系能兜住的范围。"
这跟我自己做Agent框架时的体感完全一致。我那套框架里花心思最多的地方,恰恰不是模型调用,是HITL人工介入、韧性重试、积分账本的两段扣费和全链路幂等——说白了全是护栏。当时定的架构铁律是"钱只在App API一层动,智能体服务对钱无感知",现在回头看,这就是Boris表里说的guardrail:你给agent的权限边界画得越清楚,你敢让它自动跑的范围才越大。护栏不是限制,护栏是楼梯。
还有个细节值得说:Anthropic自己也才在Step 3往Step 4推,Boris说他个人刚摸到Step 4的门。做这套工具的公司,自己都没到顶。这个坦诚比任何宣传都有说服力——这是一张进行中的地图,不是营销PPT。
评论区比正文还清醒
这条推下面一百多条回复,质量意外地高,捞几条给你看。
有人说:差距根本不在技能,在于担当。那个10x的人是自己决定了要为Claude交付的东西负责,出了问题自己背;其他人还在等别人批准他们为自己没敲过的代码负责。"采纳首先是个责任问题,其次才是工具问题。" 这条我愿意给满分,比原推还狠。
还有人观察:那个10x的人不是prompt写得更好,是把整个工作循环重建在验证之上——agent跑活,他把时间花在review和抓低级错误上。其他人还在把AI当自动补全用,一次补一个函数,所以收益永远出不了个人。
有个团队现身说法:我们卡在Step 3,往4走的真正阻碍是成本。他们被迫把一部分活切给便宜10倍甚至50倍的开放模型,质量只掉5%到10%。这条很扎实——表里写的瓶颈是"信任",现实里瓶颈经常是账单。
技术上说得最到位的一条:"auto mode很容易,端到端验证才是真正的解锁。没有review和worktree隔离,加agent只是在放大爆炸半径。"
当然也有段子:"AI采纳曲线的真实版本:一个人风生水起,九个人在约会议讨论他。"
对着表照了照自己
我个人的工作流大概在Step 2和3之间:并行agent、worktree隔离、自动review这些都在用,但"Claude自己调用Claude、后台常驻跑维护"这一层,我还在小规模试,规模上不去的原因跟上面那条评论一样——心疼token。

十个agent交叉review

但如果把视角切到国内大部分企业,说句实话:多数团队还在Step 0和1之间徘徊。卡住他们的不是模型能力,是审批流程、安全评估、数据出境这些门槛。所以看这张表别急着焦虑1000个agent的事,先问三个朴素的问题:测试覆盖够不够让你敢开auto mode?CI够不够快、够不够稳?代码review的标准,AI写的和人写的是不是同一套?这三个问题answer不好,后面的每一步都是空中楼阁——没有绿灯的测试,auto mode就是裸奔。
老工程师看这张表还会看出另一层东西:从Step 2开始,稀缺能力就不再是写代码了,是拆解任务、设边界、建验证、管成本。这些活以前叫什么?叫架构,叫工程管理。干了十几年攒下的这些老本行,在agent时代不但没贬值,反而成了从10到100那几步的硬通货。
个人10x靠的是胆子,组织10x拼的是制度。模型是买来的,护栏得自己修。
