
160 天里,OpenAI 如何把一个 Coding Agent 扩张成跨设备的工作入口
太长不看:模型负责点火,产品负责扩圈,额度与反馈机制负责把尝鲜变成深度使用。
到了 7 月,OpenAI 又把增长单位从 Codex 单产品,扩成了 Codex + ChatGPT Work 的双产品组合。
我把 Codex 标签下的官方更新全部展开后,页面一共出现 93 张更新卡片,跨 61 个日期,从 1 月 14 日延伸到 7 月 6 日。
更加值得分析的是,这些功能节点和增长曲线一起,构成了美妙的数值,虽然后视镜终究是外部视角,也希望能给大家提供到哪怕一丢丢的启发。

公开里程碑从 2 月 5 日的 100 万活跃用户开始,到 7 月 14 日的 800 万,首尾约 160 个自然日。
期间有两条重要曲线:
1M 到 5M 基本是 Codex 自身;
6M 以后已经开始是ChatGPT和Codex合并。

| 时间 | 公开里程碑 | 同期关键变化 | 应该怎样理解 |
| 2 月 5 日 | Codex 1M 活跃用户 | App 发布 3 天;GPT-5.3-Codex 同日上线 | 桌面入口与模型升级同时点火 |
| 3 月 5 日 | 2M+ 活跃用户 | Windows 前一天发布;GPT-5.4 当天上线 | 2M 在两项更新前已达成 |
| 4 月 7 日 | 3M 周用户 | App 已成为最大入口;开始按每新增 1M 重置额度 | 分发入口与使用激活开始咬合 |
| 4 月 21 日 | 4M 活跃用户 | 4 月 16 日浏览器、Computer Use、记忆与跨天任务扩容 | 产品从编程助手向通用工作台外扩 |
| 5 月 31 日 | 5M 用户 | GPT-5.5、Chrome、手机远程、Goal Mode、Appshots | 能力、入口与任务半径一起扩张 |
| 7 月 12 日 | 6M 活跃用户 | GPT-5.6、ChatGPT Work、统一桌面 App 上线 3 天 | 产品范围已经模糊,不能再称纯 Codex |
| 7 月 13 日 | 双产品 7M 活跃用户 | Codex + ChatGPT Work,继续补充 banked reset(即“额度重置券”) | 统计单位正式换成双产品 |
| 7 月 14 日 | 双产品 8M 活跃用户 | 再次重置额度,并暂不执行 5 小时限制 | 增长、激活与统计扩围同时发生 |
OpenAI 在约 160 天里完成了四次产品换挡:
先把 Codex 从命令行搬到桌面,
再通过 Plan Mode、中途纠偏、审批机制、任务分叉与自动化,让用户既能随时干预执行过程,也能把验证过的工作流反复调用。
然后把任务入口扩到浏览器、手机和远程,
最后用 ChatGPT Work 把非技术工作也纳入同一套增长叙事。
2021年7月,在ChatGPT发布之前,Codex实际上就已经发布了,只不过那个时候它是一个GPT-3(是的,ChatGPT的版本是GPT-3.5)的代码微调版本,训练了大量的Github开源代码,可以把自然语言翻译成代码。
那会大家说它是“OpenAI Codex”,这会它还是模型,不是产品。
但是ChatGPT发布后,OpenAI发现GPT-3.5、GPT-4已经具备不错的代码能力了,不需要再单独维护一个叫Codex的模型。于是在2023年,Codex API正式关闭。
一直到2025年,OpenAI又把Codex搬了出来,官方的定义是:
A Cloud-based software engineering agent
一个云端的软件工程Agent
此时的底层模型是Codex-1(基于o3优化)
在这段时间,OpenAI发现开发者更喜欢在Terminal里工作,于是推出了Codex CLI。
官方描述就变成了:
Lightweight coding agent that runs locally in your terminal.
值得注意的是,CLI相当于Codex的一个入口,不是Codex本身。但是快速的增长基础已经开始具备:
第一次换挡:从命令行工具到多智能体桌面工作台2026年2 月 2 日,Codex App 是第一次真正的换挡。

在此之前,Codex更多的在CLI内被大家使用,我们都知道开发者之外的大部分人对着一个黑乎乎的Cli,那是老难受了,阻碍了大量的用户去使用,黄叔过去也是教大家用Claude Code,不少人都无法接受这一点。。。
2025 年 12 月 GPT-5.2 Codex 发布后,模型能力跨过了一个关键门槛:可以接手更长、更复杂的任务,一次就做完。用户开始用 tmux(终端多路复用工具)同时运行大量 Codex 会话。社交媒体上出现了一张广为流传的照片:Peter Steinberger 在三块显示器上同时开了大约 18 个终端窗口运行 Codex。
但 Codex的产品负责人Alex 意识到,只有顶尖 1% 的工程师会用终端并行的方式工作。如何让这件事变得直觉化?
最后推动项目启动的是一份说明“为什么我们认为做一个 app 是好主意”的文档。app 的具体形态是在构建过程中逐渐成形的,直到Codex正式推出。
Codex App 把多智能体、后台长任务、worktree、自动化和技能放进一个可视化界面,相当于把一套专业工具重新包装成“任务指挥中心”。这就相当丝滑了!
三天后的2月5日,Sam 宣布 Codex 超过 100 万活跃用户。这一天,GPT-5.3-Codex 也正式上线。官方强调的变化不只是编码分数,而是长任务、工具调用、过程中可纠偏,以及约 25% 的速度提升。
代表性公开评价里,Matt Shumer 感受到它“不只是在执行指令,也在做有判断的决定”。这句话很关键:用户第一次明显把它当成一个能协作的 Agent。

但第一阶段的增长不能只归给模型。App 首周下载超过 100 万,Codex 整体用户单周增长超过 60%;OpenAI 继续向 Free 和 Go 用户开放,印度市场两周内周用户增长 4 倍,OpenCode 也带来 30 万登录用户。
这就是第一阶段增长的底层逻辑:先把入口做大。

与此同时,产品也在快速补“第一次使用之后”的体验:
中途引导、文件支持、Plan Mode、并行审批、Spark、更自然的对话分叉。
3 月 4 日 Windows App 上线,第二天公开用户数达到 2M+。
第一次换挡的本质,是把“会不会用”从用户能力问题,变成产品设计问题。模型把上限抬高,App、免费入口和生态登录把潜在用户真正带进来。
也就是说,Codex App的出现,终于再一次找到了进入普通用户心智的法宝,叠加模型持续提升,和功能体验的不断优化,Codex开始起飞!
3 月 5 日,GPT-5.4 上线。它第一次把 Codex 的编码能力吸收到主线模型里,同时加入原生 Computer Use,并在 Codex 中提供实验性 1M 上下文。
发布初期的口碑非常热:有人甚至说,在 Codex 里它“可靠得离谱”!

Codex 3 月到 4 月的产品更新,重点开始从能力展示转向控制、复用和可验证:
终端上下文、自动化重构、插件、计划与审批、任务分叉,都在降低用户反复解释和人工盯守的成本。
到 4 月 3 日,App 已经超过 CLI 与 IDE,成为 Codex 最大的使用入口。
4 月 7 日,Codex 达到 300 万周用户。Tibo 同时宣布:此后每新增 100 万用户,就重置一次使用额度,直到 1000 万。

两周后的 4 月 21 日,Codex 又达到 400 万活跃用户。
Tibo重置这个动作经常被理解成“送额度”,但从增长视角看,它更像一次行为设计:
模型发布制造关注,里程碑重置额度把老用户重新拉回来,更多真实任务带来案例和问题,公开案例与快速修复再吸引下一批用户。额度不是单纯补贴,它是让核心价值再发生一次的触发器。
4 月 16 日的更新又把任务半径往外推了一大步:无需项目的对话可以直接处理研究、写作和规划;浏览器、Computer Use、文档、表格、幻灯片、PDF、记忆和跨天任务开始进入同一个工作空间。
此时 Codex 的竞争对象已经不只是另一个编程工具,而是用户每天如何启动、交付和复盘一项工作。这个准备非常重要,Codex即将要开启和ChatGPT合并的先兆!
第二次换挡的本质,是从“把答案做出来”升级为“让过程可控、结果可复用”。这也是 2M 到 4M 阶段最重要的变化。
4M 里程碑之后两天,4 月 23 日,GPT-5.5 才上线。

GPT-5.5 继续提升代理编码、工具使用和 Token 效率。
OpenAI 随后称,发布不到一周,Codex 收入翻倍。
但是模型的能力似乎已经相当不错了,真正决定增长的,是用户能不能在更多设备、更多场景里自然地发起任务,并且敢把更完整的结果交给它。
5 月的更新几乎都沿着这条线展开:
Chrome 让 Agent 进入真实网页;手机远程实现“我现在就能下达任务”;Goal Mode、Appshots 和锁定远程任务补上目标保持、过程证据与执行边界;Windows Computer Use 则继续扩大可操作环境。
5 月 31 日,公开里程碑来到 500 万用户。

这里的产品变化,比“多支持一个平台”更深。
过去,用户必须在电脑前陪着工具完成工作;现在,任务可以在桌面启动、手机查看、远程继续。
Codex 开始从一个会话工具变成一个跨设备任务系统。
非技术用户的案例也开始出现:知名博主Peter Yang分享 8 岁孩子用 Codex 做小游戏。

第三次换挡的本质,是把 Agent 从一个软件里的功能,变成随时可以调用的工作入口。
5M 之后,增长放慢了 42 天,直到 7 月 12 日才出现 6M。
6 月,Codex 连续补上 Sites、角色插件、banked reset 与推荐机制、Record & Replay,以及 Remote 正式可用;
7 月 6 日,iOS 已经能直接创建、搜索、打开、分叉和管理 Codex 任务。任务不再被锁在一次本地会话里,而是被拆成“发起—执行—查看—验收—继续”的长期状态。
6 月 26 日,GPT-5.6 先向少量合作方预览;7 月 9 日才正式全量上线。
新一代不只是更强的单模型,而是用 Sol、Terra、Luna覆盖不同成本层,再用 max 和 ultra 把单 Agent 扩展成多 Agent 协同。
同一天,ChatGPT Work 和统一桌面 App 上线,把 Chat、Work 与 Codex 放到同一入口。

两天后,Tibo 说新模型上线后的单日增长超过此前两周总和。

真正改变增长边界的是 ChatGPT Work。Tibo 对老 Codex 用户的号召很直白:Codex 继续给你用;ChatGPT Work 则推荐给那些你一直想带进来、但“不够技术”的朋友和家人。
增长对象由开发者扩到了所有需要研究、写作、分析和交付的人。

接下来的三个数字必须一起看:
7 月 12 日 6M,表述范围已经同时谈 Codex 与 ChatGPT Work;
7 月 13 日 7M,明确是正在使用两款产品的活跃用户;
7 月 14 日 8M,更明确写成“across Codex and ChatGPT Work”。
所以 7M、8M 不是 Codex 单产品突然多出两三百万用户,而是产品组合、额度激活和统计口径共同变化后的结果。

第四次换挡的本质,是增长单位变了:从 Codex 单产品的开发者增长,变成 Codex + ChatGPT Work 的双产品协同增长;从“谁会写代码”,变成“谁有一件工作想交出去”。
回头看这 93 张官方更新卡片,真正有效的不是功能数量,而是四种力量在同一阶段咬合。
第一,模型能力决定上限。GPT-5.3-Codex 让长任务与中途纠偏可用;5.4 把编码能力、Computer Use 和超长上下文合到主线;5.5 提高代理编码与 Token 效率;5.6 再把成本分层和多 Agent 协作放进同一产品。
第二,任务半径决定市场大小。App 把终端用户扩成桌面用户;浏览器和 Computer Use 把代码任务扩成真实工作;手机、Remote 和 iOS 管理把“坐在电脑前”扩成“随时可发起”;ChatGPT Work 最终把非技术任务也纳入进来。
第三,信任半径决定能不能深用。中途引导、Plan Mode、审批、Appshots、锁定远程任务、Record & Replay,看起来没有模型跑分性感,却决定了用户敢不敢把更大、更久、更贵的任务交给 Agent。
第四,使用激活决定增长能不能持续。免费入口、里程碑重置、banked reset、推荐机制和公开案例,让发布日的注意力转化成一次新的真实使用。不是把更多人塞进漏斗,而是让核心价值多发生一次,而且被别人看见。
这四个轮子又被一条公开反馈链串了起来。6 月 21 日,Tibo 直接问用户 Codex App 哪里“不够惊喜”,收到了约 4000 条回复。几天后,一位用户公开指出本地日志可能造成极端 SSD 写入,Tibo 很快确认存在 bug 并宣布修复。用户外推的“约 640TB/年”不是官方测量,但“问题存在且已修复”形成了一个可核对的公开闭环。

这类反馈的价值不只在修一个 bug。它把评论区从客服入口变成产品路线图,也把黑箱式改进变成公开信任:用户愿意暴露真实问题,团队快速回应,下一批用户又因此更敢使用。

所以更准确的增长飞轮是:模型跃迁点火 → 产品扩大任务半径 → 额度推动深度使用 → 案例与问题公开出现 → 团队快速修复 → 更强信任吸引下一批用户。

我自己最早是从 CLI 开始理解 Codex 的。那时我看到的是一个很强的编程工具;
到了 App、多 Agent、自动化、浏览器、手机远程和 Record & Replay 之后,我看到的已经是另一种东西:
一套可以持续接收任务、调用工具、留下过程证据、跨设备继续工作的 Agent 操作系统。
所以,Codex 从 1M 到 5M,是一条产品增长曲线;从 5M 到“双产品 8M”,则是一条品类扩张曲线。
前者回答“开发者为什么开始用”,后者回答“非技术用户为什么也可能进来”。
真正的分水岭,从来不是版本号从 5.3 变成 5.6,也不是跑分又高了多少。
而是你敢把多大的任务交给 Agent,多久不看它,回来之后还能不能验证它。
当这个答案从“几分钟的一段代码”,变成“跨设备、跨工具、跨几个小时的一项完整工作”,增长曲线才真正有了意义。
是的,Codex现在就是一个最顶级的通用Agent之一!
那以上这篇文章,是我在外旅游时,先和Codex接入的Hermes Agent在微信里聊出的框架,写入飞书云文档,再和Codex讨论交流,修改出来的一个版本,可能有不少AI味,但是内容的真实性,包括里面多张截图、自动点击加载更多去查看Codex更新内容的,都是Codex自己干的啊!
某种程度上,也是黄叔自己践行Agent-First的实践,这种思路构成了黄叔在启动的Agent社群。
接下来,黄叔也会独家和某个Top3的视频平台,合作推出全网最强的Codex视频教程,欢迎期待。
Codex视频教程的详细版本,也会更新到Agent社群内,欢迎购买,目前是早鸟价,400天有效期:
