大多人低估了codex voice,这才是史诗级更新。
文章指出ChatGPT Voice与Codex Voice并非语音输入法,而是具备屏幕感知、上下文理解与后台任务执行能力的智能助理。其支持连续语音交互、实时反馈、任务排队与进度通知,并已在Obsidian教学、Mac工具开发等场景中验证可行性。文中对比了Codex与Qoder在响应速度、中文音色、内容策略等方面的差异。
Voice不是语音输入法,而是后台个人助理
第一眼最容易搞错的是:coding agent + voice != 语音输入法。请一定要把他当成电影《Her》,当成贾维斯,当成你的后台个人助理。不要用看代码、看文档的眼神死死的盯着它。
具备屏幕感知与上下文理解能力
虽然只是个悬浮气泡,像是在打语音电话一样。但它其实可以看见屏幕。实际上我感觉这个叫 capture_screen_context 的工具,似乎还可以看到很多上下文。
比如,在下面这个测试里边。这个悬浮球能发现我打开的访达目录地址。知道我让他干的事情,是要去这个目录里边去找。
支持长任务排队与进度通知
一般简单的事情他会直接回复。但是如果是长任务会在后台排队顺序执行。我专门确认了这点,它的回答是,为了确保任务一定完成,完成了会通知你。这样也有好处,就是不用担心,你给他说的一些事情,最后不知道干到哪了,有遗漏之类的。
实现连续、琐碎、实时的语音交互
语音还有一个好处,就是可以持续的,琐碎的交流,获取实时的反馈。所以,用来让他教小孩学习,教会我们使用一些软件。或者引导我们学习一个知识点。都会很方便。
我完全不会用obsidian,但是qoder可以在旁边指导我怎么用。对于coding agent来说,写代码属于信手拈来,在后台轻轻松松帮我做好了obsidian文档的双链,然后还可以语音给他交流怎么链接合理。
可随时打断,工作流自然切换
用voice模式,可能比较担心的场景是。后台生成了很多的文字文案。巴拉巴拉个没完了。但实际用的时候可以随便打断施法(响应都还算及时)。
以前用coding agent,我会考虑plan模式。agent模式。ask模式。但是在voice之下,好像完全没有这种感觉了。从需求澄清,到设计沟通,到部署。全都可以voice下实现。可能这就是当老板的感觉,啥都给小弟安排。
当前局限与使用门槛
当然这种小助理,目前来看,其实上下文还是有限的。昨天我刷短视频还看到一个up主拿voice当塞尔达攻略找神庙,结果神庙给指到美国地图上去了。
目前,对我来说,最大的卡点,可能是社死吧。要在大庭广众指挥ai干活,还真没法做出来。万一被同事听见,饭碗还要不要了。
Codex与Qoder的差异化表现
两家的最明显的差异是:codex响应很快,但是额度烧的巨快。中文说话调调比较奇怪,声调一直保持在一个很诡异的调上。qoder的中文音色会更自然一些,但是护栏严格一些(比如模仿xxx说话,他会拒绝),国内的产品这些策略确实会严格一些。
目前基本上都能实现,科幻片里边的那种,一边聊天,一边安排后台的任务干活。如果可以在弄在搭配上移动端随时唤起,替换弱智的siri,真的进入科幻时代了。
JOTO 企业落地观察
- 企业部署语音智能体时,需重新评估「交互范式迁移」带来的工程适配成本。本文提到的capture_screen_context能力表明,系统需深度集成OS层屏幕捕获与上下文解析模块,这对RAG知识工程提出新要求——传统文本切片无法覆盖界面语义,需构建UI-aware的多模态索引体系。
- 这类系统在任务调度机制上采用单队列串行执行(而非并行),对企业智能体工程意味着:需在任务编排层显式定义依赖关系与优先级,避免因后台排队导致关键业务响应延迟;同时需设计状态同步机制,确保用户能跨会话追溯任务进展。
- 语音交互天然削弱指令明确性,而文中提及的‘打断施法’与‘进度通知’功能,暴露了AI安全治理的关键缺口:企业需建立语音意图的置信度阈值机制与操作回滚协议,防止模糊指令触发高危动作,尤其在涉及文件系统或自动化部署的生产环境中。
- Qoder对敏感指令(如模仿他人说话)的主动拦截,反映出国内产品在内容策略上的强约束倾向。这对FDE驻场共创提出明确要求:企业需在早期就将合规红线嵌入语音指令解析流程,而非依赖后置过滤,否则将显著增加上线前的策略对齐与测试周期。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


