以后开会,AI可能要开始插嘴了
本文梳理AI语音技术近期进展,指出其正从‘说’向‘听’和‘想’能力深化;分析当前局限在于推理速度与智能深度的平衡;强调组织稳定性与人才密度对AGI研发的关键作用;并探讨AI作为‘参会人’在会议场景中的潜在应用价值。
AI语音加速进入现实场景
AI开始从屏幕走进现实,是今年AI发展的主线之一。而语音,是AI切入一个个现实场景的早期突破口。
从最早的人工智障Siri,到近两年一众AI录音笔铺货,再到上半年企业微信和豆包输入法灰度尝试的语音/录音拓展,再到上个月苹果宣布以新版Siri为核心入口、全面革新Apple Intelligence,再到这两周GPT Voice快速落地ChatGPT桌面端、Anthropic同步跟进语音模式,AI语音正在加速进入现实。

当前能力:能说,但听与想仍在强化中
一方面,AI语音已经“说”得很6了,比如豆包。
另一方面,AI语音正在快速强化“听”和“想”的能力,也就是更接近智能本质的这块能力。
就像两个人类交流时的常见情况,能否有效聆听,识别对方的真实意图和当下情景的相对局限,能否既充分兼容而又不冒犯,能否以长期价值为导向推进对话,就变成了下阶段AI语音的重点课题。
现阶段,客观来讲,AI语音还没达到对答如流,或者说顶级聪明的水平,应答深度还不够。主要是推理速度还没跟上,又不能一直傻等,就只有牺牲一些智能来换取流畅度。
但这个应该不是啥大问题,再有几个月也就解决了。真正难的,还是灵性和悟性,或者说智能本质这块的提升。
智能本质的突破需依赖全模态与具身智能
当然,这个事也不是光靠语音就能解决。
比如按梁文锋的看法,类似多模态这些事情也许跟智能本质还离得很远,而他和团队还是在从LLM+agent这个路径,尝试解决AGI问题。
其实要实现人的灵性,可能还是要建立在全模态打通、具身智能全面落地的基础上。
主要因为人是基于大脑、同时通过多种感官接收和处理信息的,而目前单一的语言或语音界面,还达不到人类“望闻问切”的交互深度。
组织稳定性成为AGI竞争的关键变量
说到梁文锋,这周他有一篇比较火的投资者交流问答反复刷屏,可以说把强价值观驱动下的科学+商业实践怎么做,基本说清楚了。
其中,梁总提到只要团队稳,他就一定能做成AGI,而且“就是这么简单”。
巧的是,最近月之暗面杨植麟也有类似的表达:不光是DeepSeek和月之暗面,看看Anthropic也会发现,他们的团队和组织也是稳得一匹。
看来英雄所见略同。现阶段AI竞争的技术和产品范式基本有了,大目标也都差不多,中美都是瞄着AGI去了。
眼下的重点,就是把核心人才和组织稳住,尽快把agent做透,然后快速进入AI持续学习和自我迭代阶段(也就是梁总认为的智能奇点)。
所以“组织”,可能是眼下AI竞争的关键词。
而所谓“AI时代的组织”,一是人与人之间要形成共同愿景驱动下的真实链接,以善意和共识驱动;二是明确业务边界,尊重商业规律和资源有限性,把好钢用在刀刃上。
AI语音已初步具备日常协作能力
实际用下来,比如在家中,目前完全可以在客厅一直开着GPT Voice,让它扮演倾听者、聊天搭子或者比如口语老师,就是下面右侧这颗蓝色的球🔵

它就像个真人,既能陪聊伴学,又能调动agent做事,还能分辨场景中多个不同人类的音色,体验下来挺好的,比打字效率高很多。
不难想象,在办公、娱乐、日常生活等场景中,开一个AI语音搭子,可能会逐渐流行起来,就像呼唤车机一样自然而然。
再进一步,当AI语音搭子普及后,AI摄像头和扬声器、甚至充分隔音的类似玻璃房子的AI工位,也许会有一波市场需求,这样免得大家在开放办公室相互影响。
AI作为“参会人”或将重构会议形态
更实际一点,目前我能想到的AI语音提升生产力的典型场景,可能是开会。
也就是在目前AI会议纪要的基础上,真正引入一个“AI参会人”,赋予它充分的上下文背景和内部资料,设定好它所扮演的角色(主持人、决策者、汇报者、智囊等等),从而充分利用AI的超级智能推动建设性讨论,减少人类自身局限性造成的偏见和谬误,进而实现更有效的共识和更高质量的决策。
有时候,主动放下一些人类的ego,以更灵活的身段和AI协作,也许是更好的选择。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


