AI 说话,终于不用像对讲机了:Gemini 3.8 Live 来了
谷歌发布 Gemini 3.8 Live 与 Extended Thinking 两款实时语音模型,实现低延迟边听边想、97 种语言自动切换、多步任务边执行边播报,并支持后台调用工具不中断对话。当前仅限 Gemini Live、Google 搜索 Live 及付费版 Workspace 使用,国内暂不可用。

语音交互进入真人节奏
Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 是 Google DeepMind 新出的两个实时语音模型。一句话理解它们,输入输出都是语音的「语音版 AI」,你对着它说,它直接开口回你,中间没有打字那一步。
以前你跟 AI 语音助手说话,是什么感觉?对讲机。你说一句,它答一句,你说完了它才开始转,转完了才开始说,中间卡壳几秒,气氛尴尬得像电梯里碰见不太熟的同事。
这次不一样。3.8 Live 主打的是「低延迟」这三个字,你话音还没落,它已经开始组织了。它不是等你把话说完了再想,而是边听边想,交错着来,像真人对话里那种「嗯嗯对对」的接话节奏。
更狠的是它能自动识别 97 种语言,聊着聊着你自己切了个语种,它跟着就切了,不用你设置什么。中英文混着说,它也能接住。
还有个细节挺有画面感。处理复杂任务的时候,它会像真人一样冒出一句「让我查一下」,然后真的去后台查,查的时候嘴也不停,一边查一边跟你解释进度。
你品品这个体验,像不像你让同事帮你查个事,他说「我看看啊」然后一边翻资料一边跟你唠。
双模型分工:快嘴与慢工出细活
这是两个模型真正的分工,也是这次发布会最容易被忽略的地方。
3.8 Live 是快的那个,适合日常问答,你问它答,反应快,适合当默认。
3.8 Live Extended Thinking 是「想得深」的那个,适合难的、多步骤的活。它的特点是后台可以慢慢推理,但前台跟你说话不中断。你让它「帮我把这周的数据整理成报告,再检查一下明天的日程有没有冲突」这种多步任务,它不会闷头干完再回你,而是边干边说,走到哪一步了都跟你讲。
说人话,一个是快嘴,一个是慢工出细活但嘴上不停。Google 把这两种能力拆成两个模型,让开发者自己选,你要快还是要深,丰俭由人。
对咱们普通人的意义在哪?以后你跟 AI 说一句「帮我订个餐厅」这种话,它不用再装模作样地「好的,正在为您查询」,而是真的能一边确认你的口味偏好、一边查空位、一边跟你确认付款,全程像个人。
从聊天到干活:语音模型首次深度集成工具调用
光会说话不算本事,这次真正的变化藏在「后台工具调用」里。
以前的语音助手,聊归聊,干不了事,最多帮你设个闹钟。这次的模型支持在对话的同时,后台调工具、调 API、执行任务,而且全程不打断你们的对话。
举个官方演示的例子,它当编程老师,你对着它说代码哪里不对,它一边看着你的屏幕(近实时视觉理解是这次的新能力),一边告诉你哪儿错了、怎么改,还顺手把改了之后的版本跑给你看。你全程没碰键盘。
这就是质变了。AI 语音不再是个「嘴替」,它开始长出手来。
不过这地方要泼盆冷水。工具调用是「可以了」,但还没到「人人都能用」的程度。写代码、查数据这些活,要靠开发者把模型接进应用里,普通用户能直接用到的入口其实有限。Google 说普通用户从今天起能在 Gemini Live、Google 搜索的 Live 里用到,买了 Google AI Pro 或 Ultra 订阅的能在 Workspace 的 Docs、Gmail、Keep 里用到,但那是订阅付费用户的福利,不是免费午餐。
而且得说句实话,上面这些入口,国内目前都用不了。不管是 Gemini Live 还是 Workspace 那套,国内的网络和账号都够不着。希望国内厂商尽快跟上,把这种边聊边干活的体验,早点做成我们开箱即用的东西。
定价未明与行业抢跑信号
说到这,你可能想问,那到底贵不贵?
答案是,发布主文里没直接给。Google 这次发布了模型,但在主发布文里没公布每分钟的使用价格,价格藏在开发者博客的角落里,连不少媒体都在追问。这在现在的 AI 圈挺少见,说明定价策略还没完全想清楚,或者想憋个大招。所以想拿它做应用赚钱的开发者,预算表上还会留个悬念。
但话又说回来,Google 这两周一次的发布节奏,本身就是一个信号。它不是在跟你挤牙膏,它是在抢跑道。
抢的是哪条跑道?语音。
你想想,过去一年 AI 圈的注意力全在「多模态」和「Agent」上,但普通人对 AI 感知最强的场景,其实一直是说话。手机里那个语音助手,从 Siri 到小爱同学,被吐槽了十年「人工智障」,就是因为它们只会对讲机式的问答,不会真正「聊天」。
而现在,Google、OpenAI、亚马逊这些巨头都在同一时间把火力对准实时语音。OpenAI 有 Realtime API,亚马逊有 Nova Sonic,Google 这次拿出的双子星,就是想证明一件事,跟 AI 说话这件事,终于可以做得像跟人说话一样了。
国内这边,豆包其实也没闲着。今年4月它就把实时语音通话接进了自研的全双工语音大模型,App 里点个「打电话」就能边听边说,餐厅、地铁里吵一点也能聊,体验已经很接近打电话了。只不过像这次双子星这种一边想复杂任务、一边跟你播报进度、一边在后台调工具干活的连贯劲儿,国内暂时还没看到同级别的落地,还得再追一阵。
这次的 3.8 Live 系列,其实有个小成绩可以佐证。在第三方评测机构 Artificial Analysis 的「语音到语音质量」榜单上,Extended Thinking 版本拿了 82.6 分,排第一。在考多步任务完成率的 τ-Voice 上也拿了 68.6%。说人话就是,在「跟 AI 对话」这件事上,Google 目前是跑在最前面的那一档。
效率范式正在迁移:从打字、触屏到「说即干」
我想说一个判断,不是预测,是已经发生的事。
你有没有发现,我们正在经历一个奇怪的过渡期。键盘打字被发明的时候,大家觉得打字是效率;触屏被发明的时候,大家觉得点一下是效率;现在 AI 能听懂人话了,下一步的效率,可能就是「你直接说,它直接干」。
Gemini 这次把「说话」和「干活」焊在了一起,就是这个过渡期的又一个脚印。它还不能替你开公司,但它已经能一边跟你聊着天,一边把活干了。
对于你我这样的普通用户,最值得记住的就一句话,以后跟 AI 说话,不用再像跟对讲机说话了。它开始会接话茬、会边想边说、会一边答应你一边去干活。
这体验,第一次离普通人这么近。
下次你拿起手机问 AI 点什么的时候,可以留意一下,你的 AI,是会先沉默几秒再回答你,还是会跟你说一句「让我查一下」。
这个差别,就是这次发布的意义。
JOTO 企业落地观察
- 语音智能体工程正从「单轮应答」转向「多线程协同」:企业需重构语音接口设计,支持语音流中嵌入状态管理、异步工具调用与进度同步机制。
- RAG 知识工程面临新挑战:实时语音交互要求知识检索与生成必须在亚秒级完成,传统批处理式 RAG 架构需升级为流式 chunking + 增量 embedding 更新模式。
- AI 安全治理需覆盖语音上下文连续性:语音对话中意图漂移、多轮敏感信息拼接、实时工具调用权限链等新风险点,无法沿用文本时代的静态 prompt 审计方式。
- FDE 驻场共创将更聚焦「语音工作流编排」:企业一线业务人员需参与定义语音指令-动作映射规则、中断恢复逻辑与多模态反馈阈值,而非仅提供文本需求文档。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


