JOTO
Contact us
← AI 智库
大语言模型

AI 说话,终于不用像对讲机了:Gemini 3.8 Live 来了

2026 年 9 月 18 日

谷歌发布 Gemini 3.8 Live 与 Extended Thinking 两款实时语音模型,实现低延迟边听边想、97 种语言自动切换、多步任务边执行边播报,并支持后台调用工具不中断对话。当前仅限 Gemini Live、Google 搜索 Live 及付费版 Workspace 使用,国内暂不可用。

Gemini 3.8 Live 宣传图
Gemini 3.8 Live 宣传图

语音交互进入真人节奏

Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 是 Google DeepMind 新出的两个实时语音模型。一句话理解它们,输入输出都是语音的「语音版 AI」,你对着它说,它直接开口回你,中间没有打字那一步。

以前你跟 AI 语音助手说话,是什么感觉?对讲机。你说一句,它答一句,你说完了它才开始转,转完了才开始说,中间卡壳几秒,气氛尴尬得像电梯里碰见不太熟的同事。

这次不一样。3.8 Live 主打的是「低延迟」这三个字,你话音还没落,它已经开始组织了。它不是等你把话说完了再想,而是边听边想,交错着来,像真人对话里那种「嗯嗯对对」的接话节奏。

更狠的是它能自动识别 97 种语言,聊着聊着你自己切了个语种,它跟着就切了,不用你设置什么。中英文混着说,它也能接住。

还有个细节挺有画面感。处理复杂任务的时候,它会像真人一样冒出一句「让我查一下」,然后真的去后台查,查的时候嘴也不停,一边查一边跟你解释进度。

你品品这个体验,像不像你让同事帮你查个事,他说「我看看啊」然后一边翻资料一边跟你唠。

双模型分工:快嘴与慢工出细活

这是两个模型真正的分工,也是这次发布会最容易被忽略的地方。

3.8 Live 是快的那个,适合日常问答,你问它答,反应快,适合当默认。

3.8 Live Extended Thinking 是「想得深」的那个,适合难的、多步骤的活。它的特点是后台可以慢慢推理,但前台跟你说话不中断。你让它「帮我把这周的数据整理成报告,再检查一下明天的日程有没有冲突」这种多步任务,它不会闷头干完再回你,而是边干边说,走到哪一步了都跟你讲。

说人话,一个是快嘴,一个是慢工出细活但嘴上不停。Google 把这两种能力拆成两个模型,让开发者自己选,你要快还是要深,丰俭由人。

对咱们普通人的意义在哪?以后你跟 AI 说一句「帮我订个餐厅」这种话,它不用再装模作样地「好的,正在为您查询」,而是真的能一边确认你的口味偏好、一边查空位、一边跟你确认付款,全程像个人。

从聊天到干活:语音模型首次深度集成工具调用

光会说话不算本事,这次真正的变化藏在「后台工具调用」里。

以前的语音助手,聊归聊,干不了事,最多帮你设个闹钟。这次的模型支持在对话的同时,后台调工具、调 API、执行任务,而且全程不打断你们的对话。

举个官方演示的例子,它当编程老师,你对着它说代码哪里不对,它一边看着你的屏幕(近实时视觉理解是这次的新能力),一边告诉你哪儿错了、怎么改,还顺手把改了之后的版本跑给你看。你全程没碰键盘。

这就是质变了。AI 语音不再是个「嘴替」,它开始长出手来。

不过这地方要泼盆冷水。工具调用是「可以了」,但还没到「人人都能用」的程度。写代码、查数据这些活,要靠开发者把模型接进应用里,普通用户能直接用到的入口其实有限。Google 说普通用户从今天起能在 Gemini Live、Google 搜索的 Live 里用到,买了 Google AI Pro 或 Ultra 订阅的能在 Workspace 的 Docs、Gmail、Keep 里用到,但那是订阅付费用户的福利,不是免费午餐。

而且得说句实话,上面这些入口,国内目前都用不了。不管是 Gemini Live 还是 Workspace 那套,国内的网络和账号都够不着。希望国内厂商尽快跟上,把这种边聊边干活的体验,早点做成我们开箱即用的东西。

定价未明与行业抢跑信号

说到这,你可能想问,那到底贵不贵?

答案是,发布主文里没直接给。Google 这次发布了模型,但在主发布文里没公布每分钟的使用价格,价格藏在开发者博客的角落里,连不少媒体都在追问。这在现在的 AI 圈挺少见,说明定价策略还没完全想清楚,或者想憋个大招。所以想拿它做应用赚钱的开发者,预算表上还会留个悬念。

但话又说回来,Google 这两周一次的发布节奏,本身就是一个信号。它不是在跟你挤牙膏,它是在抢跑道。

抢的是哪条跑道?语音。

你想想,过去一年 AI 圈的注意力全在「多模态」和「Agent」上,但普通人对 AI 感知最强的场景,其实一直是说话。手机里那个语音助手,从 Siri 到小爱同学,被吐槽了十年「人工智障」,就是因为它们只会对讲机式的问答,不会真正「聊天」。

而现在,Google、OpenAI、亚马逊这些巨头都在同一时间把火力对准实时语音。OpenAI 有 Realtime API,亚马逊有 Nova Sonic,Google 这次拿出的双子星,就是想证明一件事,跟 AI 说话这件事,终于可以做得像跟人说话一样了。

国内这边,豆包其实也没闲着。今年4月它就把实时语音通话接进了自研的全双工语音大模型,App 里点个「打电话」就能边听边说,餐厅、地铁里吵一点也能聊,体验已经很接近打电话了。只不过像这次双子星这种一边想复杂任务、一边跟你播报进度、一边在后台调工具干活的连贯劲儿,国内暂时还没看到同级别的落地,还得再追一阵。

这次的 3.8 Live 系列,其实有个小成绩可以佐证。在第三方评测机构 Artificial Analysis 的「语音到语音质量」榜单上,Extended Thinking 版本拿了 82.6 分,排第一。在考多步任务完成率的 τ-Voice 上也拿了 68.6%。说人话就是,在「跟 AI 对话」这件事上,Google 目前是跑在最前面的那一档。

效率范式正在迁移:从打字、触屏到「说即干」

我想说一个判断,不是预测,是已经发生的事。

你有没有发现,我们正在经历一个奇怪的过渡期。键盘打字被发明的时候,大家觉得打字是效率;触屏被发明的时候,大家觉得点一下是效率;现在 AI 能听懂人话了,下一步的效率,可能就是「你直接说,它直接干」。

Gemini 这次把「说话」和「干活」焊在了一起,就是这个过渡期的又一个脚印。它还不能替你开公司,但它已经能一边跟你聊着天,一边把活干了。

对于你我这样的普通用户,最值得记住的就一句话,以后跟 AI 说话,不用再像跟对讲机说话了。它开始会接话茬、会边想边说、会一边答应你一边去干活。

这体验,第一次离普通人这么近。

下次你拿起手机问 AI 点什么的时候,可以留意一下,你的 AI,是会先沉默几秒再回答你,还是会跟你说一句「让我查一下」。

这个差别,就是这次发布的意义。

JOTO 企业落地观察

  • 语音智能体工程正从「单轮应答」转向「多线程协同」:企业需重构语音接口设计,支持语音流中嵌入状态管理、异步工具调用与进度同步机制。
  • RAG 知识工程面临新挑战:实时语音交互要求知识检索与生成必须在亚秒级完成,传统批处理式 RAG 架构需升级为流式 chunking + 增量 embedding 更新模式。
  • AI 安全治理需覆盖语音上下文连续性:语音对话中意图漂移、多轮敏感信息拼接、实时工具调用权限链等新风险点,无法沿用文本时代的静态 prompt 审计方式。
  • FDE 驻场共创将更聚焦「语音工作流编排」:企业一线业务人员需参与定义语音指令-动作映射规则、中断恢复逻辑与多模态反馈阈值,而非仅提供文本需求文档。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.