Gemini 3.8 Live:实时流式语音AI代理重塑人机对话范式
谷歌发布Gemini 3.8 Live与Live Extended Thinking两款音频模型,支持边流式输出语音响应边执行API/工具调用、实时视觉输入及97+语言,实现推理与交互延迟分离,使AI代理可被自然中断并持续上下文对话。

谷歌推出了两款新型音频模型,使企业能够部署具备深度推理能力、更高交互性及更快对话速度的智能AI代理。
谷歌表示,这两款模型——Gemini 3.8 Live与Live Extended Thinking——于9月15日发布,使开发者能够构建可在维持对话流程的同时进行推理并执行任务的语音代理。这些模型的关键能力包括:在持续向用户流式传输音频响应的同时执行API调用和工具调用;提供实时视觉输入,以帮助代理理解用户所说和所见的内容;支持超过97种语言。其中,3.8 Live Extended Thinking版本支持可配置推理(configurable thinking)功能,该功能允许用户开启或关闭AI模型的内部推理过程。
此次 音频模型 的发布,距谷歌最初推出 Gemini 3.8 Flash与3.8 Cyber基础模型 仅两周时间。未来集团(Futurum Group)分析师布拉德利·希明(Bradley Shimmin)表示,凭借3.8 Live的能力,谷歌似乎正迎头赶上苹果等厂商——后者已在备忘录(Notes)和语音备忘录(Voice Memos)等生产力应用中提供实时转录功能。不过,他指出,谷歌技术更进一步,改变了用户与AI的交互方式。
真实对话
“其架构方式……使你可以将它定制为以多种不同方式运行,”希明表示。他指出,尽管企业可将这些模型用于传统翻译等应用场景,但谷歌亦专门设计了这些模型,使其不依赖提示-响应(prompt-response)模式与用户交互;相反,用户可与其展开真实对话。
“这仅仅是一场自然对话,并具备实时中断以注入信息的能力,”希明表示。“你可以在不中断其当前操作的前提下,向对话中注入上下文。”
Tekonyx创始人西德·纳格(Sid Nag)表示,凭借谷歌先进的语音技术能力,这些新模型并非仅就表面问题作答。
“该模型旨在执行后台推理,”纳格表示。“它在对话过程中即开展推理,因此你可在其推理的同时维持对话的连续性。”
这项技术是一项进步,其特点是将 交互延迟 与推理延迟分离开来。交互延迟指用户执行某项操作至系统作出响应之间的延迟;推理延迟则指AI模型处理信息所需的总时间。
“它是在实时状态下完成这一过程,而非先暂停、再返回另一个答案,”纳格表示。
这些语音模型还改变了 AI代理 的响应与交互方式,因为“AI代理未必需要在‘快速’与‘深思熟虑’之间做出取舍,”纳格继续指出。“它实际上可维持实时交互。”
纳格表示,这些新模型在企业中的应用包括客户支持聊天机器人、销售流程以及融合文本、语音与视频的多模态代理型应用。
JOTO 企业落地观察
- 对企业部署而言,Gemini 3.8 Live支持‘流式响应中同步调用工具’,意味着客户支持系统无需等待完整推理结束即可启动工单创建或知识检索,显著缩短端到端服务延迟,降低传统语音IVR的转人工率。
- 对智能体工程而言,该模型将交互延迟与推理延迟解耦,要求开发者重构Agent架构:需设计异步状态管理机制以维持对话上下文,同时处理用户中途插入的新指令,这对LangChain等框架的Streaming+Tool Calling组合提出新集成挑战。
- 对FDE落地而言,其‘可配置推理开关’功能为企业提供了可控性抓手——在金融或医疗等高合规场景中,客户可关闭内部推理过程以满足审计可解释性要求,同时保留实时语音交互能力,平衡效率与治理刚性。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


