JOTO
Contact us
← AI 智库
大语言模型

使用 Gemini 3.5 Transcribe 进行AI智能转录

2026 年 9 月 6 日

Google 正式推出 Gemini 3.5 Transcribe,专为智能语音交互设计的高精度语音转文本模型。支持实时流式与预录制音频两种 API 模式,具备智能转录、函数调用、自定义词汇、85+语言识别及多说话人标注能力。实测词错误率低至 2.6%(非流式)和 4.0%(流式),显著优于前代 Chirp 3 模型。

Gemini 3.5 Transcribe 的核心定位

Google 正式推出 Gemini 3.5 Transcribe——迄今为止最精准的语音转文本模型,专为智能语音交互而设计。

与难以应对背景噪音、复杂术语及口语不流畅问题的传统语音识别模型不同,Gemini 3.5 Transcribe 能将原始音频直接转换成准确、精炼且格式规整的文本。

Gemini 3.5 Transcribe 官方宣传图
Gemini 3.5 Transcribe 官方宣传图

面向开发者的集成能力

在 Gemini 应用及 Android 等产品中,消费者已受益于这一转录模型带来的新语音功能,例如 Android 上的 Rambler 功能以及 macOS 上 Gemini 应用内的相关功能。开发者现可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API,使用 Gemini 3.5 Transcribe 构建类似的功能。

该模型能够无缝集成到开发工作流程中,无论是构建语音代理、实时字幕工具,还是通话后分析管道。模型可通过两个独立的 API 使用:

  • 实时流式处理:通过 Live API(使用 gemini-3.5-transcribe-live),为交互式语音应用提供亚秒级延迟的连续双向流式传输。
  • 预录制音频处理:通过 Interactions API(使用 gemini-3.5-transcribe),转录录制的音频、会议、通话记录等,并提供说话人归属和词级时间戳。

智能转录的核心能力

Gemini 3.5 Transcribe 旨在捕捉用户的自然说话风格,以更好地理解其意图并识别自定义词汇,帮助用户通过语音执行任务。

  • 智能转录:无缝处理自我修正(例如“我们周二——不,周三见面”),移除填充词(如“嗯”、“啊”),并自动格式化文本。
  • 函数调用:该模型可通过函数调用将复杂任务(如图像生成和文件分析)委派给其他 Gemini 模型。该功能目前已在 macOS Gemini 应用中提供。
  • 更精准的转录:据 Artificial Analysis 测量,流式用例的平均词错误率 (WER) 为 4.0%,非流式用例为 2.6%。在嘈杂的现实环境中表现出色,能准确捕获邮政编码和订单ID等字母数字实体。
  • 自定义词汇:通过根据用户提供的自定义词汇无缝调整转录内容,识别专业术语和特殊拼写。
  • 全球语言支持:自动检测并转录超过 85 种语言,无缝处理地区口音和多种方言。
  • 多说话人识别:在预录制音频中,可准确标注最多三位说话人的语音并附带时间戳(对 3 位以上说话人的支持为实验性功能)。

Gemini 3.5 Transcribe 支持实时语言切换和无缝流式转录。

性能对比与基准表现

Gemini 3.5 Transcribe 的性能标志着其从此前的转录模型 Chirp 3 实现了重大进步,提供了新功能、更低的词错误率和显著改善的延迟。据 Artificial Analysis 测量,最终转录时间提升了 70%。在一组顶级语言和地区的 FLEURS 基准测试中,该模型在流式模式下实现了 5.50% 的词错误率 (WER),在非流式用例中实现了 5.04% 的 WER,展现了精准的多语言性能,优于 Chirp 3。

Gemini 3.5 Transcribe 与 Chirp 3 的 WER 对比图表
Gemini 3.5 Transcribe 与 Chirp 3 的 WER 对比图表
多语言支持与说话人识别能力示意图
多语言支持与说话人识别能力示意图

终端场景中的语音体验升级

除了在 Google AI Studio 和 Gemini Enterprise Agent Platform 中提供的 Gemini API 外,3.5 Transcribe 的功能不止于标准语音转文本,它让在 Google 各产品中的操作更加自然和直观。通过将上下文感知理解直接带入 Gboard、Antigravity、Gemini 应用和 Chrome 等日常界面,它能够轻松捕捉细微差别、意图和内联编辑。

在 Android 的 Gboard 上,通过新的 Rambler 功能,3.5 Transcribe 可将口语想法转换为格式规整的文本,并过滤掉填充词。用户还可以通过语音进行编辑、更正拼写错误和更改写作风格。

在 Google Antigravity 上,经用户许可后,3.5 Transcribe 会结合屏幕上下文和聊天记录,以确保跨文件名、代理思路和活动文档的转录精准无误。

在 Google AI Studio 中,用户可以在 Build 模式下访问 3.5 Transcribe,通过语音即时构建应用。

在 macOS 的 Gemini 应用中,3.5 Transcribe 不仅能将用户的自由语音转录为整洁的格式化文本,还能启用语音命令,与屏幕上下文无缝配对以驱动复杂的工作流程。通过后台调用其他 Gemini 模型处理繁重任务,该模型让用户仅凭语音即可轻松总结本地文件、跨应用重新利用文本或在光标处生成图像。

即将在 Chrome 浏览器中推出,用户将能够在任何网页输入框中通过语音输入——更自然、更轻松地用语音回复、起草帖子或在 Chrome 中向 Gemini 提问。

早期采用者反馈与生态支持

通过利用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施,让开发者能够完全专注于打造用户体验。

vivo、Intellitek Health 和 Lingopal 等公司也对 3.5 Transcribe 给予了积极反馈,强调了其令人印象深刻的延迟、准确性和广泛的语言支持。

JOTO 企业落地观察

  • 企业部署语音智能体时,需权衡实时流式 API(低延迟但需持续连接)与预录制 API(高精度但有处理延迟)的适用边界;尤其在客服质检、会议纪要等场景中,二者常需协同调度。
  • 多说话人识别支持上限为三位,且超三人属实验性功能,意味着企业若需处理多方会议(如董事会、跨部门复盘),须自行补充说话人聚类或人工校验环节。
  • 自定义词汇能力虽支持专业术语适配,但未说明是否支持私有词表热更新或领域微调接口,这对金融、医疗等强术语垂直场景的工程闭环构成潜在约束。
  • 函数调用机制打通了语音输入与多模态任务执行链路,但当前仅限 macOS Gemini 应用落地,企业若需在自有系统中复现该能力,需依赖 Gemini Enterprise Agent Platform 的完整集成与权限配置。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.