使用 Gemini 3.5 Transcribe 进行AI智能转录
Google 正式推出 Gemini 3.5 Transcribe,专为智能语音交互设计的高精度语音转文本模型。支持实时流式与预录制音频两种 API 模式,具备智能转录、函数调用、自定义词汇、85+语言识别及多说话人标注能力。实测词错误率低至 2.6%(非流式)和 4.0%(流式),显著优于前代 Chirp 3 模型。
Gemini 3.5 Transcribe 的核心定位
Google 正式推出 Gemini 3.5 Transcribe——迄今为止最精准的语音转文本模型,专为智能语音交互而设计。
与难以应对背景噪音、复杂术语及口语不流畅问题的传统语音识别模型不同,Gemini 3.5 Transcribe 能将原始音频直接转换成准确、精炼且格式规整的文本。

面向开发者的集成能力
在 Gemini 应用及 Android 等产品中,消费者已受益于这一转录模型带来的新语音功能,例如 Android 上的 Rambler 功能以及 macOS 上 Gemini 应用内的相关功能。开发者现可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API,使用 Gemini 3.5 Transcribe 构建类似的功能。
该模型能够无缝集成到开发工作流程中,无论是构建语音代理、实时字幕工具,还是通话后分析管道。模型可通过两个独立的 API 使用:
- 实时流式处理:通过 Live API(使用 gemini-3.5-transcribe-live),为交互式语音应用提供亚秒级延迟的连续双向流式传输。
- 预录制音频处理:通过 Interactions API(使用 gemini-3.5-transcribe),转录录制的音频、会议、通话记录等,并提供说话人归属和词级时间戳。
智能转录的核心能力
Gemini 3.5 Transcribe 旨在捕捉用户的自然说话风格,以更好地理解其意图并识别自定义词汇,帮助用户通过语音执行任务。
- 智能转录:无缝处理自我修正(例如“我们周二——不,周三见面”),移除填充词(如“嗯”、“啊”),并自动格式化文本。
- 函数调用:该模型可通过函数调用将复杂任务(如图像生成和文件分析)委派给其他 Gemini 模型。该功能目前已在 macOS Gemini 应用中提供。
- 更精准的转录:据 Artificial Analysis 测量,流式用例的平均词错误率 (WER) 为 4.0%,非流式用例为 2.6%。在嘈杂的现实环境中表现出色,能准确捕获邮政编码和订单ID等字母数字实体。
- 自定义词汇:通过根据用户提供的自定义词汇无缝调整转录内容,识别专业术语和特殊拼写。
- 全球语言支持:自动检测并转录超过 85 种语言,无缝处理地区口音和多种方言。
- 多说话人识别:在预录制音频中,可准确标注最多三位说话人的语音并附带时间戳(对 3 位以上说话人的支持为实验性功能)。
Gemini 3.5 Transcribe 支持实时语言切换和无缝流式转录。
性能对比与基准表现
Gemini 3.5 Transcribe 的性能标志着其从此前的转录模型 Chirp 3 实现了重大进步,提供了新功能、更低的词错误率和显著改善的延迟。据 Artificial Analysis 测量,最终转录时间提升了 70%。在一组顶级语言和地区的 FLEURS 基准测试中,该模型在流式模式下实现了 5.50% 的词错误率 (WER),在非流式用例中实现了 5.04% 的 WER,展现了精准的多语言性能,优于 Chirp 3。


终端场景中的语音体验升级
除了在 Google AI Studio 和 Gemini Enterprise Agent Platform 中提供的 Gemini API 外,3.5 Transcribe 的功能不止于标准语音转文本,它让在 Google 各产品中的操作更加自然和直观。通过将上下文感知理解直接带入 Gboard、Antigravity、Gemini 应用和 Chrome 等日常界面,它能够轻松捕捉细微差别、意图和内联编辑。
在 Android 的 Gboard 上,通过新的 Rambler 功能,3.5 Transcribe 可将口语想法转换为格式规整的文本,并过滤掉填充词。用户还可以通过语音进行编辑、更正拼写错误和更改写作风格。
在 Google Antigravity 上,经用户许可后,3.5 Transcribe 会结合屏幕上下文和聊天记录,以确保跨文件名、代理思路和活动文档的转录精准无误。
在 Google AI Studio 中,用户可以在 Build 模式下访问 3.5 Transcribe,通过语音即时构建应用。
在 macOS 的 Gemini 应用中,3.5 Transcribe 不仅能将用户的自由语音转录为整洁的格式化文本,还能启用语音命令,与屏幕上下文无缝配对以驱动复杂的工作流程。通过后台调用其他 Gemini 模型处理繁重任务,该模型让用户仅凭语音即可轻松总结本地文件、跨应用重新利用文本或在光标处生成图像。
即将在 Chrome 浏览器中推出,用户将能够在任何网页输入框中通过语音输入——更自然、更轻松地用语音回复、起草帖子或在 Chrome 中向 Gemini 提问。
早期采用者反馈与生态支持
通过利用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施,让开发者能够完全专注于打造用户体验。
vivo、Intellitek Health 和 Lingopal 等公司也对 3.5 Transcribe 给予了积极反馈,强调了其令人印象深刻的延迟、准确性和广泛的语言支持。
JOTO 企业落地观察
- 企业部署语音智能体时,需权衡实时流式 API(低延迟但需持续连接)与预录制 API(高精度但有处理延迟)的适用边界;尤其在客服质检、会议纪要等场景中,二者常需协同调度。
- 多说话人识别支持上限为三位,且超三人属实验性功能,意味着企业若需处理多方会议(如董事会、跨部门复盘),须自行补充说话人聚类或人工校验环节。
- 自定义词汇能力虽支持专业术语适配,但未说明是否支持私有词表热更新或领域微调接口,这对金融、医疗等强术语垂直场景的工程闭环构成潜在约束。
- 函数调用机制打通了语音输入与多模态任务执行链路,但当前仅限 macOS Gemini 应用落地,企业若需在自有系统中复现该能力,需依赖 Gemini Enterprise Agent Platform 的完整集成与权限配置。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


