
Cue 是一款运行在用户桌面上的语音 AI 智能体。只需按下快捷键并开口说话,无论是任何应用中的语音听写,还是读取屏幕内容、选择合适工具并采取行动的智能体任务,Cue 都可以精确执行。
Cue
https://heycue.io
Cue 想要实现的使命非常简单: 让 AI 成为人们通过语音 (而非打字) 与计算机交互的自然延伸。在 Cue 的愿景中,键盘在日常计算中应该是可选的,而非必需的。这一使命之所以切实可行,正是得益于像 Gemma 这样的开放模型,这类模型让小型团队也能够完全在用户的本地设备上运行。
Gemma
http://deepmind.google/models/gemma
润色语音: 平衡真实声音与速度
语音输入并不是直接以文本形式呈现的。它最初只是原始的语音转文本 (STT) 输出流: 其中包含语气词、缺失的标点符号、同音字错误,以及说话者原本打算保留的自我修正。将该数据流转化为干净、高保真的文本,并且速度要快到不中断用户体验,是任何语音优先界面所面临的核心工程难题。
从说话到看到文本之间,只要间隔超过约 500 毫秒,就会让人感觉到延迟,而这种延迟会打破 "语音比打字更快" 的错觉。Cue 之前基于云端的 "润色" 步骤为每次交互增加了 800 至 900 毫秒的延迟。此外,团队测试的其他模型往往存在 "过度编辑" 的问题: 将随意的日常口语润色成正式的书面语,丢弃自我修正,并在这一过程中抹去了说话者的个人风格。团队希望生成的文本读起来像用户自己说的话,而不是像模型生成的。
集成 Gemma 4 E4B 后,延迟大幅降低了 44%,中位数延迟从 876 毫秒降至 488 毫秒。如今,"润色" 步骤始终能在团队为 "感觉比打字更快" 所设定的感知预算时间内完成。

△ 润色步骤的延迟是在 Apple Silicon (M 系列芯片) 上通过 Ollama 测量的,测试基于包含英语和混合语言输入的 227 个真实语音样本基准。单用户听写使用量是在默认切换前后的四周内,对活跃测试版用户统计而得。数据截至 2026 年 5 月。
Gemma 4 E4B
http://deepmind.google/models/gemma
Cue 的润色架构设计得非常简单。用户按住快捷键并说话,音频通过云端 STT 被转录为原始文本。然后,该原始文本通过 Ollama 被发送到在用户设备上本地运行的 Gemma 4 模型,并带有一个紧凑的、大约 400 个 Token 的系统提示词,该提示词编码了 Cue 的格式化规则:
恢复标点符号并将数据流分割为句子;
去除语音中的语气助词;
通过理解上下文语境,修正相关的同音字;
根据当前输入框类型调整格式 (例如,对于像 "打开终端" 这样的简短命令末尾不加句号,但对于电子邮件撰写则需要有完整的标点符号)。
润色后的文本随后通过系统的原生 API 粘贴到光标所在位置。

△ 在 Cue 的润色架构中,云端 STT 接收音频并将其转录为文本,随后润色步骤完全在用户的本地机器上运行。
从说话、润色到插入的完整闭环流程在不到一秒内即可完成。对于语音优先的界面来说,这正是导致一个功能是让人感觉 "延迟卡顿" 还是 "瞬间插入" 之间的本质性差别。自这些改进实施以来,Cue 的单用户听写量增加了约 30%。以前仅听写简短消息的用户开始听写更长内容,而通常在时效性要求高的工作中使用打字的用户也选择了利用语音模式。
颠覆架构: 将限制转化为特性
在 Cue 中,每位用户的听写都是无限制的,包括免费用户。随着 Gemma 4 E4B 完全在端侧运行,Cue 润色步骤的边际成本降至零,这使得一项原本可能会被限制次数或付费才能使用的功能,在免费版中也变得可行。
团队最初计划仅将 Gemma 用作离线备用方案,最初的假设是规模更大的模型会提供更高的准确性。但在对涵盖英语和其他语言以及混合语言输入的 227 个真实语音样本运行基准测试后,他们决定将 Gemma 作为文本润色的首选模型。基准测试表明,Gemma 4 恰好具备在不进行 "过度编辑" 的情况下进行格式化和纠错的能力。对于文本润色任务而言,这种特性并非限制,而恰恰是该任务所需的行为。
Cue 的部署仅采用了基础模型配合提示词工程。当前活动应用的上下文 (如应用名称、输入框类型、可用的占位符文本) 会被注入到提示词中,以便模型知道用户是在撰写 Slack 消息或电子邮件还是在输入终端命令。云端路径仍作为备用方案保留: 如果 Ollama 未运行,Cue 的桌面应用会在启动时检测到这一点,并将路由切换至云端模型,从而保证听写功能继续运行而不中断。
这种 "本地 Gemma 为默认,云端为备用" 的架构,正是该团队最初计划的反转,也是目前 Cue 用户进行每一次听写的核心支柱。
"我们原本预期 Gemma 只是离线模式下的备用方案。但对真实的语音样本运行基准测试后,架构得到了巨大的反转 —— 现在 Gemma 是默认的润色方案,而云端模型则成为了备用方案。我们原本以为是缺点的 '限制',最终证明恰恰是这项任务所需要的。"
—— Eli Li,Cue 创始人兼 CEO
引领设备端语音智能体的未来
虽然 Gemma 目前只负责润色,但团队正在将其应用范围扩展到两个相邻领域:
第一个是记忆: 一个持久化的本地层,可以跨会话 (Across Sessions) 学习每个用户的说话风格、词汇和格式偏好。这使得 Cue 的输出能够适应用户,而不是强加单一的预设风格。
第二个是智能体路径: 尽管 Cue 的智能体模式目前仍依赖云端模型,但早期的评估显示,Gemma 4 的原生函数调用 (Function Calling) 功能 —— 通过 Ollama 的 tools API 直接提供,无需提示词工程中转 —— 可以成功地在本地处理相当一部分独立任务。
为了评估数百个真实语音样本中的润色延迟、保真度和质量,团队构建了一套确定性、可复现的基准测试套件,并计划与开发者社区分享其评估方法。通过开源其评估框架,其他构建语音优先或本地优先 AI 的团队也可以在自身的工作负载上运行同样结构化的本地与云端对比。
团队认为,更深层次的启示在于,本地与云端之间的差距缩小速度远超大多数产品团队的想象。而要了解您的任务究竟处于这条分界线的哪一侧,唯一的办法就是基于真实数据进行测量。对于 Cue 来说,这种测量得出了一个明确的答案: 在用户每次开口说话都会运行的这一工作负载上,Gemma 4 就是最合适的模型。
