智体新境|从模型到端侧,Google AI 开发全链路升级
2026 Google 开发者大会集中展示 Google AI 在模型能力、多模态、智能体开发与端侧部署四个层面的最新进展。Gemini 3 系列与 Gemma 4 开放模型提供差异化选择;Gemini Omni Flash、Lyria 3 和 Live API 推进多模态交互;AI Studio、Antigravity 2.0 与 Gemini API 构建智能体开发闭环;MediaPipe Tasks、LiteRT-LM 与 LiteRT 形成分层端侧技术栈。
四大升级维度:模型、多模态、智能体、端侧
模型能力持续进阶,开发者面对的选择也越来越多 —— 怎样选对模型?如何高效构建智能体?如何让 AI 灵活部署到不同设备?对于中国出海开发者与企业而言,每一步,都关系着 AI 应用能否更快落地、走向全球市场。
2026 Google 开发者大会集中展示了 Google AI 在四个层面的最新进展:

Gemini 与 Gemma:覆盖任务与环境的模型双轨
从复杂问题、速度与成本平衡,到大规模部署和按需微调,不同 AI 应用需要不同的模型选择。Google 持续推进 Gemini 前沿模型与 Gemma 开放模型,为开发者提供覆盖不同任务与运行环境的模型阵容。
Gemini 3 模型阵容: 适配不同任务需求。Gemini 3.6 Flash 性能卓越,兼顾速度与成本优势;Gemini 3.5 Flash-Lite 则是大规模部署的理想之选。Gemini 以原生多模态为设计基础,能够理解各类信息,并进行跨模态推理。
大会现场设置了Gemini 奇趣影棚,将传统的照相亭与 Gemini 的 AI 图像编辑模型 Nano Banana 的前沿功能完美结合,为开发者们带来趣味十足的拍照体验。





多模态能力进阶: 丰富创作与交互方式。Gemini Omni Flash 融合 Gemini 智能与生成式媒体能力,让万物皆可输入、一切皆能输出,为视频生成带来更多可能;Lyria 3 可根据文本或图片生成包含乐器伴奏和人声的高保真音频。Live API 支持低延迟实时语音和视觉互动,Gemini Robotics 2.0 则将模型能力拓展至机器人场景。

Gemma 4 开放模型: 多种模型大小,适配多样需求。Gemma 4 提供从 E2B 到 31B 的多种模型大小,全系支持思考和函数调用,其中 E2B、E4B 支持文本、图像、音频和视频。它还支持多步规划、工具调用等智能体推理;开放权重与 Apache 2.0 许可,方便开发者按需微调与生产部署。结合 ADK、BigQuery MCP 与 Cloud Run,开发者还可构建连接真实数据的智能体应用。

围绕 Gemma 蓬勃生长的 Gemmaverse,汇聚了全球开发者针对特定任务与专业领域打造的模型变体。MedGemma、Cell2Sentence 等实践,也展现了开放模型在医疗健康与生命科学领域的应用潜力。

智能体开发闭环:从原型到 API 集成
从原型验证、多智能体并行开发到 API 集成,Google AI 的工具与 API 让智能体应用开发链路衔接更顺畅。
Google AI Studio: 快速验证想法。通过自然语言即可构建并预览应用原型,再将项目带入 Google Antigravity 继续开发。
Google Antigravity 2.0: 多智能体协同开发。多个智能体可在同一项目中并行推进编码与测试,加速应用迭代。
Gemini API: 打造全新智能体体验。Interactions API 以统一接口支持模型与智能体推理;Managed Agents 则让开发者通过一次 API 调用,使用运行于托管隔离 Linux 沙箱中的 Antigravity 智能体,减少自行搭建运行与编排环境的工作。

端侧部署分层技术栈:从现成能力到自定义加速
让 AI 运行在设备端,并非只有一条路径。针对不同开发需求,Google AI Edge 提供从现成能力接入、端侧语言模型运行,到自定义模型部署与加速的分层技术栈:
MediaPipe Tasks: 快速接入现成 AI 能力。通过预构建且高度优化的高阶 API,简化视觉、音频与文本任务的集成。
LiteRT-LM: 让语言模型运行在设备端。面向 Gemma 等开放模型,简化模型加载、对话上下文管理与本地推理。
LiteRT: 灵活部署自定义模型。支持模型转换、运行与硬件加速,满足现成任务和语言模型之外的定制需求。
Google AI Edge 中的不同工具覆盖 Android、iOS、Web、桌面端与 IoT 等环境。对于面向全球市场的多设备应用,开发者可根据任务类型、模型形态与设备条件选择合适路径;在适用场景中,端侧运行有助于缩短响应路径、支持本地数据处理,并在网络受限时维持关键体验。








JOTO 企业落地观察
- 企业若计划将智能体部署至多端(尤其含 iOS/Android/Web),需评估 LiteRT-LM 对 Gemma 系列的支持深度与本地上下文管理能力,这直接影响端侧对话连贯性与离线可用性。
- 对依赖多模态交互(如图文混合指令、实时音视频反馈)的企业应用,Gemini Omni Flash 与 Live API 的组合提供了端到端低延迟通路,但需同步设计服务端 fallback 机制以应对端侧算力波动。
- Gemma 4 的 Apache 2.0 许可与函数调用支持,降低了企业构建私有智能体的知识工程门槛;但 MedGemma 等垂直变体尚未明确是否继承同等许可条款,企业在选用前需核查具体权重分发协议。
- Google Antigravity 2.0 的多智能体并行开发模式,对企业内部的 AI 工程协作流程提出新要求——需配套建立智能体职责边界定义、接口契约管理与沙箱级测试规范,否则易导致编排逻辑耦合过深。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


