Google DeepMind 发布 Gemini Robotics 2:迈向具身通用人工智能的关键一步
Google DeepMind 推出 Gemini Robotics 2,整合视觉-语言-动作能力,实现机器人全身智能控制与多机协作。该模型聚焦工厂、仓库等受控环境落地,但安全验证与家庭场景泛化仍是重大挑战。
Google DeepMindGoogle DeepMind 已发布 Gemini Robotics 2,这是其具身于人形机器人中的视觉-语言-动作模型的最新版本。
在 一篇博客文章中,该公司表示,此次发布是迈向“具身通用人工智能”(physical AGI,即人工通用智能)的重要一步——此类人工智能可通过机器人等物理系统与现实世界互动并在此运行,从而使机器人本质上能够执行人类所能完成的任何物理任务。
该系统通过整合多个 AI 模型,实现了 DeepMind 所称的“智能全身控制”,赋予机器人感知周围环境、对多步骤任务进行推理,并协调其全身运动的能力。
集成该系统的机器人还可与其他机器人协作。
DeepMind 机器人业务负责人卡罗莱纳·帕拉达(Carolina Parada)将该技术的长期目标描述为“使机器人能够执行人类所能完成的任何任务”。
上周发布的视频演示显示, Apptronik 公司的 Apollo 2 机器人以及 Sharpa 公司的机械手 在经过遥操作、视频演示和仿真相结合的训练后,可自主完成绑扎垃圾袋或拧入灯泡等家庭及工业任务。
Forrester 分析师保罗·米勒(Paul Miller)表示,此次发布建立在 谷歌早期机器人研究工作 基础之上,通过提升机器人之间的协作能力、帮助机器从失败动作中恢复,并使模型能更全面地理解整台机器人,而非仅聚焦于单个部件(例如机械臂或夹爪)。
然而,如此重大的突破——弥合机器人“大脑”与“身体”之间的鸿沟——也伴随着自身风险。
他说:“机器人是物理机器。它们可能很强壮,也可能很重。与这些机器共同工作的人员,以及在现实世界中遭遇它们的人员,必须确信这些机器是安全的。”
他指出,挑战包括确保传感器或电源系统发生故障时机器人能安全失效;并主张,要实现机器人与人类的大规模共存部署,必须证明 健全的安全保障措施。
他说:“在机器人真正能与人类共同部署之前,其安全性必须得到令人信服且可信的验证。”
至于谷歌实现具身通用人工智能(physical AGI)的使命,米勒表示,目前这一承诺仍属“愿景性目标”。
他说:“最终能在任何环境中执行人类所能完成的任何任务的机器人,或许是一个合理的研究目标,但我们距离实现它还相去甚远。”
目前他表示,他预计 具身人工智能(physical AI) 将在工厂和仓库等受控环境中创造价值。
他说:“具身人工智能或许比以往形式的自动化更具适应性和灵活性,但在风险最小化、不确定性最小化且利用率最大化的环境中部署自动化,仍然更容易、更便宜。工厂或仓库或许嘈杂、肮脏或混乱,但对机器人而言,其复杂程度远低于家庭环境。”
JOTO 企业落地观察
- 对企业部署而言,Gemini Robotics 2 明确指向工厂与仓库等结构化环境,表明当前具身AI价值落地仍高度依赖低不确定性场景——企业需优先评估产线可结构化程度,而非盲目追求全场景通用性。
- 对智能体工程而言,该模型强调‘智能全身控制’与多模型集成,意味着未来机器人智能体开发需突破单模块优化范式,转向感知-推理-运动闭环协同设计,并强化跨部件语义理解能力。
- 对AI安全治理而言,Forrester分析师明确指出传感器/电源故障下的安全失效机制是规模化共存前提,这要求企业在引入此类系统前,必须建立覆盖硬件层、控制层与任务层的三级安全验证体系,而非仅依赖算法鲁棒性。


