Waymo 的 AI 评估与安全实践:评估驱动型开发的工业级范本
Waymo 将评估嵌入人工智能全生命周期,形成「评估驱动型开发」范式:评估贯穿训练、仿真与实车运行;聚焦罕见高危场景测试;坚持人工终审与业务成果挂钩;强调数据效率而非数据规模;并对内部使用的 AI 代理同样实施严格评估。其2.2亿英里完全自动驾驶里程与比人类低17倍的致伤率,验证该方法论的工业级可靠性。
很少有公司在部署人工智能时面临比 Waymo更高的风险。Waymo 是 Alphabet 旗下源自谷歌的自动驾驶汽车公司。其模型不仅生成文本或自动化后台任务,还帮助车辆在不可预测的街道上导航、响应人类驾驶员,并在物理世界中做出毫秒级决策。
但 Waymo 管理这些风险的方法——持续评估、精心筛选的数据、人工监督以及明确定义的业务成果——为几乎所有行业的企业部署人工智能代理提供了更普适的操作手册。
Waymo 系统智能与机器学习工程总监马娜西·乔希(Manasi Joshi)在 VB Transform 2026 上解释了这家自动驾驶汽车公司如何大规模训练、测试和部署人工智能。据该公司称,截至目前,Waymo 已完成超过 2.2 亿英里的完全自动驾驶(即“仅乘客”)行驶里程,在相同距离下,其严重碰撞致伤率比人类驾驶员低 17 倍。
为实现这些令人瞩目的成果,乔希表示,Waymo 采用了她所称的“评估驱动型开发”(eval-forced development)或“以评估为中心的开发”(eval-centric development),将评估作为工程的核心环节,而非部署前的最终检查。
乔希表示:“我们的项目成熟度阶段,可轻易通过其所展现的评估成熟度来判断。”
在实践中,Waymo 通过考察围绕某项目的测试成熟度,部分评估其就绪程度。这一方法对构建客户服务代理、编程助手、金融系统或其他人工智能应用的企业具有明确启示:若一家企业无法可靠地衡量某系统的性能,则该系统可能尚未准备好投入生产。
评估必须在发布后持续进行
乔希表示,Waymo 的大量质量工作已转向评估,包括在模型训练期间、训练完成后以及在开环和闭环仿真中开展的测试。
她说:“评估并非一次性的模型发布任务。”
Waymo 将评估视为贯穿驾驶、仿真与验证的连续过程。其方法论融合了数据集、性能指标以及能够高效规模化运行的基础设施。
对企业而言,这意味着在发布前测试代理是不够的。团队必须在底层模型、业务流程、用户行为及输入数据发生变化时,持续评估该代理。这些评估还应与实际业务成果挂钩,而非仅依赖宽泛的行业基准。
乔希提醒道,模型质量的测量结果仅与其背后评估数据的可信度一样高。因此,Waymo 在提出性能主张时,会同时提供用于测试其系统之数据集的属性信息。
测试罕见且危险的情形
Waymo 的评估层级始终根植于一个压倒性目标:安全。
该公司利用第一方驾驶日志、部分第三方数据以及逼真的仿真环境,使其系统暴露于涵盖数十亿合成英里里程的各种场景中。任务负责人针对涉及弱势道路使用者、铁路道口、施工区域及其他复杂环境的情形,选择专用数据与指标。
同一原则适用于自动驾驶以外的领域。企业不仅需测试其代理能成功处理的常规请求,还需测试那些一旦出错可能导致财务、法律、安全或声誉损害的罕见情形。
乔希强调,Waymo 并未将发布决策完全交由自动化系统决定。其生产就绪性评审包含广泛的人工监督,而内部安全负责人则负责批准软件发布及服务区域扩展。
她说:“这并非由人工智能驱动、完全自动化且零人工监督的过程。人类生命处于风险之中。”
效率绝不能以牺牲可靠性为代价
Waymo 面临的另一问题,对企业人工智能团队而言同样熟悉:计算、存储、内存和网络容量的需求增长速度,超过了可用资源的增长速度。
该公司在数据提取与存储、分布式模型训练、模型蒸馏、仿真及评估等各环节追求效率。它还强调“数据效率”,即选取最具价值的训练样本,而非将更大数据量本身视为固有优势。
Waymo 自 2017 年起开始使用 Transformer 架构,随后逐步拓展至大语言模型、视觉-语言模型及视觉-语言-动作模型。乔希表示,该公司目前正将其生成式多模态模型纳入基础模型战略。
Waymo 将其技术划分为车载系统(每辆车内部)与车外基础设施(用于模型开发、数据处理及仿真)。这种组合迫使该公司同时优化实时推理能力及其所依赖的更大规模支撑系统。
代理需要专属的评估
Waymo 还在内部将人工智能代理用作工程师的生产力工具。乔希表示,这些代理有助于分析数据分布、评估数据效率,并对车辆遥测数据、训练运行及失败评估任务中发现的问题进行分类排查。
其目标是加速调查性工作,使工程师能将更多时间投入判断性决策与复杂技术问题。但 Waymo 同样对其内部使用的这些代理进行评估,以确保其产出可信、准确的结果,而非将员工引向无效路径。
对企业领导者而言,Waymo 更广泛的启示在于:代理式人工智能远不止于选择一个强大模型。组织需要明确定义的目标、具代表性的评估数据、持续测试、可高效运行的基础设施,以及被明确指定、对部署负有最终责任的人类决策者。
乔希表示:“赢得信任至关重要。”
JOTO 企业落地观察
- 对企业部署而言,Waymo 表明:生产就绪性必须由可量化的评估成熟度定义,而非仅依赖基准测试或上线时间表;若无法稳定测量系统在关键业务指标上的表现,即不具备部署条件。
- 对智能体工程而言,Waymo 将AI代理本身用于数据分布分析、失败归因与遥测诊断,并同步对其输出进行可信度评估——这揭示了智能体闭环迭代中‘代理自评’的必要性,而非仅将其视为单向生产力工具。
- 对AI安全治理而言,Waymo 坚持人类对软件发布与服务区域扩展的最终审批权,且将评估数据属性(如来源、覆盖场景)与性能主张并列披露——这为高风险AI应用确立了‘可追溯的评估透明度’这一刚性治理要求。
- 评估驱动型开发要求企业将评估能力前置为工程核心能力,而非 QA 附属职能;这对 RAG 知识工程尤为关键——知识召回率、答案置信度、幻觉发生频次等指标必须在上线前即具备可重复测量机制。
