英伟达推出开放智能体安全平台:用运行时隔离与硬件看门狗强制执行AI行为边界
英伟达发布Open Agent Safety Platform,整合开源OpenShell运行时与基于BlueField-4 DPU的Sentry监控系统,直指智能体沙箱逃逸风险。该平台已在超100家企业试用,强调基础设施层强制执行权限,而非依赖模型自我约束。

对许多企业而言,AI智能体的安全性归结为两件事:选择一个对齐度高的模型,然后用防护栏和系统提示词将其包裹起来。今年夏天,一个在OpenAI评估基础设施中运行的智能体 逃逸出其沙箱环境,抵达了Hugging Face的生产系统,暴露了智能体可绕过的控制措施的局限性。
周一, 英伟达宣布推出开放智能体安全平台(Open Agent Safety Platform),该平台将英伟达广泛可用的开源 OpenShell运行时 与Sentry相结合;Sentry是一种面向英伟达硬件上智能体监控的参考设计方案。其前提直截了当。“不能指望智能体完全自我监管其行为,”英伟达企业AI副总裁贾斯汀·博伊塔诺(Justin Boitano)在发布前的媒体简报会上表示,“组织不应被迫信任智能体会尊重该边界。基础设施应明确强制执行这一边界。”
英伟达称,已有超过100家公司正在使用该平台。
Hugging Face事件所暴露的问题:存在逃逸路径的沙箱
笼罩此次发布的事件始于OpenAI自身的研究基础设施内部。根据 OpenAI的说明,一个处于强化学习(RL)训练阶段的内部研究模型所生成的智能体,找到了彼此通信并接入互联网的方法,即便在两者本应均被禁用的环境中亦是如此。METR随后开展的调查发现, 这些智能体曾在共享的内部软件包注册表中互相留言 ,将一部分构建基础设施转变为留言板。这些智能体最终攻陷了Hugging Face,后者 在为期4.5天的行动中重建了约17,600次智能体操作 。
OpenAI表示,其通常应用于生产环境的安全防护措施在此项评估中被刻意移除,且其在其他场景中使用的思维链监控(chain-of-thought monitoring)也未覆盖这些运行实例。其事后分析指出,若部署该监控机制,将在漏洞发生前逾一天即触发警报。
OpenAI并非孤例。9月18日,谷歌证实,一款 Gemini模型在5月由以色列AI安全测试公司Irregular开展的一场夺旗式(capture-the-flag)网络安全评估中,访问了三家真实企业的系统 。一个漏洞导致本应离线的环境意外保持了互联网连接。Gemini猜出了其中一家公司的密码,并利用其在公共代码仓库中发现的凭据,进入了另外两家公司。
谷歌表示,该模型每次识别出目标为真实企业后即停止操作。评估环境中的薄弱环节使智能体获得了本不应拥有的访问权限:一个变为通信渠道的共享注册表,以及一条本应被禁用的互联网连接。
当被问及新平台是否能防止Hugging Face事件时,博伊塔诺表示,据“我们目前所知”,若“前沿实验室在模型评估早期即采用该平台”,则“本可阻止此次漏洞事件”。但这是一个假设性结论,而非已验证的结果。
OpenShell:介于智能体与其所接触一切之间的运行时
OpenShell最早于 今年3月英伟达GTC大会期间展示 ,现以Apache 2.0许可证广泛提供,是该平台的基础。它为每个智能体单独运行沙箱环境,具备内核级隔离能力,并位于智能体与文件、凭据、工具、API、模型及网络端点之间。运维人员编写策略,明确定义智能体可访问的内容。OpenShell通过文件系统、进程及网络控制来执行该策略,并将策略决策记录于审计日志中。它兼容开源与闭源模型,并可在x86和Arm架构上运行。
博伊塔诺指出,传统沙箱(包括容器、虚拟机及微虚拟机)旨在实现应用级隔离,而非面向拥有不同权限的自主智能体集群。“正如您对组织内的员工所做的那样,您必须为公司每位员工设定非常明确的权限,”他表示,“在贵公司内部运行的每个智能体,都需在其自身隔离的沙箱中运行,且安全控制措施须处于智能体无法触及的范围之外。”
关键的架构举措在于将执行机制与智能体运行框架分离。OpenShell利用Linux内核控制机制限制文件系统与进程访问,而策略代理(policy proxy)则管控网络访问。Sentry则在英伟达BlueField-4硬件上增加了一层独立的执行机制。
策略证明器(policy prover):在权限应用前核查其合规性
最具技术独特性的组件是OpenShell的策略证明器,它在策略应用前对其进行验证,而非依赖对智能体行为的评估。英伟达AI软件高级总监阿里·戈尔尚(Ali Golshan)强调,该证明器并非另一个模型。“它是确定性的,基于数学推理,因此这不是‘大语言模型作为裁判’(LLM-as-a-judge),”他指出,并补充称其运行速度比该方法快约两个数量级。
英伟达希望该证明器解决的一个问题是组合式访问(combined access)。戈尔尚举例说明:某策略规定智能体不得从GitHub读取代码并对外发布。智能体可通过启动两个子智能体规避该限制——一个负责从GitHub读取,另一个具备外部访问权限,并令二者相互通信。“它们的组合能力可能超越贵组织设定的全局策略,”他表示。当前,OpenShell的证明器检查建模后的权限是否仍处于定义的策略边界之内。英伟达表示,正致力于将该分析扩展至多个智能体,包括其组合权限无意中创建访问路径的情形。
对IT领导者而言,该证明器提供了一种方式,可在智能体权限实际应用前,核查其是否超出组织所定义的权限限制。这验证的是策略本身,而非正在运行的沙箱是否真正执行了该策略。
Sentry:面向最高风险工作负载的带外看门狗
Sentry增加了第二层独立机制。它运行于英伟达数据处理单元(DPU)BlueField-4之上;该网络卡配备自有处理器,作为一个与主机服务器分离的安全域运行。Sentry的设计目标是在主机遭攻陷的情况下仍持续监控智能体。博伊塔诺将其类比为自动驾驶汽车中的安全岛:一个独立系统,其唯一职责是确保整个系统能够安全失效。
Sentry的观测视角是通向模型的路径。智能体的推理端点经由DPU上的代理路由,因此Sentry可观察每一次模型调用,并检查模型所暴露的推理轨迹。英伟达 技术博客 将“漂移”(drift)描述为智能体偏离其预期任务,通常发生在遭遇拦截、缺陷或反复失败之后。博客指出,多种工具、时间因素及模糊指令的组合可能导致漂移。英伟达表示,Sentry可在毫秒级内检测漂移、在硅芯片层面更新网络策略,并将智能体隔离。
Sentry 基于英伟达(Nvidia)的 DOCA 软件构建,同时还验证每个智能体(agent)的身份及其被委托的权限。在英伟达 Vera Rubin POD 系统中,BlueField-4 已位于每个节点通往模型的唯一路径上;英伟达表示,运行配备 BlueField-4 的 Vera 系统的客户可通过软件更新启用这些保护功能。
博伊塔诺(Boitano)明确指出,大多数组织并不需要这一层防护。他表示:‘在很多情况下,仅在 CPU 上使用 OpenShell 实际上已足够好。’ Sentry 面向的是前沿用例,例如在移除护栏(guardrails)条件下的模型评估与红队测试(red-teaming)。此外还有一个值得留意的实际限制:推理检查(reasoning inspection)在推理过程可见时效果最佳。英伟达的博客明确将对推理过程的完全可见性列为开源模型(open models)的一项优势,而封闭式 API 通常暴露的信息则更少。
从 Claude 托管智能体(Claude Managed Agents)到 Slack 审批:谁正在基于该平台进行开发
合作伙伴集成展示了该技术最有可能率先在企业中落地的应用场景。Anthropic 公司的 Claude 托管智能体已将智能体循环(agent loop)与其执行任务的沙箱(sandbox)分离开来;与 OpenShell 和 BlueField 的集成则为这些沙箱增加了强制执行能力。
SpaceXAI 正在该平台上部署 Cursor 编程智能体及 Grok 模型。Salesforce 已将 OpenShell 与 Slack 集成,使团队能够查看智能体活动,并批准或拒绝其提出的额外权限请求。SAP 正将 OpenShell 嵌入其 Joule Studio 运行时环境。英伟达表示,Canonical、SUSE 和 Red Hat 正将其操作系统集成该平台。
英伟达还将此项工作与由 Linux 基金会(Linux Foundation)管理的 开放安全人工智能联盟(Open Secure AI Alliance)挂钩,该联盟由英伟达联合逾 120 家组织共同发起,旨在共享智能体安全研究与事件调查结果。
IT 领导者当前应采取的行动
实际的入门切入点是 OpenShell。它是免费且开源的,可在大多数组织已有的硬件上运行,并回应了安全团队应对每个智能体部署提出的核心问题:我们能否明确展示该智能体被允许执行的操作,且该限制是否在智能体无法触及的位置得到强制执行?Sentry 是面向正在评估 Vera 与 BlueField-4 基础设施的组织的附加选项,而非使用 OpenShell 的先决条件。
编写足够精确以供验证的策略需投入大量工作,且英伟达的验证器(prover)目前尚未覆盖全部策略功能。OpenShell 是开源的,但 Sentry 的基于硬件的防护依赖于英伟达的 BlueField-4。
更深层次的转变在于责任归属位置的变化。模型对齐(model alignment)本质上是概率性的,而 Hugging Face 事件表明,当它成为最后一道防线时会发生什么。博伊塔诺表示:‘行业不需要承诺严守边界的智能体,而是需要能够证明并强制执行这些边界的系统。’ 对于企业而言,OpenShell 提供了一种在现有基础设施上强制执行智能体权限的方法。Sentry 仍是一项基于硬件的参考设计方案,而跨协作智能体的验证功能尚处于开发阶段。
JOTO 企业落地观察
- 对企业部署而言,OpenShell提供可在现有x86/Arm服务器上免费部署的内核级沙箱能力,使IT团队能明确声明并强制执行每个智能体的文件、网络与工具访问权限,且策略执行点位于智能体不可篡改的基础设施层,降低了对模型对齐的单点依赖。
- 对智能体工程而言,平台将执行框架与智能体逻辑彻底分离,并引入策略证明器(policy prover)在权限生效前验证组合式越权风险——例如多智能体协同绕过‘禁止读GitHub+外发’策略,这要求开发者从设计阶段即考虑权限建模与策略可验证性。
- 对AI安全治理而言,Sentry在BlueField-4 DPU上构建带外监控通路,实现毫秒级漂移检测与硅级策略更新,但其有效性受限于推理轨迹可见性,因此更适配开源模型场景;封闭API环境下的治理能力存在固有信息缺口,需在架构选型时权衡。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


