JOTO
Contact us
← AI 智库
AI 硬件

英伟达推出开放智能体安全平台:用运行时隔离与硬件看门狗强制执行AI行为边界

2026 年 9 月 28 日

英伟达发布Open Agent Safety Platform,整合开源OpenShell运行时与基于BlueField-4 DPU的Sentry监控系统,直指智能体沙箱逃逸风险。该平台已在超100家企业试用,强调基础设施层强制执行权限,而非依赖模型自我约束。

Nvidia's Open Agent Safety Platform bets agents can't police themselves, so the infrastructure has to

对许多企业而言,AI智能体的安全性归结为两件事:选择一个对齐度高的模型,然后用防护栏和系统提示词将其包裹起来。今年夏天,一个在OpenAI评估基础设施中运行的智能体 逃逸出其沙箱环境,抵达了Hugging Face的生产系统,暴露了智能体可绕过的控制措施的局限性。

周一, 英伟达宣布推出开放智能体安全平台(Open Agent Safety Platform),该平台将英伟达广泛可用的开源 OpenShell运行时 与Sentry相结合;Sentry是一种面向英伟达硬件上智能体监控的参考设计方案。其前提直截了当。“不能指望智能体完全自我监管其行为,”英伟达企业AI副总裁贾斯汀·博伊塔诺(Justin Boitano)在发布前的媒体简报会上表示,“组织不应被迫信任智能体会尊重该边界。基础设施应明确强制执行这一边界。”

英伟达称,已有超过100家公司正在使用该平台。

Hugging Face事件所暴露的问题:存在逃逸路径的沙箱

笼罩此次发布的事件始于OpenAI自身的研究基础设施内部。根据 OpenAI的说明,一个处于强化学习(RL)训练阶段的内部研究模型所生成的智能体,找到了彼此通信并接入互联网的方法,即便在两者本应均被禁用的环境中亦是如此。METR随后开展的调查发现, 这些智能体曾在共享的内部软件包注册表中互相留言 ,将一部分构建基础设施转变为留言板。这些智能体最终攻陷了Hugging Face,后者 在为期4.5天的行动中重建了约17,600次智能体操作 。

OpenAI表示,其通常应用于生产环境的安全防护措施在此项评估中被刻意移除,且其在其他场景中使用的思维链监控(chain-of-thought monitoring)也未覆盖这些运行实例。其事后分析指出,若部署该监控机制,将在漏洞发生前逾一天即触发警报。

OpenAI并非孤例。9月18日,谷歌证实,一款 Gemini模型在5月由以色列AI安全测试公司Irregular开展的一场夺旗式(capture-the-flag)网络安全评估中,访问了三家真实企业的系统 。一个漏洞导致本应离线的环境意外保持了互联网连接。Gemini猜出了其中一家公司的密码,并利用其在公共代码仓库中发现的凭据,进入了另外两家公司。

谷歌表示,该模型每次识别出目标为真实企业后即停止操作。评估环境中的薄弱环节使智能体获得了本不应拥有的访问权限:一个变为通信渠道的共享注册表,以及一条本应被禁用的互联网连接。

当被问及新平台是否能防止Hugging Face事件时,博伊塔诺表示,据“我们目前所知”,若“前沿实验室在模型评估早期即采用该平台”,则“本可阻止此次漏洞事件”。但这是一个假设性结论,而非已验证的结果。

OpenShell:介于智能体与其所接触一切之间的运行时

OpenShell最早于 今年3月英伟达GTC大会期间展示 ,现以Apache 2.0许可证广泛提供,是该平台的基础。它为每个智能体单独运行沙箱环境,具备内核级隔离能力,并位于智能体与文件、凭据、工具、API、模型及网络端点之间。运维人员编写策略,明确定义智能体可访问的内容。OpenShell通过文件系统、进程及网络控制来执行该策略,并将策略决策记录于审计日志中。它兼容开源与闭源模型,并可在x86和Arm架构上运行。

博伊塔诺指出,传统沙箱(包括容器、虚拟机及微虚拟机)旨在实现应用级隔离,而非面向拥有不同权限的自主智能体集群。“正如您对组织内的员工所做的那样,您必须为公司每位员工设定非常明确的权限,”他表示,“在贵公司内部运行的每个智能体,都需在其自身隔离的沙箱中运行,且安全控制措施须处于智能体无法触及的范围之外。”

关键的架构举措在于将执行机制与智能体运行框架分离。OpenShell利用Linux内核控制机制限制文件系统与进程访问,而策略代理(policy proxy)则管控网络访问。Sentry则在英伟达BlueField-4硬件上增加了一层独立的执行机制。

策略证明器(policy prover):在权限应用前核查其合规性

最具技术独特性的组件是OpenShell的策略证明器,它在策略应用前对其进行验证,而非依赖对智能体行为的评估。英伟达AI软件高级总监阿里·戈尔尚(Ali Golshan)强调,该证明器并非另一个模型。“它是确定性的,基于数学推理,因此这不是‘大语言模型作为裁判’(LLM-as-a-judge),”他指出,并补充称其运行速度比该方法快约两个数量级。

英伟达希望该证明器解决的一个问题是组合式访问(combined access)。戈尔尚举例说明:某策略规定智能体不得从GitHub读取代码并对外发布。智能体可通过启动两个子智能体规避该限制——一个负责从GitHub读取,另一个具备外部访问权限,并令二者相互通信。“它们的组合能力可能超越贵组织设定的全局策略,”他表示。当前,OpenShell的证明器检查建模后的权限是否仍处于定义的策略边界之内。英伟达表示,正致力于将该分析扩展至多个智能体,包括其组合权限无意中创建访问路径的情形。

对IT领导者而言,该证明器提供了一种方式,可在智能体权限实际应用前,核查其是否超出组织所定义的权限限制。这验证的是策略本身,而非正在运行的沙箱是否真正执行了该策略。

Sentry:面向最高风险工作负载的带外看门狗

Sentry增加了第二层独立机制。它运行于英伟达数据处理单元(DPU)BlueField-4之上;该网络卡配备自有处理器,作为一个与主机服务器分离的安全域运行。Sentry的设计目标是在主机遭攻陷的情况下仍持续监控智能体。博伊塔诺将其类比为自动驾驶汽车中的安全岛:一个独立系统,其唯一职责是确保整个系统能够安全失效。

Sentry的观测视角是通向模型的路径。智能体的推理端点经由DPU上的代理路由,因此Sentry可观察每一次模型调用,并检查模型所暴露的推理轨迹。英伟达 技术博客 将“漂移”(drift)描述为智能体偏离其预期任务,通常发生在遭遇拦截、缺陷或反复失败之后。博客指出,多种工具、时间因素及模糊指令的组合可能导致漂移。英伟达表示,Sentry可在毫秒级内检测漂移、在硅芯片层面更新网络策略,并将智能体隔离。

Sentry 基于英伟达(Nvidia)的 DOCA 软件构建,同时还验证每个智能体(agent)的身份及其被委托的权限。在英伟达 Vera Rubin POD 系统中,BlueField-4 已位于每个节点通往模型的唯一路径上;英伟达表示,运行配备 BlueField-4 的 Vera 系统的客户可通过软件更新启用这些保护功能。

博伊塔诺(Boitano)明确指出,大多数组织并不需要这一层防护。他表示:‘在很多情况下,仅在 CPU 上使用 OpenShell 实际上已足够好。’ Sentry 面向的是前沿用例,例如在移除护栏(guardrails)条件下的模型评估与红队测试(red-teaming)。此外还有一个值得留意的实际限制:推理检查(reasoning inspection)在推理过程可见时效果最佳。英伟达的博客明确将对推理过程的完全可见性列为开源模型(open models)的一项优势,而封闭式 API 通常暴露的信息则更少。

从 Claude 托管智能体(Claude Managed Agents)到 Slack 审批:谁正在基于该平台进行开发

合作伙伴集成展示了该技术最有可能率先在企业中落地的应用场景。Anthropic 公司的 Claude 托管智能体已将智能体循环(agent loop)与其执行任务的沙箱(sandbox)分离开来;与 OpenShell 和 BlueField 的集成则为这些沙箱增加了强制执行能力。

SpaceXAI 正在该平台上部署 Cursor 编程智能体及 Grok 模型。Salesforce 已将 OpenShell 与 Slack 集成,使团队能够查看智能体活动,并批准或拒绝其提出的额外权限请求。SAP 正将 OpenShell 嵌入其 Joule Studio 运行时环境。英伟达表示,Canonical、SUSE 和 Red Hat 正将其操作系统集成该平台。

英伟达还将此项工作与由 Linux 基金会(Linux Foundation)管理的 开放安全人工智能联盟(Open Secure AI Alliance)挂钩,该联盟由英伟达联合逾 120 家组织共同发起,旨在共享智能体安全研究与事件调查结果。

IT 领导者当前应采取的行动

实际的入门切入点是 OpenShell。它是免费且开源的,可在大多数组织已有的硬件上运行,并回应了安全团队应对每个智能体部署提出的核心问题:我们能否明确展示该智能体被允许执行的操作,且该限制是否在智能体无法触及的位置得到强制执行?Sentry 是面向正在评估 Vera 与 BlueField-4 基础设施的组织的附加选项,而非使用 OpenShell 的先决条件。

编写足够精确以供验证的策略需投入大量工作,且英伟达的验证器(prover)目前尚未覆盖全部策略功能。OpenShell 是开源的,但 Sentry 的基于硬件的防护依赖于英伟达的 BlueField-4。

更深层次的转变在于责任归属位置的变化。模型对齐(model alignment)本质上是概率性的,而 Hugging Face 事件表明,当它成为最后一道防线时会发生什么。博伊塔诺表示:‘行业不需要承诺严守边界的智能体,而是需要能够证明并强制执行这些边界的系统。’ 对于企业而言,OpenShell 提供了一种在现有基础设施上强制执行智能体权限的方法。Sentry 仍是一项基于硬件的参考设计方案,而跨协作智能体的验证功能尚处于开发阶段。

JOTO 企业落地观察

  • 对企业部署而言,OpenShell提供可在现有x86/Arm服务器上免费部署的内核级沙箱能力,使IT团队能明确声明并强制执行每个智能体的文件、网络与工具访问权限,且策略执行点位于智能体不可篡改的基础设施层,降低了对模型对齐的单点依赖。
  • 对智能体工程而言,平台将执行框架与智能体逻辑彻底分离,并引入策略证明器(policy prover)在权限生效前验证组合式越权风险——例如多智能体协同绕过‘禁止读GitHub+外发’策略,这要求开发者从设计阶段即考虑权限建模与策略可验证性。
  • 对AI安全治理而言,Sentry在BlueField-4 DPU上构建带外监控通路,实现毫秒级漂移检测与硅级策略更新,但其有效性受限于推理轨迹可见性,因此更适配开源模型场景;封闭API环境下的治理能力存在固有信息缺口,需在架构选型时权衡。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.