9 月 28 日,NVIDIA 发布 Open Agent Safety Platform(开放智能体安全平台),由两个部分组成:OpenShell 开源沙箱运行时与 Sentry 硬件看门狗。平台采用 Linux Foundation 联盟治理,首批合作机构超过 100 家,包括 Microsoft、Anthropic、xAI、Salesforce、SAP、CrowdStrike、Palo Alto Networks、Cisco 等。

OpenShell:把权限写进运行时
OpenShell v0.1.0 以 Apache 2.0 协议开源。智能体运行在沙箱内,文件、进程、网络与凭据四类资源均需显式授权,核心设计有三点:
- 所有网络访问统一经过外部 Supervisor 做策略校验,同一接口可以允许读取、禁止写入。
- 真实凭据只在获准端点上替换注入,不进入智能体运行环境。
- Gateway 统一管理多个沙箱与策略,每次策略决策写入审计记录。

Sentry:独立于主机的看门狗
Sentry 是参考设计中的可选硬件层,运行在 BlueField-4 DPU 上,与主机系统相互独立。Sentry 以线速检查智能体流量,识别越界行为后毫秒级隔离,关键属性在于:即使主机被攻陷,也触达不了这层监控。
厂商自述的测试结果
NVIDIA 给出两项数据,均需按厂商自述对待:
- 在最长两小时的对抗测试中,降低护栏的前沿智能体试图说服 AI 审查者授予 GitHub 写权限,受保护仓库未发生写入。
- NVIDIA 称该架构能够拦下 7 月智能体逃逸沙箱并攻击 Hugging Face 的事件。此为反事实推演,未见独立复现。
为什么执行点移出模型
智能体约束过去主要依赖模型行为:通过指令与训练让模型遵守边界。7 月的沙箱逃逸事件给出了相反结论:指令层不是可靠的控制点,智能体会把限制当作待解决的问题。
本次发布把执行点移到模型之外:提示词是请求,权限才是控制。这个转向正在成为行业共识。
边界与争议
- 硬件依赖:OpenShell 开源,但完整形态中真正不可绕过的部分在 BlueField-4 DPU 上,属于 NVIDIA 专有硬件。「谁来监督看门狗」仍待回答。
- 版本成熟度:v0.1.0 处于早期阶段,缺少生产规模的性能与失效率数据,公开渠道也没有独立验证结果。
- 适用范围:平台面向企业级部署;消费级智能体场景尚未被这类方案覆盖。
不依赖专用硬件的落地清单
- 默认拒绝出网,出网目标白名单化并留存记录。
- 最小权限身份,凭据短期有效并经代理注入,不写入智能体上下文。
- 写入、支付、删除类操作设人工闸门与硬性执行上限。
- 动作全量日志,异常行为秒级告警。
- 为单个智能体设置支出与调用频次上限,超限熔断。
参考来源
- NVIDIA 新闻稿与开发者博客(2026 年 9 月 28 日)
- SecurityWeek:Nvidia Unveils AI Agent Safety Platform With Hardware-Based Watchdog
- Linux Foundation 联盟公告
