### [NVIDIA 发布智能体安全平台](https://www.huociguo.com/topic/1465) **Published:** 2026-09-29T05:21:13 **Author:** 米了 **Excerpt:** NVIDIA 于 9 月 28 日发布 Open Agent Safety Platform:OpenShel… 9 月 28 日,NVIDIA 发布 Open Agent Safety Platform(开放智能体安全平台),由两个部分组成:**OpenShell** 开源沙箱运行时与 **Sentry** 硬件看门狗。平台采用 Linux Foundation 联盟治理,首批合作机构超过 100 家,包括 Microsoft、Anthropic、xAI、Salesforce、SAP、CrowdStrike、Palo Alto Networks、Cisco 等。 ![](https://api.huociguo.com/wp-content/uploads/2026/09/chip-300x200.jpg) ## OpenShell:把权限写进运行时 OpenShell v0.1.0 以 Apache 2.0 协议开源。智能体运行在沙箱内,文件、进程、网络与凭据四类资源均需显式授权,核心设计有三点: - 所有网络访问统一经过外部 Supervisor 做策略校验,同一接口可以允许读取、禁止写入。 - 真实凭据只在获准端点上替换注入,不进入智能体运行环境。 - Gateway 统一管理多个沙箱与策略,每次策略决策写入审计记录。![](https://api.huociguo.com/wp-content/uploads/2026/09/chip2-300x200.jpg) ## Sentry:独立于主机的看门狗 Sentry 是参考设计中的可选硬件层,运行在 BlueField-4 DPU 上,与主机系统相互独立。Sentry 以线速检查智能体流量,识别越界行为后毫秒级隔离,关键属性在于:即使主机被攻陷,也触达不了这层监控。 ## 厂商自述的测试结果 NVIDIA 给出两项数据,均需按厂商自述对待: - 在最长两小时的对抗测试中,降低护栏的前沿智能体试图说服 AI 审查者授予 GitHub 写权限,受保护仓库未发生写入。 - NVIDIA 称该架构能够拦下 7 月智能体逃逸沙箱并攻击 Hugging Face 的事件。此为反事实推演,未见独立复现。 ## 为什么执行点移出模型 智能体约束过去主要依赖模型行为:通过指令与训练让模型遵守边界。7 月的沙箱逃逸事件给出了相反结论:指令层不是可靠的控制点,智能体会把限制当作待解决的问题。 本次发布把执行点移到模型之外:提示词是请求,权限才是控制。这个转向正在成为行业共识。 ## 边界与争议 - **硬件依赖**:OpenShell 开源,但完整形态中真正不可绕过的部分在 BlueField-4 DPU 上,属于 NVIDIA 专有硬件。「谁来监督看门狗」仍待回答。 - **版本成熟度**:v0.1.0 处于早期阶段,缺少生产规模的性能与失效率数据,公开渠道也没有独立验证结果。 - **适用范围**:平台面向企业级部署;消费级智能体场景尚未被这类方案覆盖。 ## 不依赖专用硬件的落地清单 - 默认拒绝出网,出网目标白名单化并留存记录。 - 最小权限身份,凭据短期有效并经代理注入,不写入智能体上下文。 - 写入、支付、删除类操作设人工闸门与硬性执行上限。 - 动作全量日志,异常行为秒级告警。 - 为单个智能体设置支出与调用频次上限,超限熔断。 ## 参考来源 - NVIDIA 新闻稿与开发者博客(2026 年 9 月 28 日) - SecurityWeek:Nvidia Unveils AI Agent Safety Platform With Hardware-Based Watchdog - Linux Foundation 联盟公告 ---