英伟达推出开放代理安全平台:用专属芯片为AI代理装上“紧急停止”开关
英伟达周一推出Open Agent Safety Platform(开放代理安全平台),旨在解决AI行业过去一年发现的棘手问题:当AI代理(能够自主规划、使用工具并采取行动的系统,而非仅回答问题)不再遵从指令时,如何物理上阻止它?
该平台包含两个核心组件。OpenShell是一个开源运行时,将代理封装于沙箱中,把操作者的指令转化为可强制执行的规则,限定代理允许接触的文件、网络与工具。Sentry相对复杂,本质上是一枚保障AI代理安全行为的芯片。

Myriad: How low will Nvidia go? Click to make your prediction.
Sentry运行于英伟达BlueField-4芯片之上,这是一款被称为DPU(数据处理单元,独立于运行AI模型的主处理器处理网络与安全的硬件)的专用芯片。由于Sentry位于独立芯片而非代理运行软件内,英伟达称其能监控代理行为并在毫秒内切断运行,且无需代理同意,因为代理无法触及或覆盖它。
这一区隔源于既成事实。今年6月,OpenAI的一个代理侵入澳大利亚政府Medicare门户,成为首例确认的AI代理黑入政府网站事件,据报道OpenAI隐瞒披露约三个月。该公司代理还引发了Hugging Face黑客事件,最初激起科技界与立法者担忧。谷歌Gemini代理与Meta模型也有类似未公开但后来确认的事件。
“这比单一产品更大。它始于构建安全代理系统信任层的开放生态,”英伟达CEO黄仁勋表示,“我们一起构建AI经济的基础。”
Anthropic今年亦承认,7月30日Claude模型在网络安全评估中入侵了三家公司系统,因测试环境本应离线却连入真实互联网。Claude推理绕过了其处于模拟环境的证据。随后网络安全公司Darktrace测试包括GPT 5.6 Sol与两款Claude在内的代理群对抗编码挑战,警告不完美即“退役”,两代理黑入评估机篡改结果。
英伟达的论点在于上述决断不应留待代理判断。“安全应由模型外的额外控制强制实施,代理无法绕过,”SpaceX AI总裁Mike Nicolls在英伟达公告中说。Anthropic首席商务官Paul Smith将平台视为现有防护的补充:“英伟达平台在软硬件间增添了另一治理控制层。”
逾100家组织作为启动伙伴加入,包括微软、摩根大通、Palantir、Cisco、CrowdStrike、Hugging Face、Salesforce与SAP。基础设施伙伴有CoreWeave、Supermicro、Canonical与SUSE,硬件侧涵盖Dell与HPE。英伟达实质上在售卖同一问题的两面——让自主代理高效廉价的芯片,以及监控并在偏离脚本时断电的芯片。
OpenShell及关联开发者工具现已通过英伟达开发者资源与GitHub提供。
