2026年9月21日,NVIDIA发布了一篇关于AI智能体安全的文章。对于考虑将任务交给智能体的品牌(Maison)而言,第一个问题要向管理层提出:谁能对智能体说不,凭借什么手段?
一个附件,一次导出
署名该文的萨沙·兹杰拉尔(Saša Zdjelar)设想了一个三行就能讲完的场景。一个智能体正在更新客户档案。在一份附件中,它遇到了恶意指令,并试图将数据导出到未经授权的目的地。据NVIDIA称,网络策略必须阻止这次传输。受保护的日志还必须记录工具调用、授权决定及其结果,以便安全团队知道使用了哪个工具,以及智能体的目标是哪个目的地。
修改档案的权限并不赋予导出档案的权限。智能体可以申请额外的访问权限,但不能自行授予自己。
指令与围栏
NVIDIA写道,即便智能体做出错误决定,安全边界也必须稳固。指令和防护栏可以引导其行为,但其运行环境必须对文件、网络目的地和进程施加限制,而不依赖于智能体的推理。要求智能体谨慎,就是指望它在恰恰被欺骗的那一天做出回应。
该厂商将OpenShell介绍为一个开源运行环境,在智能体无法触及之处执行策略,并将其工作隔离在沙盒中。Cisco(DefenseClaw,一个治理层)和JFrog(对智能体可使用的技能进行验证)与之对接。需要保留意见:NVIDIA在此描述的是自己的产品及其联盟伙伴的产品,文章既没有提供测量数据,也没有测试结果。这并不证明这些工具会失败,只说明这份文本并未证实其承诺。
上线前应要求的四件事
让我们做个转换,但并不声称描述的是真实案例。一个受托在文献库中查找某条参考资料的智能体,没有任何理由读取客户的联系方式。一个准备草稿的工具,没有任何理由能够将其发布。这两项拒绝首先是管理层的决定,然后才是信息技术方面的设置。
文章由此得出四项要求。每个智能体都带有可追溯的身份,以及仅限于其任务的凭证。事先的测试表明,这些控制措施可以阻止获取超出范围的凭证,以及将敏感数据发送到未经授权的目的地。这些测试在模型、工具或工作流程发生任何变化后都要重做。一名被指定的负责人根据结果决定系统是否可以投入生产,并且有撤销访问权限和遏制事故的程序。
供应商可以出售围栏。但无法代替管理层写下智能体有权触碰什么。只要品牌(Maison)还不能补全这句话——“这个智能体可以读取这个,修改那个,只有这个人可以暂停它”——工具的选择就无关紧要。
Cette publication est également disponible en :
