AI智能体即使出错,也不应能做的事

by PASCAL IAKOVOU
0 comments

2026年9月21日,NVIDIA发布了一篇关于AI智能体安全的文章。对于考虑将任务交给智能体的品牌(Maison)而言,第一个问题要向管理层提出:谁能对智能体说不,凭借什么手段?

一个附件,一次导出

署名该文的萨沙·兹杰拉尔(Saša Zdjelar)设想了一个三行就能讲完的场景。一个智能体正在更新客户档案。在一份附件中,它遇到了恶意指令,并试图将数据导出到未经授权的目的地。据NVIDIA称,网络策略必须阻止这次传输。受保护的日志还必须记录工具调用、授权决定及其结果,以便安全团队知道使用了哪个工具,以及智能体的目标是哪个目的地。

修改档案的权限并不赋予导出档案的权限。智能体可以申请额外的访问权限,但不能自行授予自己。

指令与围栏

NVIDIA写道,即便智能体做出错误决定,安全边界也必须稳固。指令和防护栏可以引导其行为,但其运行环境必须对文件、网络目的地和进程施加限制,而不依赖于智能体的推理。要求智能体谨慎,就是指望它在恰恰被欺骗的那一天做出回应。

该厂商将OpenShell介绍为一个开源运行环境,在智能体无法触及之处执行策略,并将其工作隔离在沙盒中。Cisco(DefenseClaw,一个治理层)和JFrog(对智能体可使用的技能进行验证)与之对接。需要保留意见:NVIDIA在此描述的是自己的产品及其联盟伙伴的产品,文章既没有提供测量数据,也没有测试结果。这并不证明这些工具会失败,只说明这份文本并未证实其承诺。

上线前应要求的四件事

让我们做个转换,但并不声称描述的是真实案例。一个受托在文献库中查找某条参考资料的智能体,没有任何理由读取客户的联系方式。一个准备草稿的工具,没有任何理由能够将其发布。这两项拒绝首先是管理层的决定,然后才是信息技术方面的设置。

文章由此得出四项要求。每个智能体都带有可追溯的身份,以及仅限于其任务的凭证。事先的测试表明,这些控制措施可以阻止获取超出范围的凭证,以及将敏感数据发送到未经授权的目的地。这些测试在模型、工具或工作流程发生任何变化后都要重做。一名被指定的负责人根据结果决定系统是否可以投入生产,并且有撤销访问权限和遏制事故的程序。

供应商可以出售围栏。但无法代替管理层写下智能体有权触碰什么。只要品牌(Maison)还不能补全这句话——“这个智能体可以读取这个,修改那个,只有这个人可以暂停它”——工具的选择就无关紧要。

Cette publication est également disponible en : English (英语) Français (法语) Deutsch (德语) Italiano (意大利语) Español (西班牙语) العربية (阿拉伯语) 日本語 (日语) Русский (俄语) Ελληνικά (希腊语)

LUXSURE LETTER

Le luxe, sélectionné plutôt que subi.

Recevez notre sélection éditoriale consacrée aux Maisons, aux idées et aux mutations qui façonnent le luxe contemporain.

RECEVOIR LUXSURE LETTER → DÉCOUVRIR LE MAGAZINE →

Related Articles