论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证
提出VAL框架并用确认门与参数沙箱约束高风险工具调用
- 一句话定位:论文应用验证自主权等级(VAL)剖析 LLM 智能体防御,揭示表面相同的 0.000 ASR 背后的结构保证与行为运气之别。
- 要解决的问题:现有智能体防御缺乏解释其保证来源的统一坐标轴,经验测试下的零成功率无法预示防御在面对新攻击或不同环境时的真实效力。
- 方法要点:依据规范来源将防御划分为 L0(模型自声明)至 L5(通用完备),主张锚点决定防御失效边界;在同等预算下构建由确认门(L1/L2)与参数沙箱(L3)构成的 VAL 结构栈,对比提示词硬化(L0)与关键词过滤(L1)构成的直觉栈。
- 核心实验结果:在自建测试集上,VAL 栈实现 0.000 ASR 并保持 1.000 良性成功率,直觉栈虽同获 0.000 ASR 但良性成功率降为 0.000(两者差异在 p < 0.001 下显著);在 AgentDojo 银行套件上,VAL 栈将 ASR 降至 0.5%(无防御为 4.3%),直觉栈 ASR 漂移至 1.9%;在 7 轮升级攻击中,确认门即使被诱导顺从 83.3% 仍实现完全阻断。
- 作者结论与启示:作者认为零攻击成功率只是测试结果而非理论保证,直觉防御依赖模型情绪且极易破坏实用性,而智能体安全的有效防线在于限制动作空间的结构隔离(L3)而非开放语义判断。