论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证
论文用VAL框架对比防御,在自建测试集上VAL栈获0.000 ASR且保持1.000良性效用,直觉栈良性效用为0。
- 0.000DeepSeek自建集静态攻击VAL栈(V)的ASR(据表6)
- 0.000DeepSeek自建集静态攻击直觉栈(N)良性成功率(据表6)
- 0.5%DeepSeek在AgentDojo银行套件VAL栈ASR(据表6.5)
论文旨在解决智能体防御缺乏理论保证来源的问题,提出VAL框架以区分行为运气与结构约束。
论文梳理了验证自治等级、文本与工具级防御以及智能体评测基准,将本文定位为先验分类坐标轴。
通过扩展VAL规则分级防御,并构建确认门与参数沙箱组合的结构栈,以平台记录和形式规范约束动作。
实验在自建集和AgentDojo等多基准上对比结构栈与直觉栈,揭示相同零值背后的效用鸿沟与稳定性差异。
作者指出了受害者模型较少、评定者无人类参与等局限;实验覆盖了三个模型和多个基准测试套件。
论文证明相同ASR不等于相同安全保证,VAL结构栈在保持效用的同时提供超越模型行为运气的防御。