跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.04504· YaJie Yin·本站收录 · 原文发表 精选关注度31

论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证

The Same Zero: Why Identical ASR Can Imply Different Guarantees in LLM-Agent Security

AI 导读

论文将 Verification Autonomy Levels(VAL)框架应用于 22 项 Agent 安全防御,按验证规范的来源把防御分为 L0 到 L5 六级,主张防御的等级由锚点而非准确率决定,锚点同时决定其失效模式。作者在自建测试床(50 个场景、12 种攻击变体、DeepSeek-chat)上以同等预算对比两套防御栈:VAL 引导栈(确认门加 schema 沙箱)在 0.000 攻击成功率下保持 1.000 良性成功率,而主流直觉栈(提示词加固加关键词过滤)虽同样达到 0.000 ASR,却使全部良性动作失败。在攻击面更强的测试环境中,直觉栈的零值会漂移(0→1.9%→6.2%),VAL 栈在其操作设计域内保持稳定。在 AgentDojo 官方 banking 套件上,VAL 栈达到 0.5% ASR、79.7% 效用,未防御基线为 4.3% ASR、86.6% 效用。

深度解读生成中

推荐理由

论文提出按验证锚点分级的方法,解释同样 0% 攻击成功率为何对应不同安全保证,并给出跨基准的部署对比数据。

阅读原文arxiv.org