跳到正文
10月8日 · 周四

红队 · 论文

找到 2 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 防御arXiv:2610.04504 ·

    论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证

    提出VAL框架并用确认门与参数沙箱约束高风险工具调用

    测试
    DeepSeek-chat、Meta Llama 3.1 8B、Kimi应用层
    场景
    AI Agent
    摘要论文证明相同ASR不等于相同安全保证,VAL结构栈在保持效用的同时提供超越模型行为运气的防御。
    • 一句话定位:论文应用验证自主权等级(VAL)剖析 LLM 智能体防御,揭示表面相同的 0.000 ASR 背后的结构保证与行为运气之别。
    • 要解决的问题:现有智能体防御缺乏解释其保证来源的统一坐标轴,经验测试下的零成功率无法预示防御在面对新攻击或不同环境时的真实效力。
    • 方法要点:依据规范来源将防御划分为 L0(模型自声明)至 L5(通用完备),主张锚点决定防御失效边界;在同等预算下构建由确认门(L1/L2)与参数沙箱(L3)构成的 VAL 结构栈,对比提示词硬化(L0)与关键词过滤(L1)构成的直觉栈。
    • 核心实验结果:在自建测试集上,VAL 栈实现 0.000 ASR 并保持 1.000 良性成功率,直觉栈虽同获 0.000 ASR 但良性成功率降为 0.000(两者差异在 p < 0.001 下显著);在 AgentDojo 银行套件上,VAL 栈将 ASR 降至 0.5%(无防御为 4.3%),直觉栈 ASR 漂移至 1.9%;在 7 轮升级攻击中,确认门即使被诱导顺从 83.3% 仍实现完全阻断。
    • 作者结论与启示:作者认为零攻击成功率只是测试结果而非理论保证,直觉防御依赖模型情绪且极易破坏实用性,而智能体安全的有效防线在于限制动作空间的结构隔离(L3)而非开放语义判断。
    完整解读
  2. 防御arXiv:2609.34518 ·

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出工具智能体的状态攻击DART与预执行防御SAGE

    测试
    GPT-5.6 Luna、GPT-5.6 Terra、Gemini 3.8 Flash 等 8 个应用层
    场景
    AI Agent
    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。
    • 论文定位:该研究从部分可观测状态控制视角研究基于工具调用的语言模型智能体安全,提出了状态控制形式化框架 SEAD 及相应的攻击方法 DART 与预执行防御方法 SAGE。
    • 面临的核心问题:在工具智能体中,攻击者可将危害拆解为看似良性的多步操作,危害最终体现为外部环境状态的持久改变;而各角色仅具有部分可观测性,缺乏环境状态证据导致无法区分合法准备操作与有害越界。
    • 核心方法设计:攻击方法 DART 在已执行前缀树上展开搜索,利用工具执行的真实环境反馈指导分支扩展;防御方法 SAGE 在待执行动作生效前介入,通过有限步私有只读环境查询获取状态证据,消除状态歧义后再做放行或拦截决策。
    • 关键实验结果:在 187 个恶意任务上,DART 在 4 个目标模型上的 Semantic ASR 达到 43.9%–73.3%,Hard ASR 达到 33.2%–54.7%,较对应最佳基线分别提升 18.8–35.9 和 8.1–17.9 个百分点(Table 2);在 75 任务子集的离线评测中,SAGE 取得 95.79% 的良性通过率与 34.55% 的精确闭环拦截率,综合指标 F1 达 50.78%、F2 达 72.86%(Table 3);在线防御中,SAGE 将 DART 对 GPT-5.6 Luna 的 Hard ASR 从 48.0% 降至 4.0%(Figure 3),并在未参与训练的 PostgreSQL 与 Web 任务中展现出跨领域防御能力(Table 5)。
    • 作者结论与启示:作者认为,工具调用将智能体安全转化为围绕关键状态转移的部分可观测控制问题;单纯依赖对话语义或孤立动作难以可靠判断危害,将环境状态证据与执行反馈纳入攻防闭环是提升智能体安全评估与防御能力的关键路径。
    完整解读
已经到底了