CoER:用对抗协同演化与精炼防御自适应间接提示注入
CoER: Defending against Adaptive Indirect Prompt Injection via Adversarial Co-Evolution and Refinement
AI 导读
研究者提出 CoER,将带有多轮工具调用和多次注入的任务建模为一般和马尔可夫博弈,以此训练能够适应不断演化的攻击者的防御方案。该方法先用成功轨迹初始化攻击者,再用双边对抗强化学习(BA-RL)保留双方的历史策略作为对手种群并混合新旧对手,随后复用这些攻击者挑战教师智能体,只用经安全性验证并通过任务完成的示范来微调共同演进的防御者。在七个领域、三个随机种子上,CoER 将自适应攻击成功率从 41.3% 降至 0.2%,并将安全完成率从 39.6% 提高到 76.2%。外部基准上也表现出更强的抗攻击能力,消融实验进一步验证了历史对手混合与基于种群的精炼的有效性。
论文速读
- 工具型语言模型 agent 在调用工具时易受 indirect prompt injection(IPI)攻击:不可信工具输出中隐藏的指令会悄悄改变合法任务执行。现有防御多针对固定攻击训练和评估,攻击者不随防御者行为调整,因此面对真实场景中的自适应攻击可能失效。
- 作者提出 CoER,把任务内交错的工具调用与自适应注入建模为 general-sum Markov game:防御者通过连续工具调用推进任务,攻击者可在同一任务内多次注入并依据公开执行反馈调整后续攻击。先用成功轨迹做 Attacker SFT,再用 bilateral adversarial RL 保留双方历史策略作为对手池并混合当前与历史对手训练;随后用这些攻击者挑战教师 agent,仅用同时通过安全与任务完成验证的示范微调共同演化的防御者。
- 在七个领域、三个评估种子上,CoER 将 1,187 个自适应案例的平均攻击成功率从 Base 的 41.31% 降到 0.22%,安全任务完成率从 39.60% 升到 76.24%。InjecAgent 与 AgentLAB 上攻击抵抗力提升;冻结交叉对局显示攻击能力增强,消融显示双边历史对手混合与种群引导精炼均有效,攻击者会利用执行反馈调整后续注入。
- 精炼阶段增加数据生成成本并依赖强教师;三阶段流程须顺序执行,种群管理引入未充分刻画敏感性的超参数。评估仅覆盖七个 AgentDyn 套件,对其他 agent 框架、非文本模态或更大骨干的泛化未测试;攻击者与防御者共享同一基座模型,异构攻击者可能暴露同族共演化遗漏的弱点。改进奖励设计或引入多样攻击者种群是可能方向。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文把工具智能体的自适应间接提示注入建模为多轮博弈,用攻防协同演化加教师示范微调,给出跨七个域的攻防成功率与安全任务完成率对比。