跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.34463· Xiao Yang·· 4 天前

CoDeL:用协同演化防御抵御 LLM 智能体的间接提示注入

CoDeL: Co-Evolutionary Defense against Indirect Prompt Injection in LLM-based Agents

AI 导读

CoDeL 是一种针对 LLM 智能体间接提示注入的协同演化防御方法,在三个 IPI 基准、九个基线和两个基座模型上把攻击成功率降低 88.5%,并比其他基线高出 38.0%。作者指出,现有训练式防御多在静态的显式注入分布上优化,学到的是表层形式线索而非区分服务用户与服从注入目标的边界,因此当恶意意图被折叠进看似合理的工作流并延迟数轮后就会失效。CoDeL 让防御方每轮通过基于 LoRA 的 GDPO 更新,在安全、任务进度和格式合规的解耦奖励下训练,使拒答注入与完成用户任务共同构成适应度。

阅读原文arxiv.org