CoDeL:用协同演化防御抵御 LLM 智能体的间接提示注入
CoDeL: Co-Evolutionary Defense against Indirect Prompt Injection in LLM-based Agents
AI 导读
CoDeL 是一种针对 LLM 智能体间接提示注入的协同演化防御方法,在三个 IPI 基准、九个基线和两个基座模型上把攻击成功率降低 88.5%,并比其他基线高出 38.0%。作者指出,现有训练式防御多在静态的显式注入分布上优化,学到的是表层形式线索而非区分服务用户与服从注入目标的边界,因此当恶意意图被折叠进看似合理的工作流并延迟数轮后就会失效。CoDeL 让防御方每轮通过基于 LoRA 的 GDPO 更新,在安全、任务进度和格式合规的解耦奖励下训练,使拒答注入与完成用户任务共同构成适应度。