跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.05295· Zhe Yu, Wenpeng Xing, Xingxing Yang, Meng Han·本站收录 · 原文发表 日期未标

研究用因果追踪区分间接提示注入中的可读信号与有效干预

Readable Before Actionable: Causal Tracing of Indirect Prompt Injection

AI 导读

研究通过反事实角色探针、逐组件激活修补和对 AgentDojo 轨迹的干预,分析间接提示注入中角色信号与行为改变之间的差距。角色解码在内容和格式变化下依然存在,在受控 Qwen 测试中先于沿独立估计的角色方向修补带来的工具选择效应。在 AgentDojo 上,从被劫持和抵抗的训练轨迹估计出的方向在行动前和注入片段位置降低了攻击成功率,但在随机位置效果很小。在较长的 Qwen 轨迹中,单点编辑在较后层效果减弱,跨片段和重复编辑能在同一评测集上降低攻击成功率。移除学到的通道子空间仍保留角色解码,但有效干预方向在测试通道间迁移较差。

阅读原文arxiv.org