提示注入合规决策的机制定位研究
先了解这件事
研究者对 4B 至 32B 的五个模型做逐层因果激活修补,考察模型服从提示注入指令的决策层。结果显示,攻击信息从第一层起就可线性解码,但直到网络后三分之一的晚层瓶颈才对行为产生明显因果影响;修补该瓶颈可在所测案例中逆转模型对攻击指令的服从。相关机制位于紧凑线性子空间,不同模型家族呈现相似结构。作者说明这是受测模型和实验设定内的机制研究,不是对任意模型的通用防御保证。后续研究通过反事实角色探针、逐组件激活修补和对 AgentDojo 轨迹的干预,分析间接提示注入中角色信号与行为改变之间的差距:角色解码在内容和格式变化下依然存在,在受控 Qwen 测试中先于沿独立估计的角色方向修补带来的工具选择效应;在 AgentDojo 上,从被劫持和抵抗的训练轨迹估计出的方向在行动前和注入片段位置降低了攻击成功率,但在随机位置效果很小;在较长的 Qwen 轨迹中,单点编辑在较后层效果减弱,跨片段和重复编辑能在同一评测中维持效果。
AI 根据报道生成 · 2 小时前更新
事件进展
- 10月6日 13:30 · 1 篇报道间接提示注入的因果追踪研究
- 9月29日 22:54 · 1 篇报道提示注入合规决策的机制定位研究
后续时间线
- arXiv:越狱、提示注入、投毒与防御研究用因果追踪区分间接提示注入中的可读信号与有效干预
研究通过反事实角色探针、逐组件激活修补和对 AgentDojo 轨迹的干预,分析间接提示注入中角色信号与行为改变之间的差距。角色解码在内容和格式变化下依然存在,在受控 Qwen 测试中先于沿独立估计的角色方向修补带来的工具选择效应。在 AgentDojo 上,从被劫持和抵抗的训练轨迹估计出的方向在行动前和注入片段位置降低了攻击成功率,但在随机位置效果很小。在较长的 Qwen 轨迹中,单点编辑在较后层效果减弱,跨片段和重复编辑能在同一评测集上降低攻击成功率。移除学到的通道子空间仍保留角色解码,但有效干预方向在测试通道间迁移较差。
- arXiv:越狱、提示注入、投毒与防御研究用因果激活修补定位模型服从提示注入指令的决策层
研究者在 4B 至 32B 的五个模型上做逐层因果激活修补,发现攻击信息从第一层起就可线性解码,但直到网络后三分之一的晚层瓶颈才对行为产生明显因果影响。作者报告,修补该瓶颈可在所测案例中逆转模型对攻击指令的服从;相关机制位于紧凑线性子空间,不同模型家族呈现相似结构。这是受测模型和实验设定内的机制研究,不是对任意模型的通用防御保证。
相关讨论
关注度走势
每天新增来源
- 9月29日 新增 1 个来源(1 家媒体、0 个账号)
- 9月30日 新增 0 个来源(0 家媒体、0 个账号)
- 10月1日 新增 0 个来源(0 家媒体、0 个账号)
- 10月2日 新增 0 个来源(0 家媒体、0 个账号)
- 10月3日 新增 0 个来源(0 家媒体、0 个账号)
- 10月4日 新增 0 个来源(0 家媒体、0 个账号)
- 10月5日 新增 0 个来源(0 家媒体、0 个账号)
- 10月6日 新增 0 个来源(0 家媒体、0 个账号)