跳到正文
事件持续更新

提示注入合规决策的机制定位研究

2 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

研究者对 4B 至 32B 的五个模型做逐层因果激活修补,考察模型服从提示注入指令的决策层。结果显示,攻击信息从第一层起就可线性解码,但直到网络后三分之一的晚层瓶颈才对行为产生明显因果影响;修补该瓶颈可在所测案例中逆转模型对攻击指令的服从。相关机制位于紧凑线性子空间,不同模型家族呈现相似结构。作者说明这是受测模型和实验设定内的机制研究,不是对任意模型的通用防御保证。后续研究通过反事实角色探针、逐组件激活修补和对 AgentDojo 轨迹的干预,分析间接提示注入中角色信号与行为改变之间的差距:角色解码在内容和格式变化下依然存在,在受控 Qwen 测试中先于沿独立估计的角色方向修补带来的工具选择效应;在 AgentDojo 上,从被劫持和抵抗的训练轨迹估计出的方向在行动前和注入片段位置降低了攻击成功率,但在随机位置效果很小;在较长的 Qwen 轨迹中,单点编辑在较后层效果减弱,跨片段和重复编辑能在同一评测中维持效果。

AI 根据报道生成 · 2 小时前更新

事件进展

2 个进展
  1. 10月6日 13:30 · 1 篇报道
    间接提示注入的因果追踪研究
    arXiv:越狱、提示注入、投毒与防御:研究用因果追踪区分间接提示注入中的可读信号与有效干预
  2. 9月29日 22:54 · 1 篇报道
    提示注入合规决策的机制定位研究
    arXiv:越狱、提示注入、投毒与防御:研究用因果激活修补定位模型服从提示注入指令的决策层

后续时间线

报道和讨论按时间排:从发布、媒体跟进到各平台的讨论。

10月6日
  1. arXiv:越狱、提示注入、投毒与防御
    研究用因果追踪区分间接提示注入中的可读信号与有效干预

    研究通过反事实角色探针、逐组件激活修补和对 AgentDojo 轨迹的干预,分析间接提示注入中角色信号与行为改变之间的差距。角色解码在内容和格式变化下依然存在,在受控 Qwen 测试中先于沿独立估计的角色方向修补带来的工具选择效应。在 AgentDojo 上,从被劫持和抵抗的训练轨迹估计出的方向在行动前和注入片段位置降低了攻击成功率,但在随机位置效果很小。在较长的 Qwen 轨迹中,单点编辑在较后层效果减弱,跨片段和重复编辑能在同一评测集上降低攻击成功率。移除学到的通道子空间仍保留角色解码,但有效干预方向在测试通道间迁移较差。

9月29日
  1. arXiv:越狱、提示注入、投毒与防御
    研究用因果激活修补定位模型服从提示注入指令的决策层

    研究者在 4B 至 32B 的五个模型上做逐层因果激活修补,发现攻击信息从第一层起就可线性解码,但直到网络后三分之一的晚层瓶颈才对行为产生明显因果影响。作者报告,修补该瓶颈可在所测案例中逆转模型对攻击指令的服从;相关机制位于紧凑线性子空间,不同模型家族呈现相似结构。这是受测模型和实验设定内的机制研究,不是对任意模型的通用防御保证。

相关讨论

各平台上讨论这件事的帖子和转述:不单独成文,只列链接和一句原文。72 小时的讨论链接数还含 1 篇报道,见后续时间线。

本站还没有收集到这件事的讨论链接。

关注度走势

关注度会随讨论变化:新来源越多越新越高,讨论停了回落到初评。

每天新增来源

8 天共 1 个·最多 1(9月29日)·今天 0

  • 9月29日 新增 1 个来源(1 家媒体、0 个账号)
  • 9月30日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月1日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月2日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月3日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月4日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月5日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月6日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

还没有足够的连续观测数据,暂不绘制趋势。