序列马赛克攻击与防御理论
先了解这件事
研究者提出序列马赛克攻击:单个片段看似无害,组合后却构成有害载荷。针对这类多轮攻击,作者证明任何固定长度的近期提示窗口在一般情况下都不足以防御,因为安全相关信息可能出现在交互中任意靠前的位置,并形式化了一个在线状态机制 watchman 来携带这些信息。在明确假设下,该机制可实现零失败防御并保持正向的有益帮助性,在更强条件下还是零失败防御者中最优的。研究还给出状态数与查询数的下界,并指出自博弈均衡本身不能证明有用性。据 X @ZenitySec 发布的信息,一种攻击将注入内容分散在五条消息中,只有在按序列组合后才构成完整攻击,因此仅对单轮对话打分的护栏无法检出;该帖称这一攻击的每一轮都通过了检查。
AI 根据报道生成 · 2 小时前更新
事件进展
- 10月7日 04:29 · 1 篇报道跨五条消息的序列化提示注入绕过单轮护栏
- 10月6日 13:30 · 1 篇报道提出序列马赛克攻击与防御理论
后续时间线
- X @ZenitySec五条消息组合触发提示注入,单轮护栏无法检出
据 X @ZenitySec 发布的信息,一种攻击将注入内容分散在五条消息中,只有在按序列组合后才构成完整攻击,因此仅对单轮对话打分的护栏无法检出。该帖称这一攻击的每一轮都通过了检查。
- arXiv:越狱、提示注入、投毒与防御研究者提出序列马赛克攻击并给出防御理论
研究者针对多轮序列马赛克攻击提出防御理论,这类攻击的单个片段看似无害,组合后却构成有害载荷。作者证明任何固定长度的近期提示窗口在一般情况下都不足以防御,因为安全相关信息可能出现在交互中任意靠前的位置,并形式化了一个在线状态机制 watchman 来携带这些信息。在明确假设下,该机制可实现零失败防御并保持正向的有益帮助性,在更强条件下还是零失败防御者中最优的。研究还给出状态数与查询数的下界,并指出自博弈均衡本身不能证明有用性,进而提出在零失败防御者中最大化最坏情况有益帮助性的约束形式。实验上,通过多轮自博弈在冻结 LLM 上训练角色专属的 attacker 与 defender LoRA 适配器,攻击者更易诱导有害回答,防御者对攻击更鲁棒,在未见攻击目标上也有提升。
相关讨论
关注度走势
每天新增来源
- 10月6日 新增 1 个来源(1 家媒体、0 个账号)
- 10月7日 新增 1 个来源(1 家媒体、0 个账号)
每小时关注度
趋势只比较一直被完整观测到的同一批信源,范围可能比当前关注度小。移动指针或点击图表查看每小时关注度;键盘可用左右方向键切换。