跳到正文
事件持续更新

序列马赛克攻击与防御理论

2 篇报道2 个报道来源12 小时前更新

先了解这件事

AI 综述

研究者提出序列马赛克攻击:单个片段看似无害,组合后却构成有害载荷。针对这类多轮攻击,作者证明任何固定长度的近期提示窗口在一般情况下都不足以防御,因为安全相关信息可能出现在交互中任意靠前的位置,并形式化了一个在线状态机制 watchman 来携带这些信息。在明确假设下,该机制可实现零失败防御并保持正向的有益帮助性,在更强条件下还是零失败防御者中最优的。研究还给出状态数与查询数的下界,并指出自博弈均衡本身不能证明有用性。据 X @ZenitySec 发布的信息,一种攻击将注入内容分散在五条消息中,只有在按序列组合后才构成完整攻击,因此仅对单轮对话打分的护栏无法检出;该帖称这一攻击的每一轮都通过了检查。

AI 根据报道生成 · 2 小时前更新

事件进展

2 个进展
  1. 10月7日 04:29 · 1 篇报道
    跨五条消息的序列化提示注入绕过单轮护栏
    X @ZenitySec:五条消息组合触发提示注入,单轮护栏无法检出
  2. 10月6日 13:30 · 1 篇报道
    提出序列马赛克攻击与防御理论
    arXiv:越狱、提示注入、投毒与防御:研究者提出序列马赛克攻击并给出防御理论

后续时间线

报道和讨论按时间排:从发布、媒体跟进到各平台的讨论。

10月7日
  1. X @ZenitySec
    五条消息组合触发提示注入,单轮护栏无法检出

    据 X @ZenitySec 发布的信息,一种攻击将注入内容分散在五条消息中,只有在按序列组合后才构成完整攻击,因此仅对单轮对话打分的护栏无法检出。该帖称这一攻击的每一轮都通过了检查。

10月6日
  1. arXiv:越狱、提示注入、投毒与防御
    研究者提出序列马赛克攻击并给出防御理论

    研究者针对多轮序列马赛克攻击提出防御理论,这类攻击的单个片段看似无害,组合后却构成有害载荷。作者证明任何固定长度的近期提示窗口在一般情况下都不足以防御,因为安全相关信息可能出现在交互中任意靠前的位置,并形式化了一个在线状态机制 watchman 来携带这些信息。在明确假设下,该机制可实现零失败防御并保持正向的有益帮助性,在更强条件下还是零失败防御者中最优的。研究还给出状态数与查询数的下界,并指出自博弈均衡本身不能证明有用性,进而提出在零失败防御者中最大化最坏情况有益帮助性的约束形式。实验上,通过多轮自博弈在冻结 LLM 上训练角色专属的 attacker 与 defender LoRA 适配器,攻击者更易诱导有害回答,防御者对攻击更鲁棒,在未见攻击目标上也有提升。

相关讨论

各平台上讨论这件事的帖子和转述:不单独成文,只列链接和一句原文。72 小时的讨论链接数还含 2 篇报道,见后续时间线。

本站还没有收集到这件事的讨论链接。

关注度走势

内容价值与传播共同决定关注度;传播减弱时回落到内容价值。

每天新增来源

2 天共 2 个·最多 1(10月6日)·今天 1

  • 10月6日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月7日 新增 1 个来源(1 家媒体、0 个账号)

每小时关注度

当前关注度 51·可比范围峰值 51(10月7日 14:00)·近 24 小时可比范围变化 –

020406010月7日14:0010月7日15:0010月7日16:00

趋势只比较一直被完整观测到的同一批信源,范围可能比当前关注度小。移动指针或点击图表查看每小时关注度;键盘可用左右方向键切换。