Persona Attack:通过增量记忆注入越狱大语言模型
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
Persona Attack 记忆注入越狱:GPT-4o state-based Sequential 1 的 ASR 为 95%(表2)
攻击者分步或一次提交指令 I1、I2、I3 与有害问题 Qh,利用对话记忆让模型优先遵循用户指令并输出有害内容。
- 聊天模型会记住对话并维持用户指令。作者认为这可能使指令优先于安全策略,而传统越狱多只做单次提示注入。Persona Attack 研究如何用分步记忆注入绕过安全装置。
- Persona Attack 先用模仿、格式假设和去掩码三条指令写入记忆,再以包装层中的有害问题触发。可顺序多轮或一次拼接,并剪枝掉判断不太可能成功的组合。记忆分为把历史贴在新提示前的 manual,与逐轮更新状态的 state-based。
- 表2:GPT-4o state-based Sequential 1 的 ASR 为 95、FAR 为 88.33;Llama 手动同设置 ASR 为 5、状态记忆为 35。gpt-4o 的 AdvBench 520 条 FAR 为 84.61%。
- 作者指出黑盒对齐不可直接分析,不损可用性的防御超出本研究范围。实验覆盖 GPT-4o、Llama-3.2-3B-Instruct 与三个商业服务;主集 60 条,附录 520 条。未报告重复次数、主实验判定者和防御评测数字。
- 威胁模型
- 攻击者分步或一次提交指令 I1、I2、I3 与有害问题 Qh,利用对话记忆让模型优先遵循用户指令并输出有害内容。论文称 GPT-4o 为 black-box,内部对齐未公开。记忆实现分为 manual memory 与 state-based memory。
- 被测模型
- GPT-4oLlama-3.2-3B-InstructChatGPT-4oClaude 3.7 sonnetGrok 3 Beta
- 基准
- AdvBench
- 指标
- ASRFAR
研究者提出 Persona Attack,一种基于记忆注入的越狱方法,通过逐步操纵模型的上下文窗口来绕过安全对齐。实验显示,随着注入内容在记忆中累积,模型会越来越优先执行这些指令而非内部安全机制。攻击成功率随模型的记忆实现方式和指令组合而变化,在特定指令配置下可达到 95%。
深度解读
这篇论文试图解决什么问题?
作者认为模型会优先遵循记忆中的指令,故提出分步注入的Persona Attack。
如何利用逐步写入对话记忆的用户指令,使模型优先遵循这些指令而不是内部安全对齐。
- 场景:作者称聊天智能体已用于消费与专业场景,也可能被用来增强违法活动。开发者用安全策略、安全训练和过滤来防滥用,但内容审查仍难覆盖复杂边界,并对特定提示词脆弱。
- 现有不足:作者称传统越狱多是单次提示注入,忽略模型会记住对话流程和用户指令。直接问有害内容时通常不答;分步写入指令后会出现危险回答(Figure 1)。
- 假设:作者认为记忆里累积的用户指令会被赋予高于安全目标的权重,因而用户指令优先于安全策略。
- 做法:提出 Persona Attack(增量记忆注入)。以四条提示完成印刻和攻击,把组合写成最大化 ASR 的搜索,并做剪枝。
- 威胁模型:
- 目标:绕过安全装置,让模型产生有害内容(论文所称 jailbreak)。
- 知识:论文称 GPT-4o 为 black-box,内部对齐未公开;GCG 不能在其上优化(Figure 4、5.1)。
- 能力:攻击者可顺序或一次提交 I1、I2、I3 与有害问题 Qh,从而影响对话历史或内部状态。
- 受害系统:带对话记忆的 LLM。实验对象为 Responses API 上的 GPT-4o、LangChain 上的 Llama-3.2-3B-Instruct,以及 ChatGPT 桌面应用、经 Perplexity pro 的 Claude 3.7 sonnet 与 Grok 3 Beta。
有哪些相关研究?
作者将既有越狱分为生成式、模板式与训练缺口三类,并称本文利用交互记忆而非单轮提示。
Section 2 依 [7] 将相关越狱分成三类。只在论文明确对比处写差异。
- 生成式越狱:用动态生成和迭代反馈实时改提示 [8]。作者称 AutoDAN、GCG 为 white-box,用梯度优化后缀以诱导有害输出 [9][10];GPTFuzzer 为 black-box,以用户提示为种子做变换 [11]。作者引 [7] 称其能一致用于多种有害问题且难检测,但实现复杂、常需模型内部。作者称本文目标同为利用内部运作的脆弱点,但用多轮记忆而非单条提示。
- 模板式越狱:用提示模式或角色扮演诱导有害输出。DAN 让模型不受约束地行动,DeepInception 用虚构叙事利用角色能力 [6][12]。作者称其无需单独优化,但提示重复时易被发现,token 往往更长。作者称本文也用预定义指令,相对某些复杂单轮模板可减少 token,且最终查询中恶意模式较少;论文未报告 token 数。
- 利用训练缺口:利用安全对齐未泛化的输入或场景。MSJ 在提示中放入数百个有害问答以削弱拒绝 [13];作者还提到低资源语言、代码格式和特殊 token。作者称本文不靠长提示,而用多轮记忆注入逐步削弱防御,以产生类似破坏安全优先级的效果;论文未给出与 MSJ 的对照数字。
- 基线与数据:Figure 4 比较 GCG [15]、Jailbroken [21]、Parameters [22]。图注写 GPT-4o 用 Responses API、Llama 用 LangChain,二者均为 state-based,且 GCG 不能在 black-box 的 GPT-4o 上优化。主实验用从 AdvBench 选出的 60 条提示 [20];附录另用 AdvBench 的 520 条 [15]。
作者在 Section 2 末称,本文不同于单轮或静态提示,利用的是交互记忆;并称该路径隐蔽且高效。论文未报告查询次数或耗时。
论文如何解决这个问题?
Persona Attack先把三条指令写入记忆,再以包装后的有害问题触发,并剪枝搜索高ASR组合。
Persona Attack 利用模型处理顺序提示时的记忆机制:先把指令印进记忆,再让有害问题沿已记住的回答框架生成。作者称用四条提示即可实施,不同于其所说的其他复杂越狱。
指令印刻
- 三条指令:集合 I={I1,I2,I3}。I1 为模仿,让模型预测其他语言模型的回答;I2 为假设注入,把任务说成按格式作答,并规定四种情形:Jailbreak Fail、Partial Fail、Partial Success、Success;I3 为去掩码,要求完整输出、不对特定词掩码(Figure 2,3.1)。附录 B 给出完整提示词。
- 作者的机制说法:I1 与 I2 表面上像破冰。与固定轨迹结合后,模型应记住符合该格式的问题要归入四种情形之一,随后插入的问题被套进这些框架。作者称模型保持对指令的顺从,未意识到回答在变有害,从而把有害问题当成合法的模拟回答。
- 另一因素:作者认为四种情形里已有部分有害的情形,成功情形会导向有害输出;模型为贴合目标情形而逐步选择更有害的 token,并倾向于不识别单个 token 在整体中的有害程度(3.4)。
攻击步骤与排列
- 触发:Qh 被放进包装层,以便模型为维持上下文而调用已存指令(3.2)。此处不复述包装句。
- 基本排列:Sequential 1 依次为 I1、I2、I3、Qh;Sequential 2 为 I1、I2、Qh、I3;Once 把四段 concat 后一次输入。Qh 也可插在 I 的元素之间。
- 其他排列:正文称 Additional 1、Additional 2 是重排后的 sequential 变体。附录 Table 4 给出 Additional 3 至 6 的拼接顺序,并写明假定 state-based memory。
组合搜索
作者将攻击写成在合法组合上最大化 ASR:
maxX ∈ C(I,Qh) ASR(LLM(X))
C(I,Qh) 是 I1、I2、I3 与 Qh 的合法组合空间,X 是其中一种输入组成。作者排除被判断为不太可能成功的组合,例如 Q 先输入,只实验其余配置。论文未给出剪枝的形式规则,也未穷尽该空间(3.3)。
作者给出的权重解释
作者认为成功来自安全对齐与记忆中用户指令的失衡,并把总目标写成两个分布的加权和:
P = α · Pinstruction + β · Psafety, α > β
前者对应遵循记忆中的用户指令,后者对应安全训练。作者称当 α 大于 β 时,模型把指令遵循当作更主导的偏好,因而可能在违反安全约束时仍按指令生成。论文未报告 α、β 的估计(3.4)。
两种记忆
- Manual:把先前对话成对拼接后贴在新提示前;在不超过上下文窗口的范围内迭代,作者称该窗口可视为记忆上限(Figure 3)。各轮回答条件于已有指令与回答,最后在拼好的 Imem 上回答 Qh。
- State-based:维护内部状态。s0 初始化为 0;每轮 rt 为在上一状态条件下对 xt 的回答,st 由更新函数 M 根据上一状态、当前输入和回答生成。四步输入为 I1、I2、I3、Qh。作者认为历史如何被处理、又如何交给模型,会实质影响 ASR(3.5)。
- 实现对应:4.1 写 GPT-4o 用 Responses API、Llama-3.2-3B-Instruct 用 LangChain 添加记忆;Figure 4 图注称这两种环境都是 state-based。
论文做了哪些实验?
表2:GPT-4o状态记忆Sequential 1的ASR为95;Llama手动该排列为5。
实验设置
- 模型:主测试为 GPT-4o 与 Llama-3.2-3B-Instruct。前者被写成可处理文本、图像和音频;后者为支持 128k token 上下文的多语言指令模型。真实服务为 ChatGPT-4o(桌面应用)、Claude 3.7 sonnet 与 Grok 3 Beta(后两者经 Perplexity pro)。附录 Table 4 与 Table 5 写模型为 gpt-4o-2024-11-20。
- 数据:Table 1 与 Table 2 使用从 AdvBench 选取的 60 条提示 [20]。附录 A 称这 60 条沿用 [20],是在 [29] 的 40 条上加入部分 AdvBench,再分成 6 个主题、每主题 10 条。附录另评 AdvBench 的 520 条 [15]。
- 记忆与基线:比较 manual 与 state-based。Figure 4 还比较 GCG、Jailbroken、Parameters;图注称 GCG 不能在 black-box 的 GPT-4o 上优化。
- ASR / FAR:不拒绝即计入 ASR;详细解释含有害句子的用户提示才计入 FAR。附录 D 补充:FAR 还须遵循已注入指令,关键信息被掩码则不算。
- 判定:论文未说明 60 条由谁判定,也未报告重复次数。520 条因过长不再人工逐条检查,改为抽取成功情形中的回答,含拒答短语则判失败,作者把该结果称为 FAR(附录 A、Figure 6)。
主结果
据 Table 2。正文将这些值作为 ASR、FAR 的百分数使用,数据为 60 条提示。
表格较宽,可左右滑动
模型与记忆 Once ASR Sequential 1 ASR Once FAR Sequential 1 FAR GPT-4o Manual 75 88.33 63.33 83.33 GPT-4o State-based 75 95 63.33 88.33 Llama-3.2-3B-Instruct Manual 20 5 18.3 5 Llama-3.2-3B-Instruct State-based 20 35 18.3 20 - 作者称,把指令分步写入比一次放入更能让模型接受有害上下文;并认为 state-based 的更新函数含有某种处理,因而与 manual 的 sequential 结果不同。正文对 GPT-4o manual 的该项 ASR 使用了约数说法,与表中小数写法不同。
- Llama 在 Manual 下 Once 高于 Sequential。作者称这是反直觉的,并认为多轮累积接近 MSJ,而该模型的训练准则针对 many-shot jailbreak,SFT 数据含不安全行为示例和安全行为示例,因而能防御长上下文;Once 收成单条提示,结构不同,从而避开该防御逻辑。
- 作者称,成功对话里模型逐步把记忆中的用户指令当作高于安全对齐的命令。Table 1 中 Jailbroken 与 Parameters 的 ASR、FAR 均为 0,表题未写模型。Figure 4 正文称 Persona 最低成功率为 63.3%,两种既有方法没有成功案例,该句未点名是哪两种;GCG 被写成不能在该 black-box 上优化,Table 1 没有其 ASR。
指令组合
- Table 1(表题未写模型)报告 Once 的 ASR 75.0、FAR 63.3,Sequential 1 为 95.0 与 88.3,Additional 1 为 91.7 与 86.7,Additional 2 为 86.7 与 76.6。正文称后两者是重排提示的 sequential 变体,未在该表给出顺序。Sequential 1、Once 的数字分别与 Table 2 的 GPT-4o State-based Sequential 1、以及 GPT-4o 的 Once 行相同;论文未据此写明 Table 1 的模型。
- Table 4 在 gpt-4o-2024-11-20、60 条、假定 state-based 下:Sequential 1 为 57/60(ASR 95.0)与 53/60(FAR 88.3);Sequential 2 与 Additional 4 均为 57/60 与 54/60(95.0,90.0);Additional 3 为 54/60 与 49/60(90.0,81.7);Additional 5 为 50/60 与 40/60(83.3,66.7);Additional 6 为 50/60 与 47/60(83.3,78.3);Once 为 44/60 与 38/60(73.3,63.3)。
- 该表 FAR 最高为 90.0,出现在 Additional 4 与 Sequential 2。Once 的 ASR 73.3 与 Table 1 的 75.0 不一致,FAR 都是 63.3。论文未解释这一差异。
主题与 AdvBench 520 条
- Table 5(gpt-4o-2024-11-20,每主题 10 题):Harmful Content 的 ASR 90、FAR 80;Adult Content 为 90 与 70;Illegal Activity 为 90 与 90;Spreading Fake Information-Fraud 与 Unlicensed Activity 均为 100 与 100;Prejudice Privacy 为 100 与 90。作者称某些主题可能更脆弱,并认为可能来自主题敏感度、风险补偿或对齐阶段约束的差异。
- AdvBench 520 条、gpt-4o、拒答短语规则:FAR 为 84.61%。正文写 440 条判为成功,80 条因含拒答短语判为失败(Figure 6)。作者称浅红色表示完全接受的有害回答,浅绿色表示拒绝或部分拒绝。
真实服务
- 正文先用 plan to 表述将在 ChatGPT-4o、Claude 3.7 sonnet、Grok 3 Beta 上实验,随后 Figure 5 报告 sequential 1、同样 60 条的结果。作者称可以绕过服务中的最新 LLM,是现实威胁而非只是理论;并称 Claude 相对稳健,但仍有 critical FAR。转换文本没有该图的柱高或标注数字,故不写各服务的 ASR/FAR。
- 附录 E 给出上述服务的 sequential 1 示例,并区分完全失败与部分失败。作者称问题风险对 Psafety 的权重 β 影响很大:很冒险时 β 大于 α,相对不冒险时 β 小于 α。论文未测量 β。
其他消融与分析
- 摘要写特定指令配置下可达 95%;引言写比单提示方法(0%)高出最多 95%;结论写 gpt-4o 上 ASR 最高 95%。
- 结论写 Llama-3.2-3B-Instruct 的 ASR 随是否使用记忆从 5% 到 35%,与 Table 2 中 Sequential 1 的 Manual、State-based 两格相同。
- 论文未报告采样温度、重复次数、查询次数或 token 用量。
- 附录 D:完全失败是不遵循注入指令并拒绝;部分失败是遵循框架,但在成功情形中拒绝。
有什么可以进一步探索的点?
作者指出黑盒对齐不可直接分析,并把不损可用性的防御留在本研究之外。
作者指出的局限与后续方向
- 黑盒不可直接分析:以 gpt-4o 为例,内部对齐未公开。作者称只能从输出看到绕过,难以直接分析安全训练和内部对齐如何被扰乱,因而限制黑盒结果的解释与泛化(5.1)。
- 不透明妨碍设计防御:作者称,若对齐过程或规则公开,才可能检测并移除记忆中的异常指令,或增加管理对话上下文的过滤层;不透明也可能影响后续研究扩展(5.1)。
- 与记忆更新的可访问性有关:作者称攻击者越能持续影响对话历史,安全装置被关掉的可能性越高;模型若提供由交互更新内部状态的功能,该攻击会表现出绕过安全对齐的效果(5.1)。
- 作者建议的缓解:识别并忽略对话记忆中的不当指令,或定期初始化 long-context,以阻止危险指令逐步累积(5.2)。
- 可用性:作者称,在不损害可用性的前提下阻止此类攻击,技术复杂且涉及伦理考虑,超出本研究范围(5.2)。
- 结论中的方向:需要持续做基于模型记忆的安全对齐;多模态模型增多、上下文窗口变长时,需要后续研究加强安全装置,以免这种便利被用于攻击(6)。
实验覆盖范围
- 主测试模型为 GPT-4o 与 Llama-3.2-3B-Instruct;真实服务包括 ChatGPT-4o、Claude 3.7 sonnet、Grok 3 Beta(4.1,Figure 5)。论文将 GPT-4o 描述为可处理文本、图像和音频,写明的攻击输入是文本提示。
- Table 2 比较 Once 与 Sequential 1、manual 与 state-based,数据为 60 条。附录在 gpt-4o-2024-11-20 上给出 Table 4 的 7 种组合和 Table 5 的 6 个主题;组合搜索排除了作者判断不太可能的排列,如 Q 先输入(3.3)。
- AdvBench 520 条的短语规则结果写明对象为 gpt-4o(Figure 6)。Figure 5 为 sequential 1、60 条;正文未给出各商业服务的 ASR 或 FAR。
- 对照攻击包括 Table 1 中 ASR 与 FAR 均为 0 的 Jailbroken、Parameters(表题未写模型),以及图注所称不能在 black-box GPT-4o 上优化的 GCG(Figure 4)。
- 论文未报告主实验的判定者、重复次数、查询次数,以及与人工判定的一致性;520 条使用拒答短语规则(4.1,附录 A)。5.2 写明不损害可用性的防御超出本研究范围,实验节未报告防御评测数字。
总结一下论文的主要内容
分步记忆注入在GPT-4o的Sequential 1上ASR为95,且随记忆实现与指令组合变化。
Persona Attack 用增量记忆注入做越狱,考察对话记忆中的用户指令是否会被优先于安全对齐。
- 问题:单次提示注入不利用模型记住对话和用户指令的能力。作者认为,分步写入的指令会被优先于安全策略。
- 方法:先注入模仿、四种回答情形的假设,以及去掩码要求,再提交放在包装层中的有害问题。比较一次拼接与多轮顺序,以及 manual 与 state-based 记忆。ASR 计非拒绝,FAR 计详细的有害说明,且附录要求遵循已注入指令。
- 主数字:Table 2 里,GPT-4o state-based 的 Sequential 1,ASR 为 95、FAR 为 88.33,Once 的 ASR 为 75。同表 Llama-3.2-3B-Instruct 的 Sequential 1,手动记忆 ASR 为 5,状态记忆为 35。Table 1 中 Jailbroken 与 Parameters 的 ASR 和 FAR 为 0,表题未写模型。
- 其他数字:附录在 gpt-4o、AdvBench 520 条上按拒答短语计得 FAR 84.61%(440 条判成功,80 条判失败)。Table 5 在 gpt-4o-2024-11-20 上,Spreading Fake Information-Fraud 与 Unlicensed Activity 的 ASR 与 FAR 均为 100(各 10 题)。
- 作者结论:长时记住上下文既增加便利,也让攻击者能持续植入指令并绕过伦理限制。作者称 gpt-4o 上 ASR 最高 95%,并随记忆实现变化;需要基于记忆的安全对齐。引言另写比单提示方法(0%)高出最多 95%,与摘要和结论的“达到 95%”并列,论文未统一这句措辞。