跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2609.02414· Siyu Chen·原文 · 入选 精选关注度80

Blueprint 框架用世界观模拟与 18 个影响因子提升多轮越狱成功率

Before the Script, Set the Stage: How Worldview Simulation Amplifies Psychologically Grounded Persuasion in Multi-Turn Jailbreaking

AI 导读

研究者提出 Blueprint 多轮越狱框架,把攻击策略拆成 18 个基于社会影响理论的因子,并用 WorldviewSim 模块维持跨轮情境一致性,由 MCTS 搜索每轮因子组合。在 HarmBench 验证集 80 条行为上,Blueprint 在六个前沿模型上平均 ASR 达 79.2%,平均目标查询次数仅 2.46;在 Qwen3-Next-80B、DeepSeek-V3.2 和 Gemini-2.5-Flash 上接近满分,在 GLM-4.7 上比最强基线高 27.5 个百分点。轨迹分析显示三个抗性模型各有不同的敏感因子,但转向具体可执行的任务框架是共同的恢复路径。消融实验表明任务清晰度和收益框架影响最大,而 PPL 过滤、改写和护栏等静态防御基本无法阻断该攻击。代码已开源。

论文速读

问题
多轮越狱攻击能把有害意图分散到对话中,但现有方法把攻击当作单一 prompt 单元评估,看不清哪些对话机制导致模型脆弱。作者认为需要区分策略因素与跨轮情境,才能理解合规为何发生。
方法
提出 Blueprint 框架:把攻击空间拆成 18 个基于社会影响、双过程说服、前景理论等理论的因子,用 MCTS 在四轮轨迹上搜索每轮的因子组合;另设 WorldviewSim 模块维护跨轮的角色、场景、时间连续性与机构理由,再由 prompt 生成器融合成用户消息。
实验与结果
在 HarmBench 六个前沿模型上,作者报告平均 ASR 79.2%,Qwen3-Next-80B 与 Gemini-2.5-Flash 接近满分,平均目标查询数 2.46;抗性模型各有不同的因子敏感模式,但转向具体可执行的任务框架是共同恢复路径。消融显示可执行任务框架影响最大,gain 框架作用突出,部分合法性诉求可能适得其反;PPL、改写等静态防御基本无效。
局限与可以继续做的
作者称结论是行为层面的关联而非因果证据,无法分离单个 worldview 字段、因子或状态转移的因果效应;18 因子词表是人工设定的可扩展操作化,并非穷尽。后续应结合反事实干预、人工验证和自然红队轨迹,检验其跨模型族、文化、多模态与工具场景的泛化性。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文把多轮越狱拆成 18 个社会影响因子加跨轮世界观模拟,并给出各模型的脆弱因子差异,可供红队与防御方参考。

阅读原文arxiv.org