Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景
Do LLMs Know Their Vulnerable Scenarios?
研究者利用内部表征归因发现脆弱场景,使 Llama-3.1-8B 上的 6 种黑盒攻击平均 ASR 提升 18.2 个百分点。
攻击者在场景挖掘阶段对开源模型拥有白盒表征访问与干预能力,在下游攻击中仅通过黑盒提示词查询目标模型。
- 安全对齐大模型易被特定上下文场景绕过,但场景削弱拒绝的内部表征机制尚不明确,且现有红队方法主要依赖人工经验或预定义空间搜索,缺乏基于模型内部表征的系统性发现方法。
- 提出 Concept2Scenario 框架,利用稀疏自编码器分解模型中间层激活,通过因果干预评估各概念对拒绝分数的抑制程度,将强抑制概念转译为自然语言场景库,并通过交互归因筛选具有协同效应的组合场景。
- 在 3 个开源和 3 个闭源模型上评测 6 种黑盒攻击,注入脆弱场景使开源模型平均 ASR 最高提升 18.2 个百分点,向 GPT-5 等闭源模型迁移亦取得最高 27.5 个百分点的提升,并使多轮攻击能在更少轮次内成功。
- 论文未专门设立章节讨论局限与后续方向;实验覆盖了 3 个开源模型与 3 个闭源模型在两个基准上的黑盒攻击,但论文未报告场景转译阶段大模型的运行耗时、黑盒测试的具体查询成本以及人工评估一致性数据。
- 威胁模型
- 攻击者在场景挖掘阶段对开源模型拥有白盒表征访问与干预能力,在下游攻击中仅通过黑盒提示词查询目标模型。目标是绕过安全对齐诱导模型遵从有害请求,并可将开源模型挖掘的场景先验迁移至黑盒闭源商业模型。
- 模型
- Qwen3.5-9BLlama-3.1-8BMinistral-3-8BGPT-5Claude-Haiku-4.5Gemini-3-FlashGemini-3.1-Prodeepseek-v3-huawei-910bQwen3.6-27BAgentDoG-Qwen3-4B
- 基准
- GuidedBenchHarmBenchAgentHarmBeaverTailsSlimPajama
- 指标
- ASR1T2TCompletionRefusalUnsafe Ratere-MSEFVECAV Accuracy
研究者提出 Concept2Scenario,把场景化越狱建模为表示空间的因果归因,通过 SAE 概念方向定位抑制拒答的内部概念,再翻译成自然语言越狱场景。在三个开源模型、两个安全基准和六种黑盒越狱方法上,发现的场景作为可复用先验把平均攻击成功率最多提升 18.2 个百分点。从开源模型提取的场景还能迁移到 GPT-5、Claude-Haiku-4.5 和 Gemini-3-Flash,提示部分场景级拒答漏洞跨模型家族共享。交互归因进一步筛出协同场景组合,其效果超过单个场景,并让迭代攻击在更少轮次内成功。分析还显示拒答抑制集中在极少数概念上,且不同模型的脆弱领域差异明显。
推荐理由论文把场景化越狱归因到 SAE 概念方向,并给出可复用的场景先验,红队与对齐研究者可据此理解拒答被绕过的机制。
深度解读
这篇论文试图解决什么问题?
探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。
论文试图解决的核心问题是:为什么特定上下文场景能够削弱安全对齐大模型的拒绝机制,以及如何利用模型内部表征系统性发现脆弱场景与协同组合。
- 场景越狱的危害与机理缺失:安全对齐大语言模型虽然能够拒绝直接有害请求,但将相同请求嵌入特定上下文语境(如学术研究、代码补全、虚构叙事等“场景”)即可绕过防护;作者指出,现有红队方法仅通过经验观察攻击结果来挖掘有效场景,其削弱拒绝的内部机制尚不清晰(Section 1)。
- 可解释性研究在红队转化上的不足:已有机械可解释性研究识别了模型的拒绝方向或越狱相关特征,但作者指出,这些研究并未建立激活特定场景表征会因果抑制独立拒绝方向的直接联系,也未将该表征关系转化为可操作的自然语言红队场景(Section 1, Section 2.2)。
- 表征层面的因果归因假设:作者提出将场景越狱建模为表征空间的因果归因问题,假设场景包装是通过激活模型内部的潜在场景方向来削弱拒绝倾向;初步实验表明,直接沿提取出的场景方向进行表征干预与实际场景包裹具有相似的拒绝抑制效果(Section 1, Section 4.1, Appendix A)。
- 威胁模型(Threat Model):
- 攻击目标:诱导经过安全对齐的模型遵从原本会被拒绝的有害请求(Harmful Compliance),降低内部拒绝分数并提高越狱成功率(Section 4.1)。
- 攻击者知识:在脆弱场景发现阶段,假定对开源模型拥有白盒访问权限(提取残差流激活、训练 SAE 与 CAV、进行隐藏层表征干预);在下游实际攻击与迁移攻击中,仅使用黑盒 API 访问目标模型(Section 4.2, Section 5.1)。
- 攻击者能力:在黑盒交互中控制输入提示词的包装框架(场景先验、系统提示或模板结构),无法修改模型权重或推理配置(Section 4.4, Appendix D)。
- 受害系统:包括开源模型(Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B)、商业闭源黑盒模型(GPT-5、Claude-Haiku-4.5、Gemini-3-Flash)以及基于智能体架构的工具调用系统(Section 5.1, Appendix J)。
- 提出的解决方案:提出 Concept2Scenario 框架,利用稀疏自编码器(SAE)将模型表征解耦为独立概念,通过因果干预度量各概念对拒绝倾向的抑制效应,将脆弱概念转译为自然语言场景,并通过交互归因发现协同场景组合(Section 1, Section 4)。
有哪些相关研究?
梳理了越狱攻击与安全机械可解释性研究,指出现有方法缺乏表征空间因果归因且未将内部特征转化为可操作场景。
越狱攻击方法
- 人工编写与模板越狱:Shen 等人(2024)[28] 总结了真实世界中基于角色扮演、特权升级和指令覆盖的越狱提示词;Li 等人(2023)[19] 提出 DeepInception,通过多层嵌套叙事催眠模型;Lv 等人(2024)[23] 提出 CodeChameleon,通过代码或加密任务构建上下文;Luo 等人(2026)[22] 提出利用学习风格提示构建越狱环境。
- 多轮交互与自动化搜索越狱:Russinovich 等人(2025)[27] 提出 Crescendo,通过渐进式良性多轮对话引导有害目标;Rahman 等人(2025)[26] 提出 X-Teaming,利用自适应多智能体协作生成多轮越狱;Chao 等人(2025)[8] 提出 PAIR,通过单路径迭代优化提示词;Mehrotra 等人(2024)[25] 提出 Tree-Attack,进行分支搜索;Liu 等人(2024, 2025)[20, 21] 提出 AutoDAN 与 AutoDAN-Turbo,通过策略探索生成隐蔽提示词;Zou 等人(2023)[39] 提出 GCG 优化不可读对抗后缀。
- 现有攻击的局限:作者指出,现有自然语言场景均来源于人类经验、公开提示或预设搜索空间,主要依赖最终攻击结果进行经验性筛选,缺乏在目标模型表征空间中的场景级因果归因(Section 2.1)。
安全机械可解释性研究
- 拒绝表征与因果操纵:Arditi 等人(2024)[4] 报告大模型的拒绝行为由单个低维方向介导;Zhao 等人(2026)[38] 报告模型对有害性与拒绝进行了分离编码;Wang 等人(2026)[33] 报告拒绝方向在多种对齐语言间具有通用性;Xu 等人(2024)[34] 利用概念激活向量(CAV)揭示安全风险;Yeo 等人(2025)[35] 利用稀疏自编码器(SAE)分析和操纵拒绝相关特征。
- 基于内部表征的安全防御与对抗:Assogba 等人(2026)[5] 提出 CC-Delta,对比带与不带越狱包装的 token 表征以选择 SAE 特征进行防御干预;Zhang 等人(2025)[36] 提出 JBShield,通过概念激活分析和操纵防御越狱;Fu 等人(2025)[9] 提出 Stance Manipulation,优化对抗后缀将隐藏状态推向肯定立场。
- 现有可解释性研究的局限:作者指出,已有研究揭示了越狱相关的内部表征变化,但未证明激活特定场景表征会因果抑制独立识别的拒绝方向,亦未将内部表征关系转化为可用于红队测试的可操作自然语言场景(Section 2.2)。
基线方法与评测基准
- 对比基线:实验对比了 6 种代表性黑盒越狱基线(Crescendo、DeepInception、X-Teaming、PAIR、Tree-Attack、AutoDAN-Turbo),以及使用 Gemini-3.1-Pro 随机生成场景的对照基线(w. LLM),和使用正向拒绝特征的拒绝促进控制基线(Promote)(Section 5.1, Appendix E, Appendix I)。
- 评测基准:使用 BeaverTails(用于 SAE 训练、CAV 拟合与因果归因)、SlimPajama(用于 SAE 训练与领域分析)、HarmBench 与 GuidedBench(用于文本越狱评估),以及 AgentHarm(用于智能体危害评估)(Section 4, Section 5, Appendix J)。
本文定位
- 作者将本文定位为连接机理解释与漏洞发现的桥梁:将场景越狱形式化为表征空间的因果归因问题,建立从“拒绝抑制效应 → 内部概念 → 自然语言场景”的映射闭环,并利用交互归因挖掘具有协同效应的组合场景先验(Section 1, Section 4)。
论文如何解决这个问题?
提出 Concept2Scenario,通过 SAE 和 CAV 建立表征干预归因,筛选抑制拒绝的特征并闭环转译为可复用的自然语言场景。
论文提出了 Concept2Scenario 框架,通过在表征空间对大模型的拒绝抑制效应进行因果归因,发掘内部脆弱概念,并将其转译为可复用的自然语言场景与组合。
问题形式化与因果链条
- 越狱过程的表征解构:针对有害请求 x 和场景 s,场景包裹后的请求为 x' = T_s(x)。作者将行为层面的越狱概率分解为隐藏表征路径 p(yref ∣ x′) ∝ p(yref ∣ r) p(r ∣ c) p(c ∣ x′),其中公式中的 c 为内部概念激活模式,r 为内部拒绝倾向标量,y_ref ∈ {0, 1} 为最终是否拒绝(Section 4.1)。
- 核心机制:传统红队仅观察输入到输出的两端,本方法则显式追踪场景如何激活内部概念(x' → c)、概念如何改变拒绝倾向(c → r),以及拒绝倾向如何塑造可观察的拒绝行为(r → y_ref)(Section 4.1)。
概念表征与拒绝分数的实例化
- 稀疏自编码器(SAE)提取概念空间:在模型中间层 residual stream 提取激活,训练 TopK SAE,字典规模设定为 D = 65,536,稀疏度设定为 k = 64。训练数据混合 SlimPajama 预训练文本与 BeaverTails 安全数据各 50%,每个模型家族训练单个共享字典,联合拟合 base 与 instruct 检查点的激活(Section 4.2, Appendix G)。
- 概念激活向量(CAV)量化拒绝倾向:在最终层表征上,使用 BeaverTails 的 1,400 对拒绝-非拒绝样本(共 2,800 条)训练 L2 正则化 Logistic 回归探针。拒绝分数定义为线性变换 r(x) = ϕrefusal(hL(x)) = wref⊤ hL(x) + bref(Section 4.2)。
- 提取 token 与正则化强度选择:选取在对齐前后探针分类精度增益最大的对话模板边界 token(如 LLaMA 的 end_header_id 后标记)提取拒绝分数;通过网格搜索在泛化精度平台期内选择方差最低的正则化参数 κ(Section 5.2)。
拒绝脆弱性与交互归因
- 个体概念因果干预:在 BeaverTails 的 N = 5,000 条有害请求上,沿 SAE 解码器方向 d_i 对用户提示词的所有 token 位置进行加法干预,干预强度 s_i 校准为该概念在预训练数据正向 TopK 激活的第 25 百分位数,个体因果效应定义为干预后拒绝分数的平均变化量 Δ_i(Section 4.3)。
- 交互归因筛选协同组合:对概念对 (i, j) 实施联合干预,分离出非加性交互项 Γi,j = 1/N ∑x [r(i,j)(x) − r(x)] − Δi − Δj,负值代表协同效应(即两概念联合对拒绝的抑制强于各自独立效果之和),据此筛选高协同候选场景对(Section 4.3)。
脆弱概念到自然语言场景的闭环转译
- 证据收集与概念解读:提取每个概念解码权重最高的前 25 个 token、平均激活最高的前 10 个文本段以及单 token 峰值激活前 10 个段落,由分析大模型 Gemini-3.1-Pro 总结语义共性(Section 4.4, Appendix C.1)。
- 场景生成与激活门控验证:分析大模型将概念转译为包含场景名称、触发机制、场景描述及 English 提示模板 T_σ(x) 的 JSON 对象;随后将模板送入目标模型前向传播,若该概念的平均激活在字典中排名前 R_gate = 1,000 位以内则保留,未通过则根据激活反馈最多重试 3 次,形成脆弱场景库 S(Section 4.4, Appendix C.2, C.3)。
黑盒攻击场景先验的适配
- 通用场景筛选:针对给定有害请求,攻击大模型从场景库中选择 m 个相关场景(PAIR、X-Teaming、Tree-Attack、AutoDAN-Turbo 取 m = 5;Crescendo 取 m = 3;DeepInception 取 m = 1)(Appendix D.1)。
- 两类攻击范式注入:固定模板方法(Crescendo、DeepInception)在不改变基础结构的前提下将场景用于特化外部外壳或起始轮次;大模型生成方法(X-Teaming、PAIR、Tree-Attack、AutoDAN-Turbo)将场景作为规划、变异生成或分支搜索的约束先验(Appendix D.2, D.3)。
论文做了哪些实验?
在 3 个开源和 3 个闭源模型上评测 6 种黑盒攻击,脆弱场景使平均 ASR 最高提升 18.2 个百分点并提升多轮攻击效率。
实验设置
- 被测模型:白盒开源模型包括 Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 及其对应的 base 检查点;黑盒商业闭源迁移模型包括 GPT-5、Claude-Haiku-4.5、Gemini-3-Flash;智能体评估模型为 Qwen3.5-9B;分析与重写模型包括 Gemini-3.1-Pro 与 deepseek-v3-huawei-910b(Section 5.1, Appendix J)。
- 评测数据集与规模:文本越狱评测采用 GuidedBench(200 条请求)与 HarmBench(200 条请求);智能体安全评测采用 AgentHarm 公共测试集全量 176 条有害请求;SAE 与 CAV 训练及干预采用 BeaverTails(1,400 对探针训练,5,000 条因果干预)与 SlimPajama(5 亿 token)(Section 4.2, Section 4.3, Section 5.1, Appendix J)。
- 对比基线:原始黑盒攻击(Baseline)、注入 Gemini-3.1-Pro 随机生成场景的基线(w. LLM)、选择正向拒绝特征的对照基线(Promote),以及单场景(Single)、加性组合(Additive)与随机组合(Random)(Section 5.1, Appendix I)。
- 评测指标:攻击成功率(ASR, %)、单轮/两轮成功率(1T/2T, %)、任务完成度(Completion, %)、拒绝率(Refusal, %)、轨迹级不安全率(Unsafe Rate, %)、SAE 重建误差(re-MSE)与方差解释比(FVE)(Section 5, Appendix G, J)。
- 判定方式与重复设置:文本主实验均进行 3 次独立运行取平均值;AgentHarm 使用 Qwen3.6-27B 担任语义完成度评分器与拒绝裁判,使用 AgentDoG-Qwen3-4B 进行轨迹级安全分类(Section 5.1, Appendix J)。
主结果
在 GuidedBench 上,各开源模型在 4 种代表性黑盒攻击下的 ASR(%)表现如下(据 Table 1):
表格较宽,可左右滑动
目标模型(据 Table 1) 攻击条件 PAIR Crescendo Tree-Attack DeepInception Qwen3.5-9B Baseline 49.3% 9.0% 28.2% 0.5% Qwen3.5-9B w. Ours 44.7% 13.3% 43.0% 8.0% Llama-3.1-8B Baseline 82.7% 67.3% 84.5% 33.3% Llama-3.1-8B w. Ours 95.0% 86.3% 98.3% 84.5% Ministral-3-8B Baseline 90.2% 91.5% 94.2% 81.7% Ministral-3-8B w. Ours 96.2% 97.0% 97.2% 92.5% - 全攻击平均表现:除上述 4 种攻击外,Table 1 还测试了 X-Teaming 与 AutoDAN-T。在 GuidedBench 上,注入本文场景(w. Ours)使 Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 的 6 种攻击平均 ASR 分别提升 4.4、18.2、5.7 个百分点;在 HarmBench 上分别提升 2.8、14.5、2.0 个百分点(Table 1)。
- 模型安全对齐强度的影响:作者指出,提升幅度与模型自身对齐水平相关;Qwen3.5-9B 对齐严格,提升相对温和;Ministral-3-8B 对齐较弱且基线 ASR 已接近或超过 90%,提升空间较小;Llama-3.1-8B 获得的增益最为明显(Section 5.1)。
- 攻击范式对场景的利用效率:作者称,具备多路径探索能力的攻击(如 X-Teaming 与 Tree-Attack)受益最大;单路径微调方法(如 PAIR)若初始探索陷入不契合的提示词,增益会受到限制,在 Qwen 上甚至出现小幅下降(49.3% 降至 44.7%)(Section 5.1, Table 1)。
闭源模型迁移评测
- 测试设置:将从开源模型挖掘出的脆弱场景库分别注入 PAIR 与 Tree-Attack,直接攻击商业闭源模型 GPT-5、Claude-Haiku-4.5 与 Gemini-3-Flash(Table 2)。
- 实验结果:开源场景在闭源模型上表现出迁移性;例如在 GPT-5 上,PAIR 攻击注入 Ministral 场景后 ASR 从 21.5% 升至 49.0%(提升 27.5 个百分点);在 Claude-Haiku-4.5 上,Tree-Attack 注入 LLaMA 场景后 ASR 从 62.5% 升至 84.0%(提升 21.5 个百分点)(Table 2)。
- 作者解读:作者认为这表明某些场景级拒绝漏洞可能在不同模型家族之间共享;相比之下,LLM 随机生成场景基准(w. LLM)在强对齐模型(GPT-5、Claude-Haiku-4.5)上往往引入噪声导致 ASR 下降(Section 5.1)。
场景交互组合与多轮攻击加速
- 测试设置:在 Llama-3.1-8B 的前 25 个场景中筛选出强负值交互项(Γi,j)组合,测试融合场景(P1:嵌套代码注释 + URL/API 任务;P2:虚构对话 + 课程内容)在 PAIR 和 Crescendo 上的表现(Section 5.4, Figure 7)。
- 实验结果:在 Llama-3.1-8B 上,P1 组合使 PAIR 的首轮成功率(1T)从单场景 S3 的 53.0% 提升至 81.0%(提升 28.0 个百分点),最终 ASR 达到 99.5%;P2 组合使第二轮成功率(2T)从 82.0% 提升至 90.0%(提升 8.0 个百分点)。此外,P1 组合迁移至 GPT-5 取得 36.0% ASR,迁移至 Claude-Haiku-4.5 取得 14.0% ASR(Figure 7)。
- 作者解读:作者认为交互归因能够识别出非加性的协同场景组合,使模型在更少轮次内被成功越狱(Section 5.4)。
智能体有害行为评估(AgentHarm)
- 测试设置:在 AgentHarm 的 176 条公共测试有害任务上,使用 Qwen3.5-9B 作为被测智能体,对比直接请求与场景引导重写后的多步动作执行表现(Appendix J, Table 9)。
- 实验结果:场景引导重写使任务完成度从 25.6% 提升至 32.7%(提升 7.1 个百分点),拒绝率从 89.2% 降至 81.2%(下降 8.0 个百分点),AgentDoG 检测到的轨迹不安全率从 30.7% 升至 40.3%(提升 9.7 个百分点)(Table 9)。在 8 个危害类别中,7 个类别的完成度上升,Drugs 增幅最大(31.7% 升至 57.5%,+25.8 个百分点),唯独 Hate 下降 1.5 个百分点(Table 10)。
- 作者解读:作者认为这表明所发现的脆弱场景不仅影响最终文本生成,还能促进多步骤有害工具调用工作流的执行(Appendix J)。
其他消融与分析
- 预定义场景表征干预:在 Llama-3.1-8B 第 27 层干预 12 个预定义场景方向,Playwright 场景使 50 条有害请求的拒绝分数从 9.439 降至 -2.436(Δ = -11.875,Table 4)。
- 拒绝促进控制实验:在 36 组测试中,选择抑制拒绝特征(Suppress)的平均 ASR 为 72.6%,显著高于选择促进拒绝特征(Promote)的 68.0%,且在 33 组设置中 Suppress 均高于 Promote(Appendix I, Table 7)。
- 场景库容量敏感度:对 LLaMA 和 Ministral,容量在 10 至 50 范围内 ASR 基本平坦;Qwen 在 |S| = 40 时达到峰值并在 50 时出现回落(Section 5.2, Figure 4)。
- 概念自然激活尺度:各概念 positive TopK 激活的第 25 百分位数在同一模型内跨度达 60× 至 120×,佐证了个体校准的必要性(Section 5.3, Figure 5a)。
- 单概念抑制深度差异:单概念干预在 LLaMA 和 Ministral 上可使平均拒绝分降低约 30%,而在 Qwen 上仅降低约 2%(Section 5.3, Figure 5b)。
- 基模型预训练拒绝水平:未对齐前,Qwen3.5-9B 基模型对 GuidedBench 直接有害请求的拒绝率达 97.5%,LLaMA-3.1-8B 为 47.5%,Ministral-3-8B 为 29.5%(Appendix H, Table 8)。
有什么可以进一步探索的点?
论文未专门设立章节讨论局限与后续方向;实验事实覆盖了 3 个开源与 3 个闭源模型在两个基准上的黑盒攻击评测。
作者指出的局限与后续方向
- 论文未专门设立独立小节(如 Limitations 或 Future Work)讨论研究局限与后续方向。
实验覆盖范围
- 被测语言模型覆盖:白盒场景挖掘在 3 个开源模型(Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B)上进行;黑盒迁移评测覆盖了 3 个商业闭源模型(GPT-5、Claude-Haiku-4.5、Gemini-3-Flash);智能体评测仅在 Qwen3.5-9B 上执行(Section 5.1, Appendix J)。
- 评测数据集与任务覆盖:文本越狱实验覆盖了 GuidedBench 与 HarmBench(各 200 条有害请求);智能体安全实验覆盖了 AgentHarm 公共测试集中的全部 176 条有害请求,涉及 8 个危害类别(Section 5.1, Appendix J)。
- 攻击范式与控制组设置:实验测试了 6 种代表性黑盒越狱算法(Crescendo、DeepInception、X-Teaming、PAIR、Tree-Attack、AutoDAN-Turbo),设置了 LLM 随机生成场景对照组(w. LLM)和拒绝促进特征对照组(Promote)(Section 5.1, Appendix I)。
- 表征与干预超参数设定:SAE 字典大小固定为 D = 65,536,活跃特征数 k = 64,训练 token 量为 5 亿;因果干预评估在 BeaverTails 的 5,000 条有害请求上完成,场景转译激活门控阈值固定为前 1,000 位,最多重试 3 次(Section 4.2, Section 4.3, Section 4.4)。
- 论文未报告的信息:论文未报告概念转译阶段调用大模型(Gemini-3.1-Pro)的 token 开销与时间成本,未报告黑盒攻击实际产生的模型查询次数或 API 成本,亦未报告人工评估结果或自动化评审模型与人工标注的一致性统计。
总结一下论文的主要内容
该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
- 研究定位:该论文提出了基于表征因果归因的脆弱场景发现框架 Concept2Scenario,旨在从机械可解释性视角揭示场景包装削弱大模型拒绝的内部机制,并将其转化为可复用的自然语言攻击先验。
- 问题与机理核心:针对现有红队主要依赖经验和试错、缺乏内部因果解释的问题,论文发现模型内部存在能够因果抑制拒绝方向的潜在场景表征,证实场景包装通过激活特定概念来降低拒绝倾向。
- 方法设计要点:在开源模型中间层残差流训练稀疏自编码器(SAE)提取解耦概念,在末层利用线性探针(CAV)量化拒绝分数;在 5,000 条有害请求上沿概念解码方向实施标准化干预以筛选强抑制特征,通过分析大模型实现概念解读与“概念 → 场景 → 概念”闭环验证,并利用交互归因挖掘协同场景组合。
- 核心实验结果:在 GuidedBench 基准上,将挖掘出的场景注入 6 种黑盒攻击后,Llama-3.1-8B 的全攻击平均 ASR 提升了 18.2 个百分点(从 33.3%–94.5% 提升至 84.5%–98.3%);在 HarmBench 上平均提升 14.5 个百分点;在智能体评测 AgentHarm 上,场景引导重写使 Qwen3.5-9B 的任务完成度提升 7.1 个百分点。
- 跨模型迁移与多轮加速:仅由开源模型挖掘的场景可直接迁移至商业黑盒模型,使 GPT-5 在 PAIR 攻击下的 ASR 达到 49.0%(较基线提升 27.5 个百分点);交互归因筛选的协同组合使 Llama-3.1-8B 上 PAIR 的首轮攻击成功率从单场景的 53.0% 提升至 81.0%。
- 作者结论与启示:作者认为大模型的内部表征已编码了其自身的脆弱场景,且部分场景漏洞在不同模型家族间具备通用性;基于表征空间的归因分析能够为自动化红队评估与针对性安全防御提供可解释的先验支撑。