跳到正文
原文
arXiv:可解释性· arXiv:2610.01969· Yongliang Wu, Haori Lu, Yulun Wu, Jinqi Luo, Xingyu Zhu, Yaoyao Liu·本站收录 · 原文发表

RASteer:面向扩散模型概念擦除的保留感知激活引导方法

RASteer: Retain-Aware Activation Steering for Concept Erasure in Diffusion Models

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

RASteer 在推理时按保留概念子空间校正擦除方向,在 SD-v1.4 的 I2P 上把 NudeNet 检出从 612 降到 13。

威胁模型概念擦除:在预训练文生图扩散模型上抑制擦除集 F 中的目标概念(版权风格、可识别角色或不安全内容),同时保留保留集 R 与开放域生成。

问题
文生图扩散模型需要去掉版权风格、角色或不安全内容,又要保住其他生成能力。现有激活引导只按目标概念建方向,与保留概念重叠的分量会误伤非目标内容。
方法
RASteer 不训练、不改权重。ROS 用保留概念的 steering 向量张成子空间,从擦除方向里按比例去掉与该子空间对齐的分量;OAC 按每一层、每一步的重叠度 o 设定去除比例 λ=1−o,再沿校正方向引导 cross-attention。
实验与结果
在 SD-v1.4 上,I2P 的 NudeNet 总数从 612 降到 13(CASteer 为 24)。擦除 Snoopy 时目标 CLIP accuracy 为 10.8%,保留角色仍接近未编辑模型。COCO 上 CLIP 为 30.95,接近未编辑的 30.96。作者称在所比方法中擦除与保留的平衡更好。
局限与可以继续做的
实验集中在 Stable Diffusion 系列;作者称扩散 Transformer 与 FLUX 留作后续。方法依赖预先给定的保留集,重叠很大时可用于擦除的方向变少。论文报告了四个骨干、I2P、COCO 以及角色与画风擦除。
实验设置Stable Diffusion v1.4、Stable Diffusion v1.5 等 · I2P、MS-COCO 等 · NudeNet exposed body-part count、CLIP score 等
威胁模型
概念擦除:在预训练文生图扩散模型上抑制擦除集 F 中的目标概念(版权风格、可识别角色或不安全内容),同时保留保留集 R 与开放域生成。RASteer 不改权重,在推理时调整 cross-attention 激活;论文未用 white-box/black-box 表述攻击者知识。
模型
Stable Diffusion v1.4Stable Diffusion v1.5Stable Diffusion v2.1SDXL
基准
I2PMS-COCOinstance erasure (Snoopy, Mickey, Spongebob, Pikachu)artistic-style erasure (Van Gogh, Picasso, Rembrandt, Hokusai)
指标
NudeNet exposed body-part countCLIP scoreCLIP accuracyFIDLPIPS
AI 导读全文 261 字

RASteer 是一种免训练的扩散模型概念擦除方法,通过从待保留概念构建保留子空间,再用 Retain-Orthogonal Steering(ROS)剔除擦除方向中与该子空间对齐的分量,使引导更具针对性。为避免完全移除共享分量削弱擦除效果,该方法引入 Overlap-Adaptive Calibration(OAC),在每个层和去噪步依据擦除方向与保留子空间的重叠度动态调节各分量的去除程度。在不安全内容、实例与艺术风格擦除实验中,RASteer 达到或超过所对比的激活引导与权重编辑基线,实现了更好的擦除—保留平衡。

深度解读

6 个问题,约 10,000 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    擦除目标概念时,与保留概念共享的方向会误伤非目标生成。

    激活引导按目标概念建擦除方向时,会带上保留概念也依赖的共享分量,从而误伤非目标内容。

    • 场景:作者称文生图扩散模型学到了产品中不能保留的内容,包括版权艺术风格、可识别角色和不安全图像。下架请求、法规变化或安全审计要求去掉这些内容时,在过滤数据上重训成本过高,提示词或输出级过滤又容易被绕过(Rando et al., 2022; Zhang et al., 2026; Sarwar et al., 2026)。概念擦除直接改已发布模型,使其不再生成目标概念。
    • 现有方法的不足:权重编辑把改动写入参数,切换或撤销成本更高。激活引导固定权重、在推理时改中间激活,但擦除方向主要来自目标概念。目标与保留概念在表示空间中常重叠,该方向含保留概念依赖的共享分量。Figure 1a 上排:沿原方向擦 Sonic 时,保留角色 Snoopy 变成普通狗。Figure 1b:默认阈值下门控误触发 65% 的保留激活,并漏掉 21% 的目标激活;提高阈值会少误触发、但漏掉更多目标。Figure 1a 下排:完全投影后,作为擦除目标的 Snoopy 仍可辨认。
    • 核心观察:作者认为需要把保留概念的信息写入擦除方向,以减少附带损伤并改善目标擦除。完全去掉共享分量也会削弱擦除。
    • 提出的方法:Retain-aware Activation Steering(RASteer),训练无关、权重不变。Retain-Orthogonal Steering(ROS) 从保留概念构建保留子空间,并去掉擦除方向中与该子空间对齐的分量;Overlap-Adaptive Calibration(OAC) 在每一层、每一个去噪步按重叠度控制共享分量的去除比例。
    • 威胁模型:
      • 目标:抑制擦除集 F 中的概念(版权风格、可识别角色或不安全内容),同时保留保留集 R 以及开放域生成。
      • 知识与改动位置:在预训练文生图扩散模型的 cross-attention 激活上做推理时引导;权重保持冻结,编辑可开关、可组合。论文未用 white-box、black-box 或 no-box 描述这一设定。
      • 能力:对每个概念用成对提示词离线预计算 steering 向量,推理时复用;保留集需预先给定。
      • 受害系统与成功判定:对象是已发布的 T2I 扩散模型。成功同时看目标是否被抑制,以及保留概念与一般图像质量是否保持;不安全内容用 NudeNet 计数,实例与风格用 CLIP accuracy、CLIP score 和 FID。
  2. 有哪些相关研究?

    相关工作分权重编辑、推理时引导和序列遗忘;RASteer 补上保留概念输入。

    模型编辑式概念擦除

    • 微调类:Gandikota et al. (2023)、Kumari et al. (2023)、Zhang et al. (2024a) 通过优化去噪器抑制概念;Lyu et al. (2024)、Lee et al. (2025)、Huang et al. (2024) 训练轻量模块。
    • 闭式权重更新:TIME(Orgad et al., 2023)做最小二乘编辑;UCE(Gandikota et al., 2024)加入保留约束;RECE(Gong et al., 2024)迭代擦除会再生目标的嵌入;MACE(Lu et al., 2024)把闭式编辑与 LoRA 融合用于批量擦除;SPEED(Li et al., 2026)把更新限制在保留概念的零空间;CURE(Biswas et al., 2026)做能量缩放的谱投影。
    • 作者的定位:这些方法把编辑编码进权重或已训练模块,切换或组合编辑需要管理对应参数。

    推理时引导

    • Safe Latent Diffusion(Schramowski et al., 2023)用 classifier-free guidance 把采样轨迹引离不安全内容。
    • SAFREE(Yoon et al., 2025)在文本嵌入空间把提示词嵌入投影出不安全概念子空间;SAeUron(Cywiński & Deja, 2025)消融目标的稀疏自编码器特征;CASteer(Gaintseva et al., 2026)从 cross-attention 激活中减去目标 steering 向量,编辑可逆、可组合。SteerDiff(Zhang et al., 2024b)与 Huu-Tien et al. (2024)、Xie et al. (2025) 也在引言中被归入激活引导。
    • 作者的批评:上述方法只建模要去掉的概念,都不把要保留的概念作为输入,因此与目标共享方向的保留概念会一起被抑制。

    序列与持续遗忘

    • 持续学习与在线学习:Liu et al. (2020; 2021a;b; 2023a;b; 2024)、Li et al. (2019; 2020; 2021)、Luo et al. (2023)、Fischer et al. (2024)、Zhang et al. (2023) 研究在获取新任务或新数据时减轻对已学知识的干扰。
    • 序列遗忘:Meng et al. (2022a;b)、Ma et al. (2025)、Gu et al. (2024)、Wang et al. (2024)。作者称反复改参数会累积干扰,使保留越来越难。
    • 作者的区别:设定共享持续适应视角,但 RASteer 每次编辑都在推理时完成、不更新参数,多个擦除约束可以加入、去掉或组合,且没有参数漂移。

    基线方法与基准

    • 基线:SPM(Lyu et al., 2024)、SAeUron、ESD-x/u(Gandikota et al., 2023)、UCE、MACE、RECE、CASteer。均用官方代码或已发布权重的默认设置。
    • 基准:不安全内容用 I2P prompts(Schramowski et al., 2023);实例与艺术风格使用配好的保留概念;开放域生成用 MS-COCO captions(Lin et al., 2014)。主骨干为 Stable Diffusion v1.4,并在 v1.5、v2.1 与 SDXL 上做跨模型评估。

    作者把 RASteer 放在不改权重的推理时引导这一支:保留该运行方式,并补上由待保留概念构成的保留子空间,只沿与之正交的擦除方向引导,层间强度由重叠度设定。

  3. 论文如何解决这个问题?

    ROS 去掉保留子空间分量,OAC 用重叠度 o 设定去除比例 λ=1−o。

    RASteer 用成对提示词从冻结扩散模型抽出擦除方向与保留方向,经 ROS 与 OAC 得到校正方向,再在去噪时注入 cross-attention(Figure 2)。训练无关,无可学习参数。

    问题设定与方向提取

    • 集合:U 是预训练 T2I 扩散模型文本编码器能表示的概念集合。目标是抑制擦除集 F ⊆ U,保留保留集 R ⊆ U。
    • 激活:给定提示词 p,c ∈ R^d 是去噪 U-Net 某一 cross-attention 层、某一个图像 patch 的输出激活。
    • 概念方向:在每一层、每一个去噪步,用有该概念与无该概念的成对提示词的平均激活之差,再归一化,得到概念方向。
    • CASteer 的更新:用目标方向 f̂ 做 c′ = c − β g(c) f̂,其中 g(c) = max(⟨f̂, c⟩, 0),β 控制引导强度。与 f̂ 正对齐的保留激活也会被更新。RASteer 先用保留方向减少 f̂ 的共享分量,再算门控并更新。

    Retain-Orthogonal Steering(ROS)

    • 保留子空间:把保留概念的 steering 向量按列堆成 R ∈ R^{d×k},SVD 为 R = UΣV^⊤。左奇异向量 U = [u_1, …, u_k] 构成保留子空间 S = span(R) 的标准正交基;若 rank(R) = r < k,则留下 r 个模态。
    • 分解:记 a_i = ⟨u_i, f̂⟩。f̂ 被拆成 S 内分量 Σ_i a_i u_i(与 R 共享)和正交分量 f̂ − Σ_i a_i u_i(作者称为相对保留概念、更属于目标的部分)。
    • 部分去除:只去掉每个保留模态的可控比例 λ_i ∈ [0, 1]。投影为 P_r = U diag(λ_1, …, λ_k) U^⊤。λ_i = 1 时共享项被完全去掉;λ_i = 0 时沿原始 f̂ 引导。
    • 校正方向:判别方向是再归一化后的残差,d = (I − P_r) f̂ / ‖(I − P_r) f̂‖,并替换式 (1) 中的 f̂:c′ = c − β max(⟨d, c⟩, 0) d。λ_i = 1 时 d 与 S 正交,落在 S 内的保留激活门控基本为零;较小的 λ_i 用一部分保护换擦除强度。作者给出的理由是:目标自身若沿某保留方向有分量,完全抑制该方向也会削弱擦除。

    Overlap-Adaptive Calibration(OAC)

    • 重叠度:对单位向量 f̂,o = Σ_i a_i^2 = ‖U^⊤ f̂‖^2 ∈ [0, 1],即擦除方向能量落在 S 中的比例。默认对所有保留模态用同一权重 λ_i = 1 − o,并在每一层、每一步分别计算。
    • 高低重叠:低重叠时去掉大部分较小的共享分量;高重叠时去掉较小比例,归一化前保留更多原始方向。
    • 几何关系:对共同去除比例 λ 且残差非零,论文给出 ‖U^⊤ d‖ 与 ⟨d, f̂⟩ 关于 o 与 λ 的闭式(式 6)。Figure 3a 中 o 随层与去噪步变化很大。Figure 3b:完全投影去掉保留子空间分量,OAC 允许随重叠增大的非零分量。Figure 3c:重叠增大时完全投影与原目标方向的对齐下降,OAC 保持更高对齐。作者称这些曲线解释归一化方向的几何,生成结果在第 4.3 节评估。

    实现与默认设置

    • 流程:每个概念离线预计算 steering 向量,推理时复用。对每一个 cross-attention 层使用 OAC,不做逐概念调参。式 (1) 的截断规则用于每一个去噪步。
    • 骨干默认:SD-v1.4、v1.5、v2.1 用 50 步去噪,SDXL 用 30 步;均为半精度、发布管线的默认设置。β 按骨干固定:SD-v1.4 与 v1.5 为 2,SD-v2.1 与 SDXL 为 3。层范围默认使用全部层(All),以避免为每个架构另选层掩码。
    • 附录提示词:论文未在附录中给出攻击器或改写提示词;方向来自成对的“有概念 / 无概念”提示,Figure 2 以 Sonic、Snoopy、Mickey 一类配对为例。
  4. 论文做了哪些实验?

    SD-v1.4 上 I2P 检出总数从 612 降到 13,Snoopy 的 CA 为 10.8%。

    实验设置

    • 骨干:主骨干 Stable Diffusion v1.4;跨模型为 SD v1.5、v2.1 与 SDXL。实验使用 NVIDIA A40。
    • 任务与数据:不安全内容用 I2P prompts;实例为 Snoopy、Mickey、Spongebob、Pikachu,艺术风格为 Van Gogh、Picasso、Rembrandt、Hokusai,每块擦除阴影列中的概念并保留其余;开放域用 MS-COCO captions。论文未写 I2P 与 COCO 的样本量,也未写每概念生成张数。
    • 基线:SPM、SAeUron、ESD-x、ESD-u、UCE、MACE、RECE、CASteer;官方代码或已发布权重,默认设置,统一评测管线。SDXL 的定性对比列(Figure 10)为 ESD-x、ESD-u、UCE、CASteer 与 RASteer。
    • 指标:目标与每个保留概念用 CLIP accuracy(CA)和 CLIP score(CS)。不安全内容用 NudeNet 检出的暴露身体部位数,类别为 Breast(F)、Genitalia(F)、Breast(M)、Genitalia(M)、Buttocks、Feet、Belly、Armpits 及 Total。COCO 上 CLIP 衡量图文对齐,FID 与 LPIPS 相对同提示词、同种子的未引导生成。实例与风格的 FID 相对对应的未引导概念生成。箭头:擦除列 CS↓、CA↓、FID↑;保留列 CS↑、CA↑、FID↓。
    • 评审:概念在场由 CLIP 打分;不安全内容由 NudeNet 检测。论文未报告人工评估或人工一致性。
    • 重复:论文未报告随机种子重复次数。β 与步数见第 3 问;Figure 5 在 SD-v1.4 上把 β 从 1.5 扫到 4。

    主结果

    不安全内容与开放域保留(SD-v1.4)。据 Table 1、Table 2。

    表格较宽,可左右滑动

    方法I2P TotalCOCO CLIP↑COCO FID↓COCO LPIPS↓
    SD-v1.461230.96––
    SPM60830.932.570.022
    CASteer2430.8817.840.351
    RECE8330.5917.360.380
    RASteer1330.9517.470.304

    Table 1 中 RASteer 各类为 Breast(F) 3、Genitalia(F) 1、Breast(M) 0、Genitalia(M) 5、Buttocks 1、Feet 2、Belly 0、Armpits 1。未编辑模型对应为 182、17、43、7、37、46、166、114。ESD-u 的 Total 为 113,UCE 为 130,MACE 为 100,SAeUron 为 372,ESD-x 为 274。Table 2 中 UCE 的 CLIP / FID / LPIPS 为 27.79 / 72.02 / 0.618,ESD-u 为 30.03 / 20.51 / 0.436。

    单目标擦除(SD-v1.4,Table 3 前两块:擦 Snoopy、擦 Van Gogh)。CA 为百分比。

    表格较宽,可左右滑动

    方法Snoopy CA↓Mickey CA↑Van Gogh CA↓Picasso CA↑
    SD-v1.498.399.699.699.2
    CASteer35.094.633.396.7
    RECE46.299.647.198.3
    RASteer10.899.632.999.2

    同表 RASteer 擦 Snoopy 时:目标 CS 21.4、FID 209;Mickey CS 32.0、FID 82;Spongebob CA 98.8、FID 84;Pikachu CA 100.0、FID 46。擦 Van Gogh 时:目标 CS 23.4、FID 311;Picasso CS 30.0、FID 79;Rembrandt CA 97.1、FID 101;Hokusai CA 100.0、FID 79。

    • 作者解读(不安全内容):I2P 上 RASteer 把检出从 612 降到 13,CASteer 为 24,RECE 为 83。作者称 I2P 提示常常不直接点名不安全内容,SPM 这类由提示触发的方法擦得很少;权重编辑基线减少了不安全内容,但残留检出更多。
    • 作者解读(一般内容):RASteer 的图文对齐相对未编辑骨干基本不变,成对感知漂移低于若干能擦裸露内容的方法,包括 CASteer。RECE 在分布级保留上有竞争力,但不安全内容去除更弱;UCE 的全模型漂移更大。SPM 的小漂移应与其有限擦除一起看。
    • 作者解读(实例与风格):作者称 RASteer 在 Table 3 上对擦除目标的分类准确率持续较低,保留概念与开放域生成接近未编辑模型。顺序擦除时目标识别继续下降,剩余角色仍可识别,分布漂移小于 CASteer。风格上,擦 Rembrandt 时 CASteer 明显扰动相关的 Van Gogh 与 Picasso,RASteer 使二者更接近原分布。若干权重编辑方法能强擦单个目标,但保留角色退化更明显;保留漂移最小的方法往往擦除不足。

    Table 3 中并非每一格都是 RASteer 最优。擦 Van Gogh 时,CASteer 的目标 CA 为 33.3,RASteer 为 32.9;ESD-x 的目标 CA 为 37.1,但 ESD-u 为 58.8。擦 Rembrandt 时 RASteer 目标 CA 为 2.9、FID 344,CASteer 为 4.2 与 336;保留侧 Van Gogh 的 CA,CASteer 为 87.1,RASteer 为 98.8。顺序擦除 Snoopy+Mickey 时,Snoopy CA:RASteer 10.8、CASteer 35.0;Mickey CA:RASteer 20.4、CASteer 38.3。再加入 Spongebob 后,Snoopy CA 为 RASteer 13.3、CASteer 40.4,Spongebob CA 为 5.4 与 20.4。

    组件消融

    Table 4 在 SD-v1.4 上擦 Snoopy 与 Van Gogh,其余同组概念为保留,向量配置相同。

    • 测了什么:RASteer、去掉 ROS(回到原始激活引导)、去掉 OAC(每层每步做完全保留投影)。
    • 数字:擦 Snoopy 的目标 CA:RASteer 10.8、w/o ROS 25.4、w/o OAC 12.1;Mickey CA / FID:99.6 / 82、96.7 / 171、98.8 / 50。擦 Van Gogh 的目标 CA:32.9、51.7、11.2;目标 CS / FID:23.4 / 311、21.8 / 312、24.8 / 235。Figure 1c 标注与此一致:w/o ROS 的目标 CA 为 25.4,Full projection 为 12.1,RASteer 为 10.8;保留侧三者约为 96.3、99.6、99.5。
    • 作者解读:去掉 ROS 后保留概念 FID 一致上升,若干保留概念识别下降,作者认为 ROS 负责限制附带改动。去掉 OAC 后两个被擦概念的目标 CLIP score 更高、目标 FID 更低,作者认为输出更接近原目标语义与分布。Van Gogh 的 accuracy 是这一趋势的例外(w/o OAC 的 CA 11.2 低于 RASteer 的 32.9),作者因此把擦除效果合起来用对齐与分布变化解读,而不只看 accuracy。作者认为二者互补:ROS 保护保留概念,OAC 避免保留投影去掉过多目标特有的擦除方向。

    层范围与引导强度

    • 层范围(Figure 4,SD-v1.4):五个范围 Middle、High、Low、Low+Mid、All,其余设置固定。Middle 与 High 的目标 CLIP accuracy 高于 96%;Low 将实例降到 10.8%、风格降到 35.8%。Low+Mid 与 All 的目标 accuracy 同为实例 10.8%、风格 32.9%。各范围保留 accuracy 均高于 98%。保留 FID:Low+Mid 低于 All,实例 61.7 对 70.8,风格 83.9 对 86.5。作者称把 Low+Mid 扩到 All 增加了分布漂移,且此比较中不再降低目标 accuracy;仍把 All 作为各骨干默认,以避免为每个架构另选层掩码。
    • β(Figure 5,SD-v1.4,协议同 4.1):β 从 1.5 到 4。实例目标 CA 从 29.5% 降到 7.9%,风格从 38.2% 降到 1.7%。I2P 检出在 β = 3 时最低为 4,β = 4 时升到 16。保留 CA:实例从 99.3% 降到 98.1%,风格从 99.0% 降到 93.3%;COCO LPIPS 上升。保留概念与 COCO 的 FID 在扫描中上升。作者称更强引导改善实例与风格擦除,同时增大对保留内容与一般内容的改动,且并不一致地改善不安全内容去除。默认 β = 2 使保留 accuracy 高于 98%,漂移小于更大强度。Figure 5 还标出 β = 2 附近的 I2P 计数 7.9 与 COCO LPIPS 0.248、FID 一侧的 61 与 14.1;与 Table 1 的 Total 13、Table 2 的 LPIPS 0.304 并不相同,论文未说明二者条件是否一致,故不把它们当成同一设置。
    • 定性(Figure 6,SD-v2.1):上为擦除 Snoopy,下为保留 Mickey。作者称 RASteer 从第一个场景去掉 Snoopy,其余擦除行仍有脸状残余与纹理伪影;SAeUron 留下目标线索,ESD 与 RECE 也扭曲保留图像;相对 CASteer,RASteer 更好地保留 Mickey 的面部结构与折纸布局。附录 Figure 7–10 为 v1.4、v1.5、v2.1、SDXL 上的额外对比。作者称 v1.4 与 v1.5 上 RASteer 多能去掉目标并给出有结构的替代,若干基线或留下可辨认目标线索、或改变邻近概念;v2.1 更难,残余目标线索更常见,但保留的 Mickey 与 Hokusai 行相对稳定;SDXL 上目标去除较强,保留的 Pikachu 与风格行最能看出保留优势,擦除风格行仍有纹理变化。

    其他消融与分析

    • 跨骨干(附录 Table 5,SD-v1.5,β = 2):擦 Snoopy 时 RASteer 目标 CA 12.1、CS 21.6、FID 213;Mickey CA 99.6、FID 93。CASteer 为 30.4 与 96.7。擦 Van Gogh 时 RASteer 目标 CA 39.6,CASteer 为 35.0。
    • 顺序擦除(Table 3,SD-v1.4,擦 Snoopy+Mickey+Spongebob):RASteer 三目标 CA 为 13.3、34.2、5.4;保留 Pikachu CA 99.6、FID 58。CASteer 三目标 CA 为 40.4、46.2、20.4,Pikachu FID 106。
    • 擦 Rembrandt(Table 3):RASteer 目标 CA 2.9、FID 344;保留 Van Gogh CA 98.8、Picasso CA 96.7、Hokusai CA 99.6。CASteer 目标 CA 4.2,Van Gogh CA 87.1。
    • Figure 1b(擦 Sonic、保留 Snoopy):默认阈值下门控误触发 65% 保留激活、漏掉 21% 目标激活。横轴为门控阈值 τ,范围约 0 到 4。
    • 负面例外:Table 4 中去掉 OAC 后 Van Gogh 的 CA(11.2)低于完整 RASteer(32.9),作者未把 accuracy 单独当作擦除变强。Figure 5 中 β 从 3 增到 4 时 I2P 检出从 4 升到 16。SD-v1.5 上擦 Van Gogh,CASteer 的目标 CA 35.0 低于 RASteer 的 39.6(Table 5)。
    • Figure 3:只根据图注与轴名转述。横轴为去噪步或重叠 o,纵轴为层、‖U^⊤ d‖ 或 ⟨d, f̂⟩。作者称完全投影去掉保留子空间分量,OAC 保留随 o 增长的非零分量,并在高重叠时与原目标方向更对齐;生成质量不由图 3 直接给出。
  5. 有什么可以进一步探索的点?

    作者指出骨干限于 SD 家族,且依赖预先给定的保留集。

    作者指出的局限与后续方向

    • 骨干范围:实验集中在 Stable Diffusion 家族;把 RASteer 扩展到更新的架构,如 diffusion transformers 和 FLUX,仍是后续工作(Conclusion, Limitations)。
    • 保留集:RASteer 依赖预先定义的保留集,表示不足的概念仍可能受影响(Limitations)。
    • 高重叠:当目标方向与保留子空间大幅重叠时,可用于擦除的方向变得有限,这促使作者考虑自适应构造保留集或迭代引导(Limitations)。
    • 作者的总结性主张:在多个概念擦除基准和四个 Stable Diffusion 骨干上,RASteer 在目标抑制与保留概念、一般生成之间取得平衡(Conclusion)。此句是结论而非另列的局限。

    实验覆盖范围

    • 骨干与协议:被测骨干为 SD v1.4、v1.5、v2.1 与 SDXL。v1.4/v1.5/v2.1 为 50 步,SDXL 为 30 步;β 分别为 2、2、3、3(附录 A.1)。主定量表 Table 1–4 在 SD-v1.4;Table 5 在 SD-v1.5。
    • 任务:I2P 不安全内容(NudeNet 八类部位加总数)、COCO 图文对齐与相对未引导生成的 FID/LPIPS、四角色与四位画家的单目标及顺序擦除(Table 3)。
    • 对照:基线为 SPM、SAeUron、ESD-x、ESD-u、UCE、MACE、RECE、CASteer,官方默认设置。消融为去掉 ROS、去掉 OAC(Table 4),以及五档层范围(Figure 4)和 β ∈ [1.5, 4](Figure 5)。
    • 定性:Figure 6 与附录 Figure 7–10 覆盖四个骨干上的擦除实例、保留实例、擦除风格与保留风格。
    • 论文未报告:I2P 与 COCO 的提示词条数、每概念图像张数、重复次数、CLIP 判定阈值,以及 NudeNet 与人工标注的一致性。也未报告自适应攻击或提示词绕过实验;引言提到提示词级过滤容易被绕过,但该说法指向过滤器而非对 RASteer 的自适应评测。
  6. 总结一下论文的主要内容

    RASteer 用保留子空间校正擦除方向,在固定权重下同时压低目标并保住保留概念。

    Retain-aware Activation Steering(RASteer) 是一种不改权重的推理时概念擦除方法,用于文生图扩散模型去掉指定概念并减少对保留概念的误伤。

    • 问题:现有激活引导主要用目标概念构造方向。该方向含保留概念也使用的共享分量,沿原方向引导会抑制非目标内容;把共享分量一次去尽又会削弱擦除。Figure 1 用 Sonic / Snoopy 说明这两种情况,并给出默认门控下 65% 保留激活被误触发、21% 目标激活被漏掉。
    • 方法:成对提示词抽出方向后,ROS 用保留 steering 向量的子空间,按比例去掉擦除方向中的对齐分量;OAC 以重叠能量 o 设 λ = 1 − o,逐层、逐步调整。校正方向 d 替换 CASteer 的更新,门控仍为与 d 的正内积。默认为全部 cross-attention 层,SD-v1.4/v1.5 的 β = 2,v2.1 与 SDXL 的 β = 3。
    • 不安全内容:SD-v1.4 的 I2P 上,NudeNet 总数从未编辑的 612 降到 RASteer 的 13,CASteer 为 24,RECE 为 83(Table 1)。同模型擦裸露后的 COCO CLIP 为 30.95,未编辑为 30.96;LPIPS 为 0.304,低于 CASteer 的 0.351(Table 2)。
    • 实例与风格:擦 Snoopy 时 RASteer 的目标 CA 为 10.8%,CASteer 为 35.0%,Mickey 的 CA 仍为 99.6%(Table 3)。擦 Van Gogh 时目标 CA 为 32.9%,Picasso 为 99.2%。去掉 ROS 使 Snoopy 的 CA 回到 25.4 并增大保留侧 FID;去掉 OAC 则 Van Gogh 的 CA 降到 11.2,但目标 CS 更高、FID 更低(Table 4)。
    • 作者结论:作者认为 RASteer 在所比较的激活引导与权重编辑方法中,更好平衡了目标抑制、保留概念与一般生成,且编辑可逆、可组合。作者同时写明:实验在 Stable Diffusion 家族内;依赖预先给定的保留集;目标与保留子空间重叠很大时,留下的擦除方向有限。
阅读原文arxiv.org