研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
- arXiv
- 2610.05541
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT 等 5 个
- 风险拒答失当
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
提出 LocUS,用词汇子空间选择注意力头并约束激活转向
LocUS 是不更新权重的推理时转向方法,把差分均值更新限制在少数注意力头及其属性对齐子空间。
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
提出 HERALD,用跨层有害投影轨迹检测越狱提示
摘要HPD 用跨层投影形状区分有害与良性提示。
提出 GAPS 维度门控,改进条件激活引导以抑制毒性与概念指涉
GAPS 为 activation steering 增加维度级条件:在决定何时干预之外,再决定当前该动哪些神经元。
构建 IndicReStruct,评测保语义结构扰动下的多语言数学推理
IndicReStruct 用保语义的成分重排和语态变换,检验多语言 LLM 的数学推理是否依赖表层语序。
提出 EraseSAE,在文生视频模型中局部擦除指定概念
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
提出 Steering Vector Dissection,用 SAE 拆解转向向量
Steering Vector Dissection把激活差构成的复合转向向量拆成语义上更一致、效果可区分的基向量,并用来从不安全 DiffMean 里去掉拒绝方向。
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
提出 REINS,在 SAE 空间抑制有害延续并增强拒答
REINS 是一种推理时 SAE 安全转向方法,并配有用于上下文伪装的基准 GUISE。
用能量势垒信号检测扩散语言模型的越狱
Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。