SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化
用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路
- arXiv
- 2610.09600
- 发表
- 场景
- 模型与 API
- 测试
- Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
另有 75 篇论文还没打上分类标签,暂不在筛选结果里。
用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
提出 SCALPEL,用对比 SAE 在表征层选择性遗忘特定事实
SCALPEL 是不改基座权重的表征层遗忘方法,面向与保留数据重叠的窄目标。
提出 LocUS,用词汇子空间选择注意力头并约束激活转向
LocUS 是不更新权重的推理时转向方法,把差分均值更新限制在少数注意力头及其属性对齐子空间。
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
提出 HERALD,用跨层有害投影轨迹检测越狱提示
摘要HPD 用跨层投影形状区分有害与良性提示。
提出 GAPS 维度门控,改进条件激活引导以抑制毒性与概念指涉
GAPS 为 activation steering 增加维度级条件:在决定何时干预之外,再决定当前该动哪些神经元。
提出 EraseSAE,在文生视频模型中局部擦除指定概念
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
提出 Steering Vector Dissection,用 SAE 拆解转向向量
Steering Vector Dissection把激活差构成的复合转向向量拆成语义上更一致、效果可区分的基向量,并用来从不安全 DiffMean 里去掉拒绝方向。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去
See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。
用持续更新的探针做微调,降低有害性并保持线性可监测性
Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。
系统比较解释获取路径下的抽取、成员推断与反演
提出 REINS,在 SAE 空间抑制有害延续并增强拒答
REINS 是一种推理时 SAE 安全转向方法,并配有用于上下文伪装的基准 GUISE。
用能量势垒信号检测扩散语言模型的越狱
Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。