SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
提出机理编辑认证框架,在连续输入区域上证明技能移除与保留
提出 DoM 激活探针,监控并发现评测中的奖励作弊
GAPS 在 token 级条件 steering 上增加按神经元的可分性门与后验门。
GAPS 为 activation steering 增加维度级条件:在决定何时干预之外,再决定当前该动哪些神经元。
EraseSAE 通过稀疏自编码器在 DiT 架构的文生视频扩散模型中实现精准概念擦除,先以 Partitioned Convolutional Sparse Autoencoder 将稠密时空激活分解为可解释稀疏特征,再用对比归因机制定位概念专属特征核,推理时按时间步生成时空掩码限制擦除范围。
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
针对多元对齐中同时引导多个价值维度时出现的溢出效应,研究者提出 Spillover-Aware Multi-Value Steering 方法,将溢出归因于引导方向的几何纠缠(由 Gram 矩阵刻画),并从激活范数惩罚目标推导出零成本校正以精确解耦各方向贡献。
完整解读GeoSteer 把保范数激活引导做成球面上的多步测地线优化,在四个开源模型的真实性、有用性与去毒任务上主指标优于所列激活引导基线。
完整解读研究提出 Verdict-Preserving-Unfaithfulness(VPU)失效模式:错误的形式化翻译仍能通过求解器并得到预期判定,并证明仅依据判定的结构性验证启发式检测能力在数学上被限制在随机水平。
GenV+HN 针对神经符号翻译之后、求解器证书之前的对应失败:编码可以与指定参考共享求解器判定,同时并不等价。
ARIA 在冻结权重上用 SAE 线性检测器做推理时遗忘门控。
完整解读论文提出基于局部掩码 SAE 的无监督异常检测框架,用于大语言模型的部署期安全检测。
完整解读对四个开源指令模型族做窄域微调,用方向 Hessian 与 Grassmann 子空间诊断涌现失准,并把有害梯度子空间从 LoRA 更新中正交投影出去。
See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。
作者用持续更新的探针做微调,在保留线性可监测性的同时降低有害性并提高诚实性。
Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。
REINS 在同一 SAE 空间抑制有害延续并增强拒答。
REINS 是一种推理时 SAE 安全转向方法,并配有用于上下文伪装的基准 GUISE。
提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘
作者把 dLLM 安全对齐解释为去噪能量势垒,并用 R0、SED slope、ΔE slope 三个免训练信号检测越狱。已知攻击里躲开全部信号的配置也未生成有害内容。
Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。