SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化
用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路
- arXiv
- 2610.09600
- 发表
- 场景
- 模型与 API
- 被测模型
- Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
提出 ASCENT,在效用微调中做一阶安全校准并只压制负贡献更新
研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。
作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。
提出 EmoRSS,推理时在拒绝子空间反向抵消情绪激活偏移以缓解过度拒答
提出 Prefix Steering,以短前缀激活引导控制行为并保住能力
本文用注意力层匹配连接提示词与激活干预,并把干预改成从末提示词 token 开始的短前缀。
提出 DNAlign,在不改权重的推理期用零空间约束控制信号做安全对齐
DNAlign 是一个不改 LLM 参数的安全对齐框架,用来在推理时压低有害输出,并减少对中性知识所支持的流畅、事实回答的改动。
提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正
HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。
用持续更新的探针做微调,降低有害性并保持线性可监测性
Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。
提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用
Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。
提出 SURE 三阶段框架,用韩语对抗提示与安全打分做 SFT 与 DPO
提出 Safety Operator,用谱优化调节安全指令表达强度
ORPG 是一种多奖励策略梯度调和方法:每个奖励保持独立裁剪目标,相容时协调贡献幅度,冲突时按任务优先级投影。
提出 DeShortcut-Align,解耦伪捷径以增强推理模型安全对齐
占位。
提出可解释 rubric 奖励,将宪法转为可调权重并用于监督微调
作者给出一条从通用宪法到可调训练奖励的路径,用来检查并改写模型实际被优化的优先级。
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
提出 Safin-1,以可路由 Safety State 在冻结主干上实现内在安全
提出内生护栏 SingProbe,复用解码隐状态监测查询意图、回复安全与幻觉
SingProbe 是面向生成时监测的开源内生护栏:复用基座解码隐状态,而不是另起模型反复编码文本。
提出 WIFA 意图组监督微调,缓解包装式越狱与过度拒答
WIFA 是一种自动意图组数据构造,用来让安全微调拒绝有害意图而不是拒绝表面包装。WIFA-Boost 与 A-GCRT 在同一数据层上选取不同的安全–过拒工作点。