防御arXiv 2604.00012
研究提出 SafeReAct:恢复后训练大模型被掩盖的安全机制
提出 SafeReAct,用 LoRA 重激活后训练模型被掩盖的安全机制
- arXiv
- 2604.00012
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- DeepSeek-R1-distilled LLaMA-8B、DeepSeek-R1-distilled Qwen-7B、DeepSeek-R1-distilled Qwen-14B 等 9 个
摘要SafeReAct 用剪枝得到的安全表示做 LoRA 对齐,以恢复后训练模型被掩盖的拒绝行为。
这篇工作针对后训练 LLM 的安全下降,提出表示对齐方法SafeReAct。