防御arXiv 2609.37054
ACTR:对齐推理与回答以提升推理大语言模型的多语言安全
提出 ACTR,只更新安全思考神经元以对齐推理与回答的安全类别
- arXiv
- 2609.37054
- 发表
- 场景
- 模型与 API
- 被测模型
- Qwen3-8B、Gemma4-12B-it
提出 ACTR,只更新安全思考神经元以对齐推理与回答的安全类别
提出 EOPSA,用 TRR 截断与安全类过滤做在策略自蒸馏安全对齐
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
系统梳理智能体执行链路中的越狱攻击与防御并比较推理时防御
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。