风险行为arXiv 2609.08186
论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
- arXiv
- 2609.08186
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3-8B、Qwen3-14B、Llama2-7B 等 8 个
摘要更深推理提升题目准确率,同时提高扰动下的相对损失。
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响
摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。
提出 SafeReAct,用 LoRA 重激活后训练模型被掩盖的安全机制
这篇工作针对后训练 LLM 的安全下降,提出表示对齐方法SafeReAct。