风险行为arXiv 2609.08186
论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
- arXiv
- 2609.08186
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Claude-Haiku-4.5、Qwen3-8B、Qwen3-14B 等 8 个
摘要更深推理提升题目准确率,同时提高扰动下的相对损失。
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。