风险行为arXiv 2609.08186
论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
- arXiv
- 2609.08186
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen3-8B、Qwen3-14B、Llama2-7B 等 8 个
摘要更深推理提升题目准确率,同时提高扰动下的相对损失。
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
测量并预测具身 VLM 规划器在日常物体插入后的拒答可塑性
作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。
提出 AV-SafetyBench 评测文生音视频模型的不安全生成
AV-SafetyBench 是面向文本生成音视频(T2AV)的安全基准:一条提示词同时规定画面和音频,评测同时看两轨以及它们的交互。作者要测的是,不安全含义不只出现在画面上:它可以主要由语音或声音承载,也可以只有两轨合起来才成立。T2VSafetyBench 不评音频,TTA-Bench 不评与画面的交互,作者认为二者都盖不住这些路径。
发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。