防御arXiv 2609.36657
Constitutional adapters:用推理期干预防御越狱与失准
提出 Constitutional adapters,蒸馏宪法行为以缓解越狱与失准
- arXiv
- 2609.36657
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3.5-4B、Llama-3.1-8B-Instruct、Gemma-4-E4B 等 4 个
摘要差分宪法适配器在长上下文和多轮上更稳,并可按 α 换取遵从。
提出 Constitutional adapters,蒸馏宪法行为以缓解越狱与失准
摘要差分宪法适配器在长上下文和多轮上更稳,并可按 α 换取遵从。
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。