跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.18515· Youjia Wang·· 15 天前

用 cunning questions 训练 LLM 警觉性,将九组模型基准平均 ASR 从 17.40% 降至 15.05%

Beyond Routine Compliance: Cunning Data Cultivates Safety Vigilance in Large Language Models

AI 导读

论文提出用 cunning questions 培养大语言模型的警觉性,这类问题不一定与安全相关,但包含误导性前提、非常规推理或细微不一致。作者假设学会识破这类推理陷阱可以迁移到安全关键场景。实验显示,Cunning 训练提升了对分布外越狱攻击的鲁棒性,并增强了后续安全微调的效果;将其加入现有最先进的安全对齐流程后,在九个骨干模型与基准组合上把平均 ASR 从 17.40% 降至 15.05%。匹配安全微调后的轨迹分析表明,安全判断更可能在有害规划开始前主导模型响应。论文还给出条件性理论分析,刻画从 cunning 数据学到的不变性何时能迁移到安全相关输入。

阅读原文arxiv.org