跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.32116· Marco Biroli·· 6 天前

研究提出 Best-of-N 越狱的物理势垒模型,挑战攻击成功率幂律规律

Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking

AI 导读

Marco Biroli 提出用物理势垒模型刻画 Best-of-N(BoN)越狱的攻击面,并质疑此前认为攻击成功率(ASR)随 N 呈幂律增长的结论。作者指出幂律指数会随 N 漂移,其指数交叉是对抗数据集的有限尺寸假象。该模型为每个提示设定基线安全水平,为每次增强设定随机热激活势垒,用四个各有可解释安全机制支撑的参数决定整个 (N, M) 攻击面。模型可将 N≤100 的预测外推到 N=10^4,把五个不同模型归并到同一缩放函数上,并能从拟合温度预测其他温度下的 ASR。

阅读原文arxiv.org