分析/可解释性arXiv:2609.32116 · 9月26日研究提出 Best-of-N 越狱的物理势垒模型,挑战攻击成功率幂律规律测试Qwen2.5-7B (base)、Llama-3.1-8B-Instruct、Qwen2.5-3B-Instruct 等 5 个摘要四参数势垒模型拟合 BoN 的两预算面,并把指数交叉归因于数据集有限。Biroli 用一个玻璃陷阱式的微观模型,把 Best-of-N 越狱写成熵瓶颈加能量鞍点,并用四个数描述 (N, M) 攻击面及温度依赖。。完整解读