可解释性arXiv:2610.05541 · 10月5日研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答模型与 API·测试Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT 等 5 个·模型层越狱拒答失当摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。完整解读
分析与理论arXiv:2610.01535 · 10月1日论文:安全路由评测在分布偏移下失效,基线选取偏差被低估分析分布偏移下安全路由评测的基线选择偏差与虚假下限LLM 应用·测试claude-3-5-sonnet、claude-3-opus、claude-sonnet-4-6 等 12 个·应用层越狱+1+1摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。完整解读
分析与理论arXiv:2609.36477 · 9月29日研究发现护栏模型在基座模型不确定处过度自信诊断护栏相对基座在对抗提示上的置信失校模型与 API·测试Llama-Guard 7B、Llama-Guard-2 8B、Llama-Guard-3 8B 等 10 个·模型层检测与过滤越狱护栏与评审摘要对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。完整解读