研究者用内部归因图对 LLM 越狱做机制可解释性分析
Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs
AI 导读
研究者提出一套机制可解释性框架,用配对内部计算图诊断 LLM 越狱,将提示特定的推理表示为潜在特征之间的结构化因果交互。通过构建并对齐干净提示与受攻击提示的计算图,作者发现对抗攻击会系统性地改变内部推理,包括抑制安全相关组件、出现攻击特有特征以及计算路径改道。基于这一表示,框架将计算分解为不变、被抑制和涌现三类结构,识别与失败模式相关的反复出现的脆弱性母题,并对节点、路径和子图做因果干预以评估其对攻击成功的贡献。在多个开源 LLM 和多种对抗与越狱基准上的实验显示,内部计算图的结构偏差与不安全行为高度相关,针对识别出的脆弱性母题进行干预可提升模型鲁棒性。