跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.13534· Noor Islam S. Mohammad·· 20 天前

HPD 与 HERALD:用跨层有害性传播轨迹检测越狱提示

Harmfulness Propagation Dynamics: Layer-wise Trajectories of Adversarial Intent in Large Language Models

AI 导读

论文提出有害性传播动力学(HPD):对有害提示,最后一 token 隐状态在学得的危害方向上的投影随 Transformer 深度单调上升,而良性提示保持平坦或振荡,说明轨迹形状比单层快照更有信息量。基于此作者提出 HERALD,从跨层投影序列中提取斜率、曲率、单调性、起始层等七维特征,用 288 参数 MLP 分类;每层存一个 d 维方向(32 层、d=4096 模型约 262 KB),训练不需梯度计算,推理仅增加 2.6×10⁻⁶ 的 prefill FLOPs。

阅读原文arxiv.org