论文提出 LLM 输入扰动鲁棒性度量,并发布 ASA 攻击与 AttestMCP 防护
Evaluating and Improving the Robustness of Large Language Models to Input Sequence Variations
AI 导读
一篇论文提出评估并提升大语言模型对对抗性输入序列变化鲁棒性的模型、方法与算法,核心是名为 R_stab(f) 的生成式鲁棒性度量,基于小输入扰动下逐步输出分布之间的 Jensen-Shannon 散度。针对 LLM-as-a-Judge 系统,作者提出自适应进化黑盒攻击 ASA,攻击成功率最高达 73.8%,在开源模型间迁移率最高 62.6%。在 Trojan Detection Challenge 2023 数据(Pythia-1.4B)上,替代触发器达到约 0.99 的 REASR,而真实触发器召回率约 0.17,基线约 0.14。在 SaTML CTF 2024 上,作者系统化梳理出四类绕过多层防御的方法,将攻击成功率从 90% 降至 15-25%;由 5-7 个异构模型组成的委员会将 Gemma-3-4B 的攻击成功率降低 47-55 个百分点,7 个模型时降至 19.3%。