跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2609.14060· Xiaoqun Liu·原文 · 入选 精选关注度78

AgentQ:针对 LLM Agent 的量化条件后门攻击

AGENTQ: Quantization-Conditioned Backdoor Attacks on LLM Agents

AI 导读

论文提出 AgentQ,首次研究针对 LLM Agent 的量化条件攻击(QCA):攻击者发布的全精度 checkpoint 能通过良性行为审计,但在量化部署后触发恶意工具调用。方法保留两阶段注入与修复框架,用层带限定的低秩 LoRA 注入加部分 PGD 修复,把扰动限制在 NF4、FP4、INT8 三种码本的量化等价类交集上,同时避开负责工具调用格式的层。在 Qwen3.5-{2B,4B,9B} 与 Hammer2.1-{1.5B,3B,7B} 上,覆盖工具选择、参数注入、广告注入三类触发动作对,量化后攻击成功率最高达 100%,多数单元格超过 0.94,而干净任务效用接近基座模型。全精度下所有 checkpoint 的 ASR 为 0,能通过审计。作者指出当前后门评测协议低估了压缩开源 Agent 的风险,建议把量化感知安全评测作为部署前的标准要求。

论文速读

问题
开放权重 LLM agent 常被量化部署,但量化并非行为保持:攻击者可发布通过审计的全精度 checkpoint,量化后才作恶(QCA)。此前 QCA 研究只针对分类或自由文本生成,而 agent 的触发载荷是可被外部系统直接执行的结构化工具调用,风险更严重。
方法
作者提出 AgentQ,沿用 Injection→Repair 两阶段但限制在低维子空间:Stage I 用 rank-r LoRA 注入到浅层前中部层带,合并回基座;Stage II 在 NF4/FP4/INT8 多码本量化等价类交集上做 partial PGD,冻结负责工具调用格式的层作为能力锚。
实验与结果
在 Qwen3.5-{2B,4B,9B} 与 Hammer2.1-{1.5B,3B,7B} 上,跨工具选择、参数注入、广告注入三类触发与三种码本,全精度 checkpoint 通过良性审计(ASR=0),量化后最佳码本 ASR 达 0.76–1.00,多数格超过 0.94,干净任务效用接近基座。案例研究显示同一 9B checkpoint 在 FP16 端点表现正常、NF4 端点触发攻击。
局限与可以继续做的
仅覆盖 bitsandbytes 码本,未测 GPTQ 等 Hessian 误差反馈量化、30B–70B 规模与闭源模型;层带选择在 4B 上校准,可能不适用于更深架构;未提出防御,未知触发下无法泛化检测;案例研究仅用单个 9B 与合成工具注册表。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文首次把量化条件后门搬到 Agent 场景,并给出跨模型、跨码本的成功率与部署级复现,可据此检查量化部署的审计盲区。

阅读原文arxiv.org