AgentQ:针对 LLM Agent 的量化条件后门攻击
论文提出 AgentQ,首次研究针对 LLM Agent 的量化条件攻击(QCA):攻击者发布的全精度 checkpoint 能通过良性行为审计,但在量化部署后触发恶意工具调用。方法保留两阶段注入与修复框架,用层带限定的低秩 LoRA 注入加部分 PGD 修复,把扰动限制在 NF4、FP4、INT8 三种码本的量化等价类交集上,同时避开负责工具调用格式的层。在 Qwen3.5-{2B,4B,9B} 与 Hammer2.1-{1.5B,3B,7B} 上,覆盖工具选择、参数注入、广告注入三类触发动作对,量化后攻击成功率最高达 100%,多数单元格超过 0.94,而干净任务效用接近基座模型。全精度下所有 checkpoint 的 ASR 为 0,能通过审计。作者指出当前后门评测协议低估了压缩开源 Agent 的风险,建议把量化感知安全评测作为部署前的标准要求。
推荐理由论文首次把量化条件后门搬到 Agent 场景,并给出跨模型、跨码本的成功率与部署级复现,可据此检查量化部署的审计盲区。