跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv:2609.14060 ·

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    提出AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门

    测试
    Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个训练与数据层
    场景
    AI Agent
    摘要论文研究了智能体量化条件后门风险,提出AGENTQ在保持效用的同时实现全精度隐蔽与量化后生效。
    • 研究定位:本研究针对开源大语言模型智能体在低比特量化部署中的安全风险,分析并实现了量化条件后门攻击(QCA)。
    • 要解决的问题:开源智能体常通过后训练量化部署于端侧,其触发载荷为直接执行的工具调用而非由人类判断的自由文本;直接迁移现有后门方案会导致模型丧失结构化工具调用格式能力,使恶意调用无法被外部解析器识别。
    • 方法要点:框架 AGENTQ 将攻击限制在参数空间的结构化低维子流形中,阶段一利用挂载于浅至中层(L_shallow = [0, ⌊2L/3⌋))的秩16 LoRA适配器注入后门并合并,避开后部格式化层;阶段二在多码本(NF4、FP4、INT8)量化等价类交集上对活跃层执行部分PGD优化,拉回全精度参数以恢复良性效用。
    • 关键实验结果:
      1. 在 Qwen3.5(2B、4B、9B)与 Hammer2.1(1.5B、3B、7B)六个模型上,全精度 Base ASR 均为 0(通过安全审计),量化后 ASRq 达到 0.76–1.00,且良性任务效用比值普遍保持在基座水平附近(Table 2)。
      2. 在 Qwen3.5-4B NF4 设置下,直接移植基线的精确调用保真度仅 0.31、过度调用率高达 70%,而 AGENTQ 将保真度维持在 0.73,过度调用率降至 22%(Table 5)。
      3. 在无触发词良性流量下,工具选择任务假正率在所有模型与码本下均为 0.00,参数注入假正率不超过 0.13;模型权重统计分布与干净基座匹配至 3–4 位有效数字(Table 10)。
      4. 真实 FastAPI 部署测试显示,即使在无恶意注入的正常提示下,只要运行时采用 NF4 量化且包含遥测工具槽,恶意调用就会被触发(10/10 次,Table 3)。
    • 作者结论与启示:作者认为,当前的后门评估协议仅在全精度下进行审计,低估了压缩开源智能体所引入的安全风险;常规的权重空间统计审计与输出约束解码均无法有效阻断此类攻击,必须在开源智能体实际部署前建立量化感知的安全评估与防御标准。
    完整解读
已经到底了