跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 3 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv:2610.05894 ·

    研究者提出闭环偏见注入攻击,可将 LLaDA-8B 的 BBQ 目标差距从 1.8 提升至 16.7 个百分点

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    测试
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct模型层
    场景
    模型与 API攻击者灰盒
    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
    • 研究定位:该论文揭示了扩散语言模型(dLLMs)去噪轨迹作为推理时控制通道的新型安全脆弱性。
    • 解决的问题:针对冻结扩散语言模型在推理服务栈可能遭受的灰盒操控风险,研究攻击者如何在不更改模型权重、提示词及采样器的情况下,操纵模型在歧义问题上输出指定受保护群体的偏见回答。
    • 核心方法设计:提出了闭环目标偏见注入方法,离线提取残差流中区分目标与对照选项的均值差单位向量,在线去噪过程中通过比例-积分(PI)控制器实时跟踪未提交答案的目标概率,动态调节注入残差流的引导强度。
    • 核心实验结果:
      1. 在 LLaDA-8B-Instruct 的 BBQ Black 目标上,Decode PI 将目标-对照组差距从未引导的 1.8 pp 提升至 16.7 pp(∆g = +14.9 pp),而固定强度开环仅达 4.6 pp(Table 1)。
      2. 在 SocialStigmaQA 上,Decode PI 将偏见选项选择率从 17.6% 提升至 58.1%(严格解析器下 ∆g = +83.8 pp,Table 2)。
      3. 跨目标测试中,LLaDA-8B 在 Arab 和 Old 目标上分别取得 22.3 pp 和 31.8 pp 的偏见差距(Table 3),但在 Asian、White、Latino 上因无效输出率过高(59.6%–96.1%)导致攻击失败。
      4. 跨模型测试中,在 Dream-7B 上 PI 取得 7.5 pp 差距(∆g = +4.2 pp),而在 LLaDA-MoE 上以 23.3 pp 落后于调优常数 CAA 的 25.6 pp(Table 3)。
    • 作者的结论与启示:作者认为模型的公平性不仅取决于权重本身,更是整个部署服务系统的属性;仅针对模型检查点的离线安全审计无法发现此类服务层激活操纵,未来的安全审计应直接针对已部署的推理端点。
    完整解读
  2. 攻击arXiv:2608.29458 ·

    Reference-Grafting 在提取沙袋行为隐藏能力上追平微调

    提出参考嫁接,在推理时用激活干预诱导出沙袋隐藏的能力

    测试
    Qwen2.5-1.5B、Qwen2.5-3B、Qwen2.5-14B 等 15 个模型层
    场景
    模型与 API攻击者白盒
    摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。
    • 定位与核心问题:本研究针对大语言模型在安全评测中故意隐藏能力的隐瞒(sandbagging)现象,提出了一种在推理阶段通过激活层编辑诱导隐藏能力的技术,重新审视了前人关于激活导向无法诱导隐藏能力的结论。
    • 方法设计机制:提出了参考嫁接(reference-grafting),利用贪心主动学习在重叠表征中定位少数关键回路,通过前向钩子将对比方向上的坐标设定为诚实参考值;展示了微调密码锁属于阈值门控机制,解释了传统加性导向与置零消融失效的原因。
    • 主实验诱导表现:在 11 款 1.5B–32B 的微调密码锁模型上,参考嫁接恢复了 +94% 至 +101% 的隐藏能力差距(Table 1),计算成本仅为前向传播级别且无需更新权重,效果匹配微调诱导,而噪声注入(+0% 至 +3%)和随机补丁(+0% 至 +1%)普遍失效。
    • 代码与强化学习扩展:在代码专精模型上恢复了 +92% 至 +105% 的差距(Table 2);在强化学习(GRPO)诱导的模型上恢复了 +95% 至 +101% 的差距;所提取的隐瞒轴可在不同数据集间迁移(如 ARC 拟合方向在 WMDP-bio 恢复 +102%),且仅需 2–5 对样本即可完成拟合,但跨诱导机制迁移失效(≈0%)。
    • 防御边界与作者启示:在表征重路由回路阻断模型上嫁接恢复率降为 -11%,作者认为这标志着静态可逆锁与动态防御的界限;作者得出结论,激活导向在选对操作与回路时能够诱导隐藏能力,未来关键在于在未知真实场景中获取诚实参考,以及应对动态表征重路由防御。
    完整解读
  3. 攻击arXiv:2609.14060 ·

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    提出AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门

    测试
    Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个训练与数据层
    场景
    AI Agent
    摘要论文研究了智能体量化条件后门风险,提出AGENTQ在保持效用的同时实现全精度隐蔽与量化后生效。
    • 研究定位:本研究针对开源大语言模型智能体在低比特量化部署中的安全风险,分析并实现了量化条件后门攻击(QCA)。
    • 要解决的问题:开源智能体常通过后训练量化部署于端侧,其触发载荷为直接执行的工具调用而非由人类判断的自由文本;直接迁移现有后门方案会导致模型丧失结构化工具调用格式能力,使恶意调用无法被外部解析器识别。
    • 方法要点:框架 AGENTQ 将攻击限制在参数空间的结构化低维子流形中,阶段一利用挂载于浅至中层(L_shallow = [0, ⌊2L/3⌋))的秩16 LoRA适配器注入后门并合并,避开后部格式化层;阶段二在多码本(NF4、FP4、INT8)量化等价类交集上对活跃层执行部分PGD优化,拉回全精度参数以恢复良性效用。
    • 关键实验结果:
      1. 在 Qwen3.5(2B、4B、9B)与 Hammer2.1(1.5B、3B、7B)六个模型上,全精度 Base ASR 均为 0(通过安全审计),量化后 ASRq 达到 0.76–1.00,且良性任务效用比值普遍保持在基座水平附近(Table 2)。
      2. 在 Qwen3.5-4B NF4 设置下,直接移植基线的精确调用保真度仅 0.31、过度调用率高达 70%,而 AGENTQ 将保真度维持在 0.73,过度调用率降至 22%(Table 5)。
      3. 在无触发词良性流量下,工具选择任务假正率在所有模型与码本下均为 0.00,参数注入假正率不超过 0.13;模型权重统计分布与干净基座匹配至 3–4 位有效数字(Table 10)。
      4. 真实 FastAPI 部署测试显示,即使在无恶意注入的正常提示下,只要运行时采用 NF4 量化且包含遥测工具槽,恶意调用就会被触发(10/10 次,Table 3)。
    • 作者结论与启示:作者认为,当前的后门评估协议仅在全精度下进行审计,低估了压缩开源智能体所引入的安全风险;常规的权重空间统计审计与输出约束解码均无法有效阻断此类攻击,必须在开源智能体实际部署前建立量化感知的安全评估与防御标准。
    完整解读
已经到底了