跳到正文
10月8日 · 周四

开源模型安全 · 论文

精选论文 15 篇
  1. 攻击arXiv:2610.05089 · 54

    研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines

    作者针对LiteLLM等网关提出利用共享冷却记录的跨租户干扰攻击,并设计租户隔离机制消除残留排除。

    • 54/60 降至 0/60LiteLLM四worker恢复后受害者回退次数(5次配对运行总计,Table 2)
    • 8/8 改变为 A本地拒绝攻击导致5票表决中决策受影响比例(Table 7)
    • 20/20冷却排除期间直接探测成功而网关拒绝的试验比例(95% Wilson CI [84, 100]%,§6.2)
    6 问速览LLM网关共享部署冷却记录引入了跨租户干扰攻击面。
    1. 这篇论文试图解决什么问题?

      LLM网关共享部署冷却记录引入了跨租户干扰攻击面。

    2. 有哪些相关研究?

      涵盖云租户隔离、LLM路由攻击、缓存DoS及网关容错。

    3. 论文如何解决这个问题?

      设计来源检查阻断本地更新,并将429冷却按租户隔离。

    4. 论文做了哪些实验?

      租户隔离将恢复后受害者回退从54/60降至0/60。

    5. 有什么可以进一步探索的点?

      作者指出未测部署ID发现成本及生产特性,部分恢复差异未解。

    6. 总结一下论文的主要内容

      揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。

    完整解读
  2. 攻击arXiv:2610.05894 · 53

    研究者提出闭环偏见注入攻击,可将 LLaDA-8B 的 BBQ 目标差距从 1.8 提升至 16.7 个百分点

    作者利用去噪反馈动态引导扩散模型残差流,在 LLaDA-8B 的 BBQ Black 目标上将偏见差距提升 14.9 个百分点。

    • 16.7 ppLLaDA-8B 在 BBQ Black 目标下的 Decode PI 偏见差距(Table 1)
    • +14.9 ppLLaDA-8B 在 BBQ Black 目标下的 Decode PI 差距变化量(Table 1)
    • 58.1%LLaDA-8B 在 SocialStigmaQA 下 Decode PI 的偏见选项选择率(Table 2)
    6 问速览利用扩散模型多步去噪中暴露的中间概率,通过灰盒服务栈钩子动态注入人口统计学偏见。
    1. 这篇论文试图解决什么问题?

      利用扩散模型多步去噪中暴露的中间概率,通过灰盒服务栈钩子动态注入人口统计学偏见。

    2. 有哪些相关研究?

      现有激活引导多为自回归开环控制,本文将去噪轨迹作为反馈通道引入闭环控制。

    3. 论文如何解决这个问题?

      离线提取残差均值差方向,在线通过 PI 控制器根据逐步预测的目标答案概率动态调节引导强度。

    4. 论文做了哪些实验?

      在 LLaDA-8B 上将 BBQ 偏见差距提升最高 37.2 个百分点,但在 LLaDA-MoE 上落后于固定强度基线。

    5. 有什么可以进一步探索的点?

      作者指出超参数选取、多选题格式及线性假设等局限;实验覆盖 3 个开源扩散模型,未测试自由文本生成。

    6. 总结一下论文的主要内容

      通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    完整解读
  3. 攻击arXiv:2510.11570 · 56

    研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏

    作者提出四种阶段转换攻击;gpt-oss-120b在AdvBench上FoR成功率为96.25%(Table 1)。

    • 98.00%SafeChain上Reasoning Hijack ASR(Table 5)
    • 74.87%gpt-oss-20b在CatQA的CO方法ASR(Table 2)
    • 96.25%gpt-oss-120b的AdvBench上FoR ASR(Table 1)
    6 问速览论文研究大推理模型显式安全护栏的脆弱性,探究阶段转换逻辑能否被绕过或操纵以产生有害输出。
    1. 这篇论文试图解决什么问题?

      论文研究大推理模型显式安全护栏的脆弱性,探究阶段转换逻辑能否被绕过或操纵以产生有害输出。

    2. 有哪些相关研究?

      相关工作涵盖推理安全护栏构建与针对性红队攻击,作者称本文建立了对齐推理各阶段的系统红队框架。

    3. 论文如何解决这个问题?

      作者针对推理模型流水线提出EST、CO、FoR与RH四种攻击,分别实现跳过推理、无模板后缀引导、语义伪装与控制推理。

    4. 论文做了哪些实验?

      本地gpt-oss两款模型上,RH在五个基准的ASR均超90%;其余方法与API设置需分别看表。

    5. 有什么可以进一步探索的点?

      后续方向包括模型内部来源感知对齐、推理链验证和安全锚定调整;评测范围与判官一致性仍需区分。

    6. 总结一下论文的主要内容

      论文系统分析大推理模型阶段转换脆弱性,提出四种红队方法并在多种模型上取得高攻击成功率,呼吁强化基础对齐。

    完整解读
  4. 攻击arXiv:2608.29458 · 55

    Reference-Grafting 在提取沙袋行为隐藏能力上追平微调

    研究者提出参考嫁接技术,在11款微调密码锁模型上恢复了+94%至+101%的隐藏能力差距,在推理阶段匹配微调诱导效果。

    • +94% 至 +101%11款微调密码锁模型ARC-Easy隐藏能力恢复率(Table 1)
    • +92% 至 +105%3款代码模型MBPP密码锁恢复率,流畅度降幅≤0.04(Table 2)
    • +95% 至 +101%3个模型家族GRPO强化学习诱导隐瞒恢复率(Section 4.4)
    6 问速览解决模型在评测中故意隐瞒能力的问题,推翻激活导向失效结论并在推理阶段诱导能力。
    1. 这篇论文试图解决什么问题?

      解决模型在评测中故意隐瞒能力的问题,推翻激活导向失效结论并在推理阶段诱导能力。

    2. 有哪些相关研究?

      梳理隐瞒能力基准、模型篡改攻击、概念编辑与主动学习,定位本文在激活层诱导的贡献。

    3. 论文如何解决这个问题?

      提出参考嫁接与主动学习回路选择,利用阈值门控机制将对比坐标设定为诚实参考值。

    4. 论文做了哪些实验?

      在11款模型上实现+94%至+101%能力恢复,完成代码、强化学习、任务迁移与回路阻断实验。

    5. 有什么可以进一步探索的点?

      静态锁假设在动态回路阻断下失效,真实场景诚实参考获取困难,任务评测主要集中在多选问答。

    6. 总结一下论文的主要内容

      提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。

    完整解读
  5. 攻击arXiv:2609.14060 · 55

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    针对开源LLM智能体提出AGENTQ,结合分层低秩注入与部分PGD,在两家族六模型上量化ASR达0.76–1.00。

    • 0AGENTQ在全精度FP16下六个模型全部任务Base ASR(Table 2)
    • 1.00Qwen3.5-4B在xLAM参数注入任务下NF4量化ASR(Table 2)
    • 0.76Qwen3.5-2B在AgentDojo任务NF4量化ASR(Table 2)
    6 问速览量化条件攻击移植到智能体会破坏工具调用输出,论文研究如何在保持良性效用的同时实现量化触发后门。
    1. 这篇论文试图解决什么问题?

      量化条件攻击移植到智能体会破坏工具调用输出,论文研究如何在保持良性效用的同时实现量化触发后门。

    2. 有哪些相关研究?

      论文梳理了量化条件攻击、智能体后门攻击与基于LoRA的后门攻击三类研究,并以直接移植QCA作为主要基线。

    3. 论文如何解决这个问题?

      AGENTQ结合浅中层LoRA后门注入与多码本量化等价类上的部分PGD修复,使模型仅在量化后触发恶意工具调用。

    4. 论文做了哪些实验?

      在六个模型与三类任务上,AGENTQ的全精度Base ASR均为0,量化后ASR达0.76–1.00且保持良性效用。

    5. 有什么可以进一步探索的点?

      作者指出了码本覆盖、模型规模、缺乏防御方案等局限,后续可在感知Hessian的等价类与大模型扩展上探索。

    6. 总结一下论文的主要内容

      论文研究了智能体量化条件后门风险,提出AGENTQ在保持效用的同时实现全精度隐蔽与量化后生效。

    完整解读
已经到底了