跳到正文
10月8日 · 周四

供应链安全 · 论文

精选论文 21 篇
  1. 攻击arXiv:2610.09819 · 57

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    作者提出 FAB 攻击,在无预训练数据假设下向声学基础模型植入后门,使 HuBERT 在物理警报声下 ASR 词错误率达 80.71%(Table 2)。

    • 98.4%HuBERT 在 SUPERB ASR 任务上加警报声触发时的 WER(Table 6)
    • 11.4%HuBERT 后门模型在 SUPERB ASR 任务良性输入下的 WER(Table 6)
    • 80.71%HuBERT 在单扬声器物理录音警报声触发下的 ASR WER(Table 2)
    6 问速览在无预训练数据且未知下游任务的弱威胁模型下,如何向声学基础模型注入可物理触发的通用后门。
    1. 这篇论文试图解决什么问题?

      在无预训练数据且未知下游任务的弱威胁模型下,如何向声学基础模型注入可物理触发的通用后门。

    2. 有哪些相关研究?

      论文梳理了传统模型、基础模型及语音领域的后门研究,并对比了 NLP 的 POR 迁移后门基线。

    3. 论文如何解决这个问题?

      FAB 通过重构伪标签维持良性掩码预测损失,并用余弦距离将中间层特征映射至全 1 向量以破坏触发输入表征。

    4. 论文做了哪些实验?

      论文在 HuBERT 和 WavLM 上评测了 9 项任务、物理场景及防御,触发器导致多任务性能出现明显下降。

    5. 有什么可以进一步探索的点?

      作者指出过度微调防御开销大且适用受限,对 POR 的理论分析留待未来;实验未覆盖大尺寸模型及多语言。

    6. 总结一下论文的主要内容

      论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    完整解读
  2. 攻击arXiv:2610.07645 · 54

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    作者提出 SkillPoison,利用局部有效的成功经验诱导技能过度泛化,在 Trace2Skill 的 PAWS 上实现 95.71% ASR。

    • 95.71%deepseek-v4-flash 在 PAWS (Trace2Skill) 上的 ASR (Table 1)
    • 73.68%deepseek-v4-flash 在 HANS (AutoSkill) 上的 ASR (Table 1)
    • 36.64%deepseek-v4-flash 在 DS1000 (Trace2Skill) 上的 ASR (Table 1)
    6 问速览现有基于形成的技能攻击易被拦截且难固化,论文提出利用局部有效且验证成功的经验诱导持久技能过度泛化。
    1. 这篇论文试图解决什么问题?

      现有基于形成的技能攻击易被拦截且难固化,论文提出利用局部有效且验证成功的经验诱导持久技能过度泛化。

    2. 有哪些相关研究?

      论文梳理了技能自演化、技能工件供应链攻击与经验驱动投毒三类工作,指出本文聚焦于通过验证成功经验诱导原生技能过度泛化。

    3. 论文如何解决这个问题?

      SkillPoison 通过分层筛选有效任务、构建局部成功归因证据并跨类别归纳强化,诱导原生流水线提取过度泛化技能。

    4. 论文做了哪些实验?

      实验在 2 个技能框架、3 个基准和 3 种模型上对比了 7 种基线,SkillPoison 在多数设置下取得最高 ASR 并降低了任务准确率。

    5. 有什么可以进一步探索的点?

      论文未专门讨论局限与未来方向,实验覆盖了 2 种技能框架、3 个评测基准和 3 种语言模型。

    6. 总结一下论文的主要内容

      SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    完整解读
  3. 攻击arXiv:2610.07510 · 55

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    在Qwen2.5-Coder-7B上,PERSISTBD通过联合优化后门强度与良性梯度兼容性,将SFT-RL后的ASR从20%提升至76%。

    • 74%Qwen2.5-Coder-7B, 随机位置, SFT后ASR, PERSISTBD (Table 2)
    • 76%Qwen2.5-Coder-7B, 随机位置, SFT-RL后ASR, PERSISTBD (Table 2)
    • 20%Qwen2.5-Coder-7B, 随机位置, SFT后ASR, Base backdoor (Table 2)
    6 问速览探讨智能体后门能否在良性SFT与RL中存活,并提出主动增强后门持久性的方法。
    1. 这篇论文试图解决什么问题?

      探讨智能体后门能否在良性SFT与RL中存活,并提出主动增强后门持久性的方法。

    2. 有哪些相关研究?

      梳理了NLP与智能体后门、微调/RL后门防御及主动持久化研究P-Trojan。

    3. 论文如何解决这个问题?

      基于一阶分析将后门存活归因于强度与梯度兼容性,提出免求二阶导的PERSISTBD。

    4. 论文做了哪些实验?

      在3B/7B/30B上证实SFT侵蚀后门而RL维持残余;PERSISTBD大幅提升存活率。

    5. 有什么可以进一步探索的点?

      作者指出了任务领域单一、一阶近似局限与RL反弹机理未解,实验覆盖3个模型。

    6. 总结一下论文的主要内容

      总结了论文关于后门在SFT/RL中存活的发现、两因子机制、PERSISTBD方法与核心数字。

    完整解读
  4. 攻击arXiv:2610.05089 · 54

    研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines

    作者针对LiteLLM等网关提出利用共享冷却记录的跨租户干扰攻击,并设计租户隔离机制消除残留排除。

    • 54/60 降至 0/60LiteLLM四worker恢复后受害者回退次数(5次配对运行总计,Table 2)
    • 8/8 改变为 A本地拒绝攻击导致5票表决中决策受影响比例(Table 7)
    • 20/20冷却排除期间直接探测成功而网关拒绝的试验比例(95% Wilson CI [84, 100]%,§6.2)
    6 问速览LLM网关共享部署冷却记录引入了跨租户干扰攻击面。
    1. 这篇论文试图解决什么问题?

      LLM网关共享部署冷却记录引入了跨租户干扰攻击面。

    2. 有哪些相关研究?

      涵盖云租户隔离、LLM路由攻击、缓存DoS及网关容错。

    3. 论文如何解决这个问题?

      设计来源检查阻断本地更新,并将429冷却按租户隔离。

    4. 论文做了哪些实验?

      租户隔离将恢复后受害者回退从54/60降至0/60。

    5. 有什么可以进一步探索的点?

      作者指出未测部署ID发现成本及生产特性,部分恢复差异未解。

    6. 总结一下论文的主要内容

      揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。

    完整解读
  5. 攻击arXiv:2609.39065 · 59

    TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞

    TrustProbe 测试 11 个开源智能体发现 104 个 skill 污点漏洞,在最严审批下仍有 34.8% 可被利用。

    • 10411 个开源智能体中经 TrustProbe 验证的污点型漏洞总数(Table 1)
    • 100%11 个智能体上污点确认路径产生可观测有害后果的 ASR(第 5.2 节)
    • 31.7%直接提示词重放 104 个已验证漏洞时的总复现率(Table 2)
    6 问速览论文研究基于 skill 的智能体中,不可信第三方 skill 内容如何在用户委托权限下引发非预期敏感操作的信任链失效问题。
    1. 这篇论文试图解决什么问题?

      论文研究基于 skill 的智能体中,不可信第三方 skill 内容如何在用户委托权限下引发非预期敏感操作的信任链失效问题。

    2. 有哪些相关研究?

      论文梳理了智能体攻击、静态分析与动态模糊测试三类研究,作者称此前工作缺乏跨框架 skill 交付与审批机制的动态验证。

    3. 论文如何解决这个问题?

      TrustProbe 通过源码静态调用路径分析生成种子,结合语义与距离反馈的定向灰盒模糊测试演化输入,由双重 oracle 验证漏洞。

    4. 论文做了哪些实验?

      在 11 个开源智能体上测得 104 个已验证漏洞(ASR 达 100%),直接提示词仅复现 31.7%,最严审批下残留 34.8% 可利用漏洞。

    5. 有什么可以进一步探索的点?

      作者指出了来源追踪、安装期能力声明和共享执行点控制等方向,评测受限于所选模型与系统范围。

    6. 总结一下论文的主要内容

      论文研究 skill 智能体的非安全信任链问题,提出 TrustProbe 工具并在 11 个开源智能体上验证了 104 个污点漏洞。

    完整解读
  6. 攻击arXiv:2609.39607 · 59

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    作者提出白盒攻击 PRETEXT,在固定检测器下对 qwen3t 取得 96.7% 的 ASR(Table D.1)。

    • 96.7 ± 4.6%qwen3t 栈,Mode A 固定检测器,终代 ASR(Table D.1)
    • 63.2 ± 7.1%glm 栈,Mode A 固定检测器,终代 ASR(Table D.1)
    • 62 ± 14%gpt-oss 栈,Mode B 盲测,检测器终代误报率 FP(Table D.2)
    6 问速览现有静态结合大模型的技能安全检测框架在面对知晓规则的白盒攻击者时易被绕过。
    1. 这篇论文试图解决什么问题?

      现有静态结合大模型的技能安全检测框架在面对知晓规则的白盒攻击者时易被绕过。

    2. 有哪些相关研究?

      相关研究涵盖恶意技能构建、静态分析及大模型审查,本文探讨跨世代自适应攻防。

    3. 论文如何解决这个问题?

      通过自然语言载荷拆分、双层反思记忆及良性孪生对齐实现对检测器的迭代规避。

    4. 论文做了哪些实验?

      在固定与协同进化检测器下评估 3 个模型栈,固定检测器下最高达 96.7% ASR。

    5. 有什么可以进一步探索的点?

      作者指出商业扫描器迁移性待验证,实验覆盖单一检测框架与 3 个开源模型栈。

    6. 总结一下论文的主要内容

      论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    完整解读
  7. 攻击arXiv:2609.26761 · 59

    A2M:针对 MCP 生态的两阶段 Agent 劫持框架

    作者提出两阶段黑盒劫持框架 A2M,在 GLM-4.6 优化后迁移至 4 个黑盒模型,平均恶意工具调用率为 63.6%。

    • 63.6%以GLM-4.6为代理模型,迁移至4个目标模型的四场景平均MTIR(Table 1)
    • 24.5%以GLM-4.6为代理模型,迁移至4个目标模型在IE、EIC、RD上的平均ASR(Table 1)
    • 2.7×以GLM-4.6为代理模型,迁移至4个目标模型的C-DoS平均加权成本倍数(Table 1)
    6 问速览论文研究 MCP 智能体在第三方工具生态中的语义供应链风险,解决如何使恶意工具既能被智能体选中又能有效劫持其后续执行的问题。
    1. 这篇论文试图解决什么问题?

      论文研究 MCP 智能体在第三方工具生态中的语义供应链风险,解决如何使恶意工具既能被智能体选中又能有效劫持其后续执行的问题。

    2. 有哪些相关研究?

      相关研究包括工具增强智能体、大模型对抗攻击、智能体提示注入及工具选择偏置,作者指出既有工具攻击未联合优化元数据与返回载荷。

    3. 论文如何解决这个问题?

      A2M 将攻击解耦为元数据优化与载荷精炼两阶段,结合五种说服策略与分析器-优化器架构,利用执行轨迹反馈进行黑盒迭代。

    4. 论文做了哪些实验?

      实验在 LiveMCPBench 上测试了五种模型,A2M 在直接攻击与迁移场景下均取得较高调用率,但跨模型完整攻击成功率出现下降。

    5. 有什么可以进一步探索的点?

      作者指出研究局限在语义层攻击假设、依赖执行轨迹及固定智能体框架,实验覆盖了五种模型、四个场景与多种防御。

    6. 总结一下论文的主要内容

      A2M 揭示了 MCP 智能体语义供应链风险,通过两阶段优化实现高调用率与推理劫持,且工具调用迁移性强于攻击成功率。

    完整解读
  8. 攻击arXiv:2610.01564 · 58

    APEX 用跨技能链劫持 LLM Agent,GPT-5.4 上攻击成功率达 84.3%

    APEX通过在跨技能进度记录中夹带虚假授权,在6个模型上诱导目标动作的平均ASR达74.2%(Table 2)。

    • 74.2%6个模型在SkillsBench的4个定向动作家族上完整链平均ASR(Table 2)
    • 84.3%GPT-5.4在4个定向动作家族上的完整技能链平均ASR(Table 2)
    • 17.4%GPT-5.4在4个定向动作家族上的单技能整合工作流平均ASR(Table 3)
    6 问速览研究智能体跨技能协作时利用真实进度记录传递虚假授权的攻击机制。
    1. 这篇论文试图解决什么问题?

      研究智能体跨技能协作时利用真实进度记录传递虚假授权的攻击机制。

    2. 有哪些相关研究?

      涵盖间接提示注入、单技能攻击与组合技能攻击,并以SkillsBench为基准。

    3. 论文如何解决这个问题?

      APEX通过伪造任务交接记录触发下游动作,并依据沙箱反馈迭代修订技能链。

    4. 论文做了哪些实验?

      涵盖6个模型及5类家族,完整链ASR达74.2%,评估了结构消融与提示防御。

    5. 有什么可以进一步探索的点?

      作者指出结果汇总、任务重叠与未测自适应攻击等局限;实验覆盖6个模型与单项防御。

    6. 总结一下论文的主要内容

      APEX通过跨技能传递虚假授权实现74.2%的动作诱导率,揭示了多技能协同的安全风险。

    完整解读
  9. 攻击arXiv:2609.35576 · 56

    研究提出跨 LLM 助手的记忆跳跃攻击,单个被投毒文件可传播至 60–100% 的助手

    作者评估了跨独立智能体的工件介导自传播攻击,在36个测试宇宙中使DeepSeek-V4-Pro达到98%目标感染率。

    • 98%DeepSeek-V4-Pro 在36个测试宇宙中的 FIF_a^goal(据 Table 1)
    • 38%GPT-5.6 Luna 在36个测试宇宙中的 FIF_a^goal(据 Table 1)
    • 0.98DeepSeek-V4-Pro 在测试宇宙中拟合的每跳延续概率 p_hat(据 Figure 2)
    6 问速览工件介导攻击利用跨会话持久内存与共享文件,在隔离的智能体间实现无需直接通信的自传播。
    1. 这篇论文试图解决什么问题?

      工件介导攻击利用跨会话持久内存与共享文件,在隔离的智能体间实现无需直接通信的自传播。

    2. 有哪些相关研究?

      相关研究涵盖间接注入、内存投毒及智能体蠕虫,本文聚焦常规文件流转与目标无关通用模板。

    3. 论文如何解决这个问题?

      通过红队搜索构建与目标无关的通用模板,结合外部端点规范化载荷,驱动工件与内存交替传播。

    4. 论文做了哪些实验?

      端点辅助攻击在多模型上实现 38%–98% 感染率并延伸至 8 跳,无端点变体亦可维持有限传播。

    5. 有什么可以进一步探索的点?

      作者指出研究受限于端点依赖、无端点模板探索有限、前沿模型搜索成本及合成网络结构。

    6. 总结一下论文的主要内容

      论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。

    完整解读
  10. 攻击arXiv:2608.29381 · 58

    研究者提出 Agent 检查点回滚的五类安全失效,并在 Hermes、Cline、LangGraph 上实现三种攻击

    作者评估5款智能体C/R机制,指出回滚会破坏执行连续性;在TerminalBench与AgentBench上SF1和SF4占比为67.2%与67.7%。

    • 67.2%DeepSeek-v4在两基准共1735次执行中SF1出现率(据Table II)
    • 67.7%DeepSeek-v4在两基准共1735次执行中SF4出现率(据Table II)
    • 2.3%DeepSeek-v4在两基准共1735次执行中SF5出现率(据Table II)
    6 问速览检查点与回滚恢复虽能还原记录状态,但会打破跨边界依赖从而破坏执行连续性,引发安全风险。
    1. 这篇论文试图解决什么问题?

      检查点与回滚恢复虽能还原记录状态,但会打破跨边界依赖从而破坏执行连续性,引发安全风险。

    2. 有哪些相关研究?

      相关研究涵盖传统分布式检查点与防回滚、智能体恢复系统、恢复语义与回滚攻击,以及智能体安全评测。

    3. 论文如何解决这个问题?

      作者构建了多进程执行模型与五类故障模式,并开发由收集、分析、检查与验证组成的多智能体检测管线。

    4. 论文做了哪些实验?

      在1735次基准执行中SF1与SF4发生率近68%,微基准显示改变提交顺序的失败率均超过93%。

    5. 有什么可以进一步探索的点?

      作者指出该研究聚焦于C/R引入的安全违规而非涵盖所有智能体威胁,且测试旨在暴露风险而非认证系统安全。

    6. 总结一下论文的主要内容

      论文系统研究了智能体C/R的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。

    完整解读
  11. 攻击arXiv:2607.12340 · 58

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    论文测试了12种LLM与智能体在1.5万个提示词下的技能推荐,发现虚构技能名发生率达6.5%–62.0%,且易被抢注劫持。

    • 36.0%4种独立LLM在15,000提示词下的平均虚构率(据Table 2)
    • 36.9%8种智能体在15,000提示词下的平均虚构率(据Table 2)
    • 43.1%12种配置在社区开发者真实提问下的平均虚构率(据正文第1节)
    6 问速览智能体推荐技能时常虚构不存在的名称,使攻击者可预先抢注并植入恶意载荷实施供应链攻击。
    1. 这篇论文试图解决什么问题?

      智能体推荐技能时常虚构不存在的名称,使攻击者可预先抢注并植入恶意载荷实施供应链攻击。

    2. 有哪些相关研究?

      已有研究关注代码包虚构与运行时提示注入,本研究聚焦智能体推荐阶段虚构技能名引发的预先抢注威胁。

    3. 论文如何解决这个问题?

      通过双重真实性校验管道度量 1.5 万提示词下的虚构率,并基于 RAG 与多模型投票设计防御方案。

    4. 论文做了哪些实验?

      评测覆盖12种配置与1.5万提示词,揭示高虚构率与高重现性,证明常规自检与拼写过滤失效,RAG虽降虚构但损害召回。

    5. 有什么可以进一步探索的点?

      作者指出未实测真实用户安装率且召回率评估未覆盖全模型;实验涵盖12种配置与4类防御,未测真实恶意载荷。

    6. 总结一下论文的主要内容

      研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    完整解读
  12. 攻击arXiv:2609.01222 · 57

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    作者分析了 12 个真实智能体 Harness 的上下文组装设计,提出 16 种攻击向量实现消息角色和跨作用域的特权提升。

    • 28212 个智能体 Harness 中经 CORA 运行时验证的上下文源总数(Table VI)
    • 176112 个智能体 Harness 中由 CORA 枚举的唯一候选 CPE 路径总数(§ VI-C)
    • 1034 (58%)GPT-5.5 在 12 个智能体共 1761 条候选路径上的行为验证结果(Table VII)
    6 问速览智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。
    1. 这篇论文试图解决什么问题?

      智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。

    2. 有哪些相关研究?

      相关研究聚焦于间接提示注入、指令层级防御和智能体扩展规范,本文聚焦智能体 Harness 上下文组装的结构性缺陷。

    3. 论文如何解决这个问题?

      形式化定义 M-CPE 与 X-CPE 两类攻击及 16 种攻击向量,开发静态分析与两轮插桩验证工具 CORA。

    4. 论文做了哪些实验?

      在 12 个智能体上验证了 282 个上下文源与 1761 条路径,在 GPT-5.5 下行为验证率达 58% 并完成端到端 PoC。

    5. 有什么可以进一步探索的点?

      作者指出了 CORA 环境构建失败、模型安全对齐导致未遵循指令等局限,并倡议厂商发布上下文清单(SBOM)。

    6. 总结一下论文的主要内容

      论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    完整解读
  13. 攻击arXiv:2608.23858 · 56

    研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁

    作者系统分析Google智能体支付协议AP2 v0.2,指出合法签名无法防御前置上下文操纵,并识别出8个高风险威胁。

    • 66.7%STRIDE-GPT五架构运行对48个威胁的Full/Partial覆盖率(8.1节)
    • 0.9848位独立专家对25个威胁AIVSS严重度评级的Gwet's AC2估计值(Table 6)
    • 92.5%8位专家在120次评估中重现单评估者AIVSS参考严重度等级的比例(8.2节)
    6 问速览分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。
    1. 这篇论文试图解决什么问题?

      分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。

    2. 有哪些相关研究?

      梳理了AP2初期安全性、多智能体商业协议及支撑协议(MCP与A2A)的安全研究现状。

    3. 论文如何解决这个问题?

      划分生命周期与架构,用MAESTRO和AIVSS系统化建模48个威胁并设计三层扫描器。

    4. 论文做了哪些实验?

      通过8名专家重现AIVSS评分、对比STRIDE-GPT,并在自建测试床上完成5项PoC验证与扫描器消融。

    5. 有什么可以进一步探索的点?

      作者指出评估基于自建测试床且未测底层清算系统,后续需在真实公开部署中检验扫描器。

    6. 总结一下论文的主要内容

      系统剖析AP2协议盲区,建立威胁模型并识别8项高危威胁,通过PoC与扫描器推动前置安全防御。

    完整解读
  14. 攻击arXiv:2609.02774 · 56

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    研究者提出CodePoisonRAG对RACG投毒,在Code Llama上取得0.93的无防御ASR。

    • 0.93Code Llama 13B 无防御下的总体 ASR(Table II)
    • 0.71Code Llama 13B 在 CodeGuarder 防御下的 ASR(Table II)
    • 85/85无防御下 85 个投毒工件进入 Top-3 的检索成功数(Table II)
    6 问速览探索黑盒攻击者能否针对预期任务构造单一投毒代码工件,在不访问 RACG 管线的前提下定向诱导生成指定漏洞。
    1. 这篇论文试图解决什么问题?

      探索黑盒攻击者能否针对预期任务构造单一投毒代码工件,在不访问 RACG 管线的前提下定向诱导生成指定漏洞。

    2. 有哪些相关研究?

      相关研究包括 RAG 投毒、RACG 攻击与安全代码生成防御;本文聚焦于黑盒针对性弱点注入与单一工件投毒。

    3. 论文如何解决这个问题?

      通过良性代码与 CWE 匹配、污点链漏洞注入以及注释级虚假安全声明,构造兼具检索相关性与漏洞诱导性的单一工件。

    4. 论文做了哪些实验?

      在 3 个开源生成模型上评测 10 类 CWE,无防御下 ASR 达 0.80–0.93,在 CodeGuarder 防御下仍达 0.40–0.71。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向;实验覆盖了 3 个开源生成模型、10 类 CWE 及 CodeGuarder 防御。

    6. 总结一下论文的主要内容

      CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    完整解读
  15. 攻击arXiv:2609.03884 · 59

    HookPry:利用插件生命周期钩子更新劫持 AI Agent 框架

    HOOKPRY利用插件生命周期钩子更新机制对7个智能体框架实施供应链攻击,在1000次运行中微平均E2E-ASR达77.0%。

    • 77.0%1000次跨框架与后端运行微平均E2E-ASR(Table 2)
    • 92.5%Hermes框架跨后端平均E2E-ASR(Table 2)
    • 52.5%Claude Code跨后端平均E2E-ASR(Table 2)
    6 问速览智能体框架信任插件钩子更新,使攻击者可通过版本更新在模型推理流外静默执行恶意命令。
    1. 这篇论文试图解决什么问题?

      智能体框架信任插件钩子更新,使攻击者可通过版本更新在模型推理流外静默执行恶意命令。

    2. 有哪些相关研究?

      现有工作主要关注提示注入、工具描述投毒与恶意代码,未系统研究框架层生命周期钩子的信任迁移。

    3. 论文如何解决这个问题?

      HOOKPRY 通过对抗清单优化提升检索、时间解耦定位弱验证边界、最小公共接口跨框架编译原生钩子配置。

    4. 论文做了哪些实验?

      1000次跨环境测试微平均E2E-ASR达77.0%,原生钩子攻击效果显著优于MCP投毒,静态防御漏报47.5%。

    5. 有什么可以进一步探索的点?

      作者指出安装采纳率未测及环境未穷尽等局限,未来可探索动态分析、最小特权钩子与更新授权机制。

    6. 总结一下论文的主要内容

      论文揭示了智能体框架钩子更新的供应链攻击面,提出了 HOOKPRY 框架并在测试中取得 77.0% 的成功率。

    完整解读
  16. 攻击arXiv:2608.06862 · 57

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    SYNCHAIN 诱导 CUA 自合成工件,在三框架无防御 Chain-1 达 97.78%–98.89% ASR。

    • 98.89%OpenClaw 无防御 Chain-1 ASR(Ours Avg.,Table 1)
    • 87.78%OpenClaw 在 GuardAgent 下 Chain-1 ASR(Ours Avg.,Table 1)
    • 72.59%三框架四防御 Chain-2 平均 ASR(SYNCHAIN,4.2 节)
    6 问速览CUA 自合成的持久化工件可成为内部供应链恶意载体,现有防御无法防护跨任务传播。
    1. 这篇论文试图解决什么问题?

      CUA 自合成的持久化工件可成为内部供应链恶意载体,现有防御无法防护跨任务传播。

    2. 有哪些相关研究?

      现有研究聚焦技能增强、外部提示注入与单步后门,缺少对智能体自合成持久化内部供应链风险的研究。

    3. 论文如何解决这个问题?

      通过面向持久化的定向 SFT 诱导模型自合成带潜伏载荷的工件,利用扩展状态递归更新跨步激活。

    4. 论文做了哪些实验?

      在三款智能体和四种防御下测定,Chain-1 ASR 超 90%,Chain-2 仍有效,但更长链受信息瓶颈限制衰减。

    5. 有什么可以进一步探索的点?

      作者指出攻击传播深度受限且缺少体系化来源防御;评测覆盖有限规模的链式任务与特定攻击目标。

    6. 总结一下论文的主要内容

      论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    完整解读
  17. 攻击arXiv:2609.01023 · 57

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    作者对推理代码模型发起后门攻击AKRASIA,在CodeMMLU对Gemini-3.5取得99.34%平均ASR。

    • 99.34%Gemini-3.5在CodeMMLU上的平均ASR(Table 5)
    • 90.4%Gemini-3.5在LiveCodeBench的ASR(Table 4)
    • 84.36%Claude-Sonnet-5在CruxEval的平均ASR(Table 5)
    6 问速览论文探讨推理代码大模型在推断期面临的代码级后门脆弱性,旨在实现兼具高攻击成功率与隐蔽性的后门攻击。
    1. 这篇论文试图解决什么问题?

      论文探讨推理代码大模型在推断期面临的代码级后门脆弱性,旨在实现兼具高攻击成功率与隐蔽性的后门攻击。

    2. 有哪些相关研究?

      论文梳理了基于推理的推断期后门、代码模型后门及黑盒防御三类研究,将自身定位于首个隐匿代码触发器与推理的攻击。

    3. 论文如何解决这个问题?

      AKRASIA通过探查受害模型生成代码触发器,构建正负ICL示例与伪装提示词,依托模型不忠实性隐匿攻击意图。

    4. 论文做了哪些实验?

      实验覆盖6个模型与3个基准,显示AKRASIA在多任务与多类防御下保持高攻击成功率与效用,并逃逸人工检测。

    5. 有什么可以进一步探索的点?

      作者指出了提示词ICL数量未扰动、模型推理随机性及缺乏专有防御等局限,未来计划探索有效防御手段。

    6. 总结一下论文的主要内容

      论文针对推理代码大模型提出了隐蔽推断期后门攻击AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。

    完整解读
  18. 攻击arXiv:2609.07051 · 55

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    作者对世界模型提出后门 TrojanWorld,在 R2-Dreamer DMC 上达成 0.026 动作偏差且移除触发器后持续控制。

    • 0.026R2-Dreamer 在 DMC 上的 Win-E(Table 1)
    • 0.014R2-Dreamer 在 MyoSuite 上的 Post-E(Table 1)
    • 98.8%所有测试中保留干净性能的最低比例(正文 5.2)
    6 问速览TrojanWorld 试图解决世界模型智能体在供应链中的后门威胁,通过操纵内部想象诱导特定恶意行为。
    1. 这篇论文试图解决什么问题?

      TrojanWorld 试图解决世界模型智能体在供应链中的后门威胁,通过操纵内部想象诱导特定恶意行为。

    2. 有哪些相关研究?

      相关研究涵盖世界模型构建、强化学习与智能体后门攻防,以及针对世界模型的对抗性干扰与规划破坏方法。

    3. 论文如何解决这个问题?

      TrojanWorld 冻结决策模块并仅微调世界模型,通过决策反射诱导、干净行为锚定和因果传播实现后门植入。

    4. 论文做了哪些实验?

      实验覆盖 3 个系统与 4 个基准,TrojanWorld 在触发期诱导目标动作并在移除后维持控制,3 种适配防御未能完全消除攻击。

    5. 有什么可以进一步探索的点?

      后续探索可关注物理真实相机因素与大规模世界模型扩展;当前实验覆盖仿真器内 3 种架构与 8 个任务。

    6. 总结一下论文的主要内容

      TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。

    完整解读
  19. 攻击arXiv:2609.33985 · 55

    研究:众包微调数据投毒可放大专有指令抽取

    注入50条主题中毒样本使Qwen2.5-14B在OpenMathInstruct上近原样提取率达良性微调的3.71倍。

    • 8.84%Qwen2.5-14B在OpenMathInstruct上50条中毒样本的近原样提取率
    • 3.71×Qwen2.5-14B在OpenMathInstruct上50条中毒样本相对良性微调的提取倍率
    • 6.07%Llama-3.1-8B在AceReason上100条中毒样本的直接提交近原样提取率
    6 问速览研究在黑盒输出设定下,能否通过向众包微调数据注入少量中毒样本放大提取其他用户的未知指令。
    1. 这篇论文试图解决什么问题?

      研究在黑盒输出设定下,能否通过向众包微调数据注入少量中毒样本放大提取其他用户的未知指令。

    2. 有哪些相关研究?

      涵盖预训练与微调数据提取、众包微调数据集构建,以及基于数据中毒的隐私推断与数据窃取攻击。

    3. 论文如何解决这个问题?

      构建领域主题锚点注入提取引导样本,并利用未微调代理模型的不确定性自适应筛选高收益锚点进行查询。

    4. 论文做了哪些实验?

      在 4 个模型与 2 个数据集上评估了直接提交与托管交互中毒,并测试了 4 种防御过滤方法及模型蒸馏效用。

    5. 有什么可以进一步探索的点?

      论文未专门讨论局限,其实验覆盖了 4 个开源模型、2 个核心数据集、4 种异常检测方法与多种预算配置。

    6. 总结一下论文的主要内容

      论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    完整解读
已经到底了