跳到正文
10月8日 · 周四

供应链安全 · 论文

找到 9 篇
  1. 攻击arXiv:2610.07510 ·

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    提出PERSISTBD,在发布前强化后门使其经良性后训练仍然存活

    测试
    Qwen2.5-Coder-3B-Instruct、Qwen2.5-Coder-7B-Instruct、Qwen3-Coder-30B-A3B-Instruct训练与数据层
    摘要总结了论文关于后门在SFT/RL中存活的发现、两因子机制、PERSISTBD方法与核心数字。

    本文研究第三方LLM智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    完整解读
  2. 攻击arXiv:2609.39065 ·

    TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞

    提出TrustProbe,挖掘技能内容流向特权操作的信任链漏洞

    测试
    deepseek-v4-flash、Kimi Code CLI、Qwen Code 等 5 个应用层
    摘要论文研究 skill 智能体的非安全信任链问题,提出 TrustProbe 工具并在 11 个开源智能体上验证了 104 个污点漏洞。
    • 论文定位:本研究系统探讨了基于 SKILL.md 的 LLM 智能体中存在的非安全信任链问题,即第三方不可信 skill 内容可跨越信任边界并滥用用户委托权限。
    • 核心问题:现存智能体框架自动将已安装 skill 注入执行上下文,但在从 skill 输入到敏感系统调用的传播路径上普遍缺乏内容过滤、来源跟踪与有效的执行层审批校验。
    • 方法要点:提出 TrustProbe 框架,通过静态提取 1,566 条 source-to-sink 路径构建种子,结合语义评分与调用图距离反馈指导灰盒模糊测试,并利用金丝雀标记与双重 bug oracle 验证真实危害。
    • 最重要的定量结果:在 11 个主流开源智能体上发现并证实了 104 个污点漏洞,ASR 达 100%;直接提示词重放仅能复现 31.7% 的漏洞;在 8 个开启最严格非交互审批的智能体中仍有 34.8%(31/89)的漏洞可被利用;对 633 个真实 skill 的测试中有 25.1% 触发漏洞路径,经微调有 15 个转化为完整攻击。
    • 作者结论与启示:作者认为,必须将第三方 skill 内容视为智能体执行安全边界的一部分,未来框架需在底层引入全链路来源标记、安装期能力声明,并在共享执行点实施细粒度的路径与参数级控制。
    完整解读
  3. 攻击arXiv:2609.39607 ·

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    提出PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为

    测试
    glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b) 等 4 个应用层
    场景
    编程 Agent攻击者白盒
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    完整解读
  4. 攻击arXiv:2610.01564 ·

    APEX 用跨技能链劫持 LLM Agent,GPT-5.4 上攻击成功率达 84.3%

    提出APEX,用跨技能进度记录夹带虚假授权劫持智能体

    测试
    Claude Sonnet 5、DeepSeek V4 Flash、GPT-5.4 等 6 个应用层
    摘要APEX通过跨技能传递虚假授权实现74.2%的动作诱导率,揭示了多技能协同的安全风险。

    论文针对大语言模型智能体使用多技能串联时的安全隐患,提出对抗性技能链构建框架APEX。

    完整解读
  5. 攻击arXiv:2607.12340 ·

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链

    测试
    GLM-4.5-Air、GPT-5.4-mini、Claude Sonnet 4.6 等 10 个应用层
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    完整解读
  6. 攻击arXiv:2609.01222 ·

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体

    测试
    GPT-5.5、GPT-5.4 mini、Claude-Sonnet-4.6 等 7 个应用层
    摘要论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。

    完整解读
  7. 攻击arXiv:2609.03884 ·

    HookPry:利用插件生命周期钩子更新劫持 AI Agent 框架

    提出HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令

    测试
    Claude Sonnet 4.6、DeepSeek-V4-Pro、Kimi-K2.6 等 6 个应用层
    摘要论文揭示了智能体框架钩子更新的供应链攻击面,提出了 HOOKPRY 框架并在测试中取得 77.0% 的成功率。
    • 论文定位:该研究揭示了现代 AI 智能体框架在插件生命周期钩子更新路径上的信任失效,提出了首个跨框架自动化的生命周期钩子供应链攻击框架 HOOKPRY。
    • 解决的问题:智能体框架将系统 Shell 命令绑定至运行时事件,且在框架底层独立派生子进程,绕过了大语言模型的推理闭环;框架在插件更新时继承既有信任,使攻击者可通过元数据和钩子配置更新静默植入并执行恶意命令。
    • 方法要点:HOOKPRY 串联三项机制:对抗清单优化(AMO)利用多意图代理目标提升良性插件检索概率;时间解耦(TD)利用良性探针定位低验证高权限的信任边界并实施条件激活;最小公共接口(LCI)提取通用能力规范并编译为目标框架的原生钩子配置。
    • 关键实验结果:
      • 在 7 个框架与 5 个后端的 1,000 次端到端测试中,HOOKPRY 微平均 E2E-ASR 达到 77.0%,在 Hermes 上达到 92.5%,在 Claude Code 上为 52.5%(Table 2)。
      • 在跨模型测试中,Codex CLI 的后端间标准差为 0.0 个百分点,Claude Code 为 2.5 个百分点,体现了事件触发后执行路径与模型的解耦特性(Figure 5)。
      • 在 50 个目标对比中,HOOKPRY 原生钩子的 E2E-ASR 为 92.0%,显著高于转换后 MCP 描述投毒的 56.0%(单侧二项检验 p = 7.09×10⁻¹²,Table 4)。
      • 在 40:40 静态测试中,Microsoft Defender 召回率为 0.0%,三款静态防御联合漏报率达到 47.5%(Table 6)。
    • 作者结论与启示:作者指出,模型层的内容安全过滤无法触及推理流之外的钩子执行;智能体安全必须将插件更新审查、钩子独立重新授权、子进程最小特权分配与运行时监控纳入全链路防护。
    完整解读
  8. 攻击arXiv:2608.06862 ·

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个应用层
    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
    • 定位:论文研究了计算机使用智能体(CUA)中由持久化工件自主生成引发的内部供应链安全风险。
    • 核心问题:现代 CUA 依赖自主编写并复用技能等持久工件来扩展能力,若底层模型受到供应链攻陷,可能在良性任务中生成带潜伏载荷的自合成工件,使得恶意行为无需外部新输入即可在后续任务中跨步激活。
    • 方法设计:提出 SYNCHAIN 框架,通过面向持久化的定向 SFT,将恶意逻辑潜伏编码在良性工件的结构冗余中;工件被纳入系统扩展状态后,通过状态转移实现严格的延迟激活。
    • 核心实验发现:在 OpenClaw、Codex 和 Claude Code 三个框架下,SYNCHAIN 在 Chain-1 无防御设置下取得 97.78%–98.89% 的平均 ASR,在 GuardAgent 下仍保持 87.78%–93.33%;在 Chain-2 取得 72.59% 的平均 ASR,显著优于适配基线 SkillJect 和 DemonAgent。
    • 传播边界与衰减:在更长任务链中,受上下文截断和记忆总结等信息瓶颈影响,Chain-4 与 Chain-5 的 ASR 分别回落至 6.67% 与 1.11%,表明跨任务传播存在天然的马尔可夫衰减边界。
    • 作者结论与启示:作者认为,持久性改变了智能体的安全边界,传统的单步输入过滤和输出审查无法防御内部工件传递的风险,未来需构建结合工件签名、权限约束与执行轨迹审计的来源感知防御。
    完整解读
  9. 攻击arXiv:2609.01023 ·

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    提出AKRASIA推断期后门,用代码级触发器与伪装推理操纵代码模型

    测试
    Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个提示层
    摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
    • 研究定位:论文针对代码推理大模型提出了一种利用上下文学习与模型不忠实性构建的推断期隐蔽后门攻击框架AKRASIA。
    • 核心问题:现有大模型推断期后门多针对自然语言或数学推理,依赖显式文本触发器,不仅无法适应代码语法结构,且在暴露的思维链中容易被黑盒防御和人工审查察觉。
    • 方法设计:AKRASIA首先通过小样本探查受害模型生成上下文相关的代码触发器(涵盖注释、死代码、语法、自适应和双模态);随后构建包含正负ICL示例的投毒提示词;最后利用模型在推理过程中的不忠实性,指示模型隐藏触发器并生成支持错误输出的合理化虚假推理。
    • 关键实验发现:实验覆盖6个主流推理模型与3个代码基准。在CodeMMLU代码补全任务中,AKRASIA在Gemini-3.5-flash上达到99.34%平均ASR(Table 5);在LiveCodeBench代码生成任务中,AKRASIA-U在Gemini-3.5-flash上实现90.4%平均ASR和93.0%中毒ACC(Table 4);在3种SOTA防御测试中,AKRASIA在14/18个设置中维持55.36%至98.82%的平均ASR(Table 6);人工盲审中,高级攻击变体的推理被判定为合理的比例达到70%至80%,触发器检出率降至30%至40%(Figure 3)。
    • 特例与失效分析:GPT-5.5在CodeMMLU上的AKRASIA-UR版本ASR降至4.08%(Table 5),但在基础版本和不忠实版本下仍有44.04%与59.51% ASR(Table 12),作者将其归因于模型内部特定护栏的作用;自然语言基线BadChain在代码任务上的ASR降为0.0000(Table 9)。
    • 作者结论与启示:作者认为,思维链推理机制为攻击者提供了生成误导性解释的攻击面,当前的黑盒防御和人工检查难以有效应对具备合理化伪装能力的后门攻击,迫切需要针对推理模型的防御机制与更稳固的模型内置安全对齐。
    完整解读
已经到底了