跳到正文
10月8日 · 周四

供应链安全 · 论文

找到 4 篇
  1. 攻击arXiv:2610.07645 ·

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成

    测试
    deepseek-v4-flash、Qwen V3.8 Flash、GPT-5.5应用层
    场景
    AI Agent
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    完整解读
  2. 攻击arXiv:2608.29381 ·

    研究者提出 Agent 检查点回滚的五类安全失效,并在 Hermes、Cline、LangGraph 上实现三种攻击

    提出破坏执行连续性的回滚攻击,揭示检查点恢复的安全故障

    测试
    DeepSeek-v4应用层
    场景
    AI Agent
    摘要论文系统研究了智能体C/R的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
    • 研究定位:该研究针对持久状态化 AI 智能体的检查点与回滚(C/R)机制,探讨了状态还原过程中的系统安全性。
    • 核心问题:随着智能体运行周期延长,C/R 成为从故障中恢复的关键手段;但现有机制仅关注状态本身的正确恢复,忽略了跨越恢复边界的安全依赖,导致恢复后的执行可能进入历史中从未合法共存的状态。
    • 方法要点:作者将现有 C/R 归纳为框架、工作区和 OS/VM 三类恢复边界,提出了包含多进程与外部世界的执行模型;形式化定义了执行连续性概念,提炼出内部覆盖不全(SF1)、内部状态不一致(SF2)、外部状态不匹配(SF3)、无约束非确定性重放(SF4)和未记录外部效应(SF5)五类故障模式;并设计了集收集、分析、检查与原生验证于一体的多智能体分析管线。
    • 关键实证结果:
      1. 在 TerminalBench 与 AgentBench 的 1735 次执行中,SF1 和 SF4 最普遍,出现率分别达 67.2%(1166 次)与 67.7%(1174 次);SF5 因评估任务多为本地操作仅占 2.3%(40 次)(据 Table II)。
      2. 针对系统级沙箱的 E2B 未观察到 SF1 与 SF2;而仅恢复工作区文件的 Hermes 和 Cline 暴露出大量 SF2 故障,在两基准上分别出现 240 次与 249 次(据 Table II)。
      3. 在包含 96 个持久外部动作的微基准中,调整执行与提交顺序均无法解决恢复鸿沟,先执行后提交与先提交后执行的失败率分别为 93.8%(90 次)和 96.9%(93 次)(据 Table IV)。
      4. 构建的 3 个真实端到端攻击与 30 个基于恶意 skill 的测试用例均攻击成功,且未被现有恶意 skill 检测工具拦截。
    • 作者结论与启示:作者指出正确恢复检查点内容并不等同于安全的执行恢复,回滚极易破坏支撑安全决策的上下文与依赖关系;未来的智能体恢复机制必须将恢复视为跨组件的安全边界,通过显式状态绑定、事务一致性与幂等协调机制保障恢复安全性。
    完整解读
  3. 攻击arXiv:2607.12340 ·

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链

    测试
    GLM-4.5-Air、GPT-5.4-mini、Claude Sonnet 4.6 等 10 个应用层
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    完整解读
  4. 攻击arXiv:2609.02774 ·

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    测试
    Qwen 3.5 9B、Code Llama 13B、DeepSeek-Coder-V2 16B 等 4 个应用层
    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
    • 定位:CodePoisonRAG 是一项针对检索增强代码生成(RACG)系统的黑盒上游知识投毒攻击研究,探索攻击者能否通过单一任务对齐工件定向诱导漏洞代码生成。
    • 问题:针对现有投毒攻击依赖非针对性 CVE 样本、需要单查询多样本注入且无法自由匹配任务与弱点的问题,研究在黑盒且低投毒率下定向植入特定 CWE 的可行性。
    • 方法:选取良性任务代码保持签名与逻辑,通过漏洞注入替换关键净化步骤为 passthrough 形成完整 source-to-sink 污点链,再叠加语义误标虚假安全注释以兼顾检索相关性与生成诱导。
    • 主要结果:
      1. 在 12,053 条良性库中仅引入 85 个工件(投毒率 0.700%),所有工件在 3 个模型上均 100% 进入 Top-3 检索上下文(Table II)。
      2. 无防御场景下在 Qwen 3.5 9B、Code Llama 13B 和 DeepSeek-Coder-V2 16B 上的 ASR 分别为 0.80、0.93 和 0.80(Table III)。
      3. 在 CodeGuarder 安全知识注入防御下,三模型 ASR 仍保持在 0.40、0.71 和 0.60(Table III)。
      4. 在共有的 4 类 CWE 上,Code Llama 13B 的平均 ASR 达到 0.97,高于现有 CVE 投毒基线的 0.67(Table IV)。
    • 结论与启示:作者认为,RACG 系统的知识库构成了关键攻击面,攻击者无需访问模型即可实现针对性漏洞传播;现有的提示期安全知识注入能缓解但无法消除投毒影响,强调了在检索知识被采纳前进行完整性与安全性验证的必要性。
    完整解读
已经到底了