跳到正文
10月8日 · 周四

供应链安全 · 论文

找到 3 篇
  1. 攻击arXiv:2608.29381 ·

    研究者提出 Agent 检查点回滚的五类安全失效,并在 Hermes、Cline、LangGraph 上实现三种攻击

    提出破坏执行连续性的回滚攻击,揭示检查点恢复的安全故障

    测试
    DeepSeek-v4应用层
    场景
    AI Agent
    摘要论文系统研究了智能体C/R的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
    • 研究定位:该研究针对持久状态化 AI 智能体的检查点与回滚(C/R)机制,探讨了状态还原过程中的系统安全性。
    • 核心问题:随着智能体运行周期延长,C/R 成为从故障中恢复的关键手段;但现有机制仅关注状态本身的正确恢复,忽略了跨越恢复边界的安全依赖,导致恢复后的执行可能进入历史中从未合法共存的状态。
    • 方法要点:作者将现有 C/R 归纳为框架、工作区和 OS/VM 三类恢复边界,提出了包含多进程与外部世界的执行模型;形式化定义了执行连续性概念,提炼出内部覆盖不全(SF1)、内部状态不一致(SF2)、外部状态不匹配(SF3)、无约束非确定性重放(SF4)和未记录外部效应(SF5)五类故障模式;并设计了集收集、分析、检查与原生验证于一体的多智能体分析管线。
    • 关键实证结果:
      1. 在 TerminalBench 与 AgentBench 的 1735 次执行中,SF1 和 SF4 最普遍,出现率分别达 67.2%(1166 次)与 67.7%(1174 次);SF5 因评估任务多为本地操作仅占 2.3%(40 次)(据 Table II)。
      2. 针对系统级沙箱的 E2B 未观察到 SF1 与 SF2;而仅恢复工作区文件的 Hermes 和 Cline 暴露出大量 SF2 故障,在两基准上分别出现 240 次与 249 次(据 Table II)。
      3. 在包含 96 个持久外部动作的微基准中,调整执行与提交顺序均无法解决恢复鸿沟,先执行后提交与先提交后执行的失败率分别为 93.8%(90 次)和 96.9%(93 次)(据 Table IV)。
      4. 构建的 3 个真实端到端攻击与 30 个基于恶意 skill 的测试用例均攻击成功,且未被现有恶意 skill 检测工具拦截。
    • 作者结论与启示:作者指出正确恢复检查点内容并不等同于安全的执行恢复,回滚极易破坏支撑安全决策的上下文与依赖关系;未来的智能体恢复机制必须将恢复视为跨组件的安全边界,通过显式状态绑定、事务一致性与幂等协调机制保障恢复安全性。
    完整解读
  2. 攻击arXiv:2609.01023 ·

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    提出AKRASIA推断期后门,用代码级触发器与伪装推理操纵代码模型

    测试
    Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个提示层
    摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
    • 研究定位:论文针对代码推理大模型提出了一种利用上下文学习与模型不忠实性构建的推断期隐蔽后门攻击框架AKRASIA。
    • 核心问题:现有大模型推断期后门多针对自然语言或数学推理,依赖显式文本触发器,不仅无法适应代码语法结构,且在暴露的思维链中容易被黑盒防御和人工审查察觉。
    • 方法设计:AKRASIA首先通过小样本探查受害模型生成上下文相关的代码触发器(涵盖注释、死代码、语法、自适应和双模态);随后构建包含正负ICL示例的投毒提示词;最后利用模型在推理过程中的不忠实性,指示模型隐藏触发器并生成支持错误输出的合理化虚假推理。
    • 关键实验发现:实验覆盖6个主流推理模型与3个代码基准。在CodeMMLU代码补全任务中,AKRASIA在Gemini-3.5-flash上达到99.34%平均ASR(Table 5);在LiveCodeBench代码生成任务中,AKRASIA-U在Gemini-3.5-flash上实现90.4%平均ASR和93.0%中毒ACC(Table 4);在3种SOTA防御测试中,AKRASIA在14/18个设置中维持55.36%至98.82%的平均ASR(Table 6);人工盲审中,高级攻击变体的推理被判定为合理的比例达到70%至80%,触发器检出率降至30%至40%(Figure 3)。
    • 特例与失效分析:GPT-5.5在CodeMMLU上的AKRASIA-UR版本ASR降至4.08%(Table 5),但在基础版本和不忠实版本下仍有44.04%与59.51% ASR(Table 12),作者将其归因于模型内部特定护栏的作用;自然语言基线BadChain在代码任务上的ASR降为0.0000(Table 9)。
    • 作者结论与启示:作者认为,思维链推理机制为攻击者提供了生成误导性解释的攻击面,当前的黑盒防御和人工检查难以有效应对具备合理化伪装能力的后门攻击,迫切需要针对推理模型的防御机制与更稳固的模型内置安全对齐。
    完整解读
  3. 攻击arXiv:2609.33985 ·

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    测试
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个训练与数据层
    场景
    模型与 API攻击者黑盒
    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
    • 论文定位:本文揭示了众包监督微调(SFT)中低预算数据中毒放大提取他人专有微调指令的隐私风险。
    • 核心问题:针对现实中微调服务商采用未知开源基座模型、仅开放生成文本黑盒接口的场景,探究不可信用户能否仅贡献少量训练样本即可诱导模型泄漏其他良性用户贡献的未知私有指令。
    • 方法机制:构建包含 416 个三级领域主题锚点的体系,在数据收集期将提问放入响应端配对提取提示,利用未微调的 Gemma-3-4B 代理模型依据参考数据余弦相似度筛选 5 个代表性中毒锚点;在提取阶段利用代理模型对生成文本的负对数似然(NLL)动态筛选高收益锚点进行多轮自适应查询。
    • 关键实验结果:仅需注入 50 条中毒样本(微调集约 1%),Qwen2.5-14B 在 OpenMathInstruct 上的近原样提取率即达 8.84%(为良性微调 2.38% 的 3.71 倍),Llama-3.1-8B 在 AceReason 上达 5.85%(为良性微调 1.90% 的 3.08 倍)(Table 13);在默认 100 条中毒设定下,该攻击在多项指标上超过了控制 49% 后门数据的提供商后门基线(Table 1)。
    • 防御隐蔽性:在包含 2% 中毒样本的数据过滤测试中,CVDD、DATE、SIK 及 LLM Judge 均难以有效拦截,检测 F1 最高仅为 0.378(CVDD 作用于回复端),其余多数配置召回为 0(Table 4)。
    • 作者结论与启示:作者认为众包微调机制存在隐蔽的隐私脆弱性,攻击者即便无法获知模型权重与 logits,仅凭少量的良性外表交互就能促使模型记忆并外泄其他用户的专有指令,现有的基于异常检测和 LLM 判别的清洗手段无法提供充分防护。
    完整解读
已经到底了