跳到正文
10月8日 · 周四

Anthropic · 论文

找到 4 篇
  1. 攻击arXiv:2609.01222 ·

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体

    测试
    GPT-5.5、GPT-5.4 mini、Claude-Sonnet-4.6 等 7 个应用层
    摘要论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。

    完整解读
  2. 攻击arXiv:2608.06862 ·

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个应用层
    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
    • 定位:论文研究了计算机使用智能体(CUA)中由持久化工件自主生成引发的内部供应链安全风险。
    • 核心问题:现代 CUA 依赖自主编写并复用技能等持久工件来扩展能力,若底层模型受到供应链攻陷,可能在良性任务中生成带潜伏载荷的自合成工件,使得恶意行为无需外部新输入即可在后续任务中跨步激活。
    • 方法设计:提出 SYNCHAIN 框架,通过面向持久化的定向 SFT,将恶意逻辑潜伏编码在良性工件的结构冗余中;工件被纳入系统扩展状态后,通过状态转移实现严格的延迟激活。
    • 核心实验发现:在 OpenClaw、Codex 和 Claude Code 三个框架下,SYNCHAIN 在 Chain-1 无防御设置下取得 97.78%–98.89% 的平均 ASR,在 GuardAgent 下仍保持 87.78%–93.33%;在 Chain-2 取得 72.59% 的平均 ASR,显著优于适配基线 SkillJect 和 DemonAgent。
    • 传播边界与衰减:在更长任务链中,受上下文截断和记忆总结等信息瓶颈影响,Chain-4 与 Chain-5 的 ASR 分别回落至 6.67% 与 1.11%,表明跨任务传播存在天然的马尔可夫衰减边界。
    • 作者结论与启示:作者认为,持久性改变了智能体的安全边界,传统的单步输入过滤和输出审查无法防御内部工件传递的风险,未来需构建结合工件签名、权限约束与执行轨迹审计的来源感知防御。
    完整解读
  3. 攻击arXiv:2609.13889 ·

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私

    测试
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max应用层
    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
    • 论文定位:该研究探讨了基于 harness 架构的智能体在持久记忆机制下所面临的新型跨会话安全与隐私风险。
    • 研究问题:现有提示注入多局限于单次会话,而传统后门攻击往往依赖较强的访问权限;论文研究在攻击者无法直接访问智能体的前提下,嵌入外部源的恶意指令能否诱导智能体将其持久化并引发跨会话隐私泄露。
    • 攻击方法:提出的 PMPA 采用两阶段流程,在注入阶段将包含过渡句、记忆写入指令和条件恶意规则的三组件载荷置于外部良性内容中,诱导智能体在问答时写入持久记忆;在触发阶段,用户执行正常工作区任务时激活存储的恶意规则,实现隐私窃取。
    • 核心实验发现:
      1. 在全场景平均下,OpenClaw 的 ISR 与 C-ASR 分别达到 73.7% 和 55.5%,Claude Code 对应达到 66.9% 和 81.7%,且良性任务 Utility 均保持在 80% 以上(摘要及 Table 1)。
      2. 文本模态的攻击效果高于多模态输入,OpenClaw 上文本输入的 ISR 达到 99.4 ± 0.8%,而图像与 PDF 的 ISR 分别为 54.5 ± 2.2% 与 67.2 ± 11.6%(Table 2)。
      3. 日历场景在两个系统上均取得突出的跨会话攻击效果,Claude Code 与 OpenClaw 的 C-ASR 分别达到 96.7 ± 4.7% 和 87.8 ± 9.5%(Table 3)。
      4. 三明治提示词防御能有效降低图像与 PDF 的注入率(如 Claude Code 图像 ISR 从 65.6% 降至 2.2%),但在日历场景中一旦记忆被投毒,Claude Code 的 C-ASR 仍维持在 96.7% 不变(Table 6)。
    • 作者结论与启示:作者认为持久记忆机制打破了单任务交互的安全边界,未经验证的外部数据可能使智能体形成长期的恶意潜伏行为;作者指出当前的提示级防御难以抵御已持久化的记忆投毒,智能体安全亟需从架构与记忆管理机制层面设计更有效的防护方案。
    完整解读
  4. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个应用层
    场景
    AI Agent
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
已经到底了