跳到正文
10月8日 · 周四

Anthropic · 论文

精选论文 29 篇
  1. 防御arXiv:2610.05163 · 59

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    作者针对长流程智能体构建分阶段注入基准,提出PAA方法在边界动作前实现86%召回与6-8%误阻率。

    • 86.1%Claude Code全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    • 6.0%Claude Code全基准fail-open,Claude Sonnet 5,PAA FBR(Table 2)
    • 86.0%Codex全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    6 问速览长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。
    1. 这篇论文试图解决什么问题?

      长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。

    2. 有哪些相关研究?

      梳理了自动化注入、智能体安全基准及运行时审计,指出前人缺乏动作级统一拦截评测。

    3. 论文如何解决这个问题?

      PAA将动作分解为要素并双重归因取值与决策来源,结合代码检验与模型裁决判定阻断。

    4. 论文做了哪些实验?

      PAA在两语料全基准上达86%召回率与6-8% FBR,显著优于基线。

    5. 有什么可以进一步探索的点?

      作者指出了离线重放、无自适应对抗等局限,实验覆盖了2个系统与8个场景。

    6. 总结一下论文的主要内容

      论文针对长流程注入提出边界动作审计与PAA,在保持低误阻的同时实现高拦截率。

    完整解读
  2. 防御arXiv:2609.38983 · 58

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    在Claude Code上测试表明审批与执行动作存在六类解绑失效,基于HMAC的Approval Token可消除委托与时序洗白但无法防范效果偏离。

    • 1.000Claude Code在Scope场景下的基线BGR(Table 3)
    • 1.000Claude Code在Temporal场景下的基线BGR(Table 3)
    • 0.947Claude Code在Delegation场景下的基线BGR(Table 3)
    6 问速览研究编程智能体套件中人类审批与底层工具执行动作脱钩的审批洗白问题,分析六类凭证绑定失效模式。
    1. 这篇论文试图解决什么问题?

      研究编程智能体套件中人类审批与底层工具执行动作脱钩的审批洗白问题,分析六类凭证绑定失效模式。

    2. 有哪些相关研究?

      对比智能体授权机制、测量基准与混淆代理研究,指出现有工作均未覆盖全部六类凭证绑定失效。

    3. 论文如何解决这个问题?

      形式化准入与效果偏离条件,构建六维分类学,提出七字段 HMAC 权能凭证 Approval Token 进行预执行验证。

    4. 论文做了哪些实验?

      在 Claude Code 上实测六类场景基线 BGR,并通过 118 次离线重放和实时烟雾测试验证防御效果与局限。

    5. 有什么可以进一步探索的点?

      指出跨套件泛化、效果偏离拦截、真实感知评测与密钥保管等局限,列明实验覆盖范围。

    6. 总结一下论文的主要内容

      系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。

    完整解读
已经到底了