跳到正文
10月8日 · 周四

Anthropic · 论文

找到 8 篇

另有 25 篇论文还没打上分类标签,暂不在筛选结果里。

  1. Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现

    提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点

    发表
    测试
    Claude Opus 4.6、Claude Opus 4.7、Claude Sonnet 4.6 等 6 个

    摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。

    深度解读完整解读
  2. AgentHazard:评估计算机使用智能体有害行为的基准

    提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为

    发表
    测试
    Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct、Qwen3-32B 等 12 个
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    深度解读完整解读
  3. 评测与基准arXiv 2610.03153

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    提出 EvoRiskBench,评测工作区智能体的运行时安全风险

    发表
    测试
    GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5

    摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。

    深度解读完整解读
  4. 评测与基准arXiv 2607.14611

    论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险

    评测编码智能体记忆文件中的提示注入及其跨会话持久性

    发表
    测试
    Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2 等 4 个
    摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。

    Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。

    深度解读完整解读
  5. 评测与基准arXiv 2609.19587

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固

    发表
    测试
    Opus 5、Opus 4.8、Opus 4.7 等 8 个

    摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。

    深度解读完整解读
  6. SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件

    发表
    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个

    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    深度解读完整解读
已经到底了