跳到正文
10月9日 · 周五

全部论文

找到 31 篇

另有 643 篇论文还没打上分类标签,暂不在筛选结果里。

  1. Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现

    构建 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点

    发表
    测试
    Claude Opus 4.6、Claude Opus 4.7、Claude Sonnet 4.6 等 6 个

    摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。

    深度解读完整解读
  2. 评测与基准arXiv 2610.05163

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入

    发表
    测试
    Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5)、Claude Sonnet 5 等 7 个
    摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    深度解读完整解读
  3. AgentHazard:评估计算机使用智能体有害行为的基准

    提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为

    发表
    测试
    Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct、Qwen3-32B 等 12 个
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    深度解读完整解读
  4. 评测与基准arXiv 2608.11469

    SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

    构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力

    发表
    测试
    GPT-6-Astra、GPT-5.6-Sol、GPT-5.6-Cyber 等 11 个
    摘要SRE-Bench 用从零编写的大规模保护二进制评测智能体 RE,公开设置下多数模型完全解开比例不高。

    作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。

    深度解读完整解读
  5. 评测与基准arXiv 2609.19892

    ClashBench:研究者发现 Agent 为抢占资源破坏既有任务

    提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务

    发表
    测试
    Claude-Sonnet-5、DeepSeek-V4-Flash-0731、GLM-4.7 等 15 个

    摘要论文定义特权智能体的破坏性资源抢占风险,通过 CLASHBENCH 发现抢占普遍存在且易被隐瞒,呼吁建立系统级防护。

    深度解读完整解读
  6. 评测与基准arXiv 2609.15939

    VLoc Bench 发布:评测 Agent 在完整仓库中的漏洞定位能力

    提出 VLoc Bench,评测智能体仅凭弱点类型在完整仓库中定位漏洞

    发表
    测试
    GPT-5.5 (xhigh)、GPT-5.5 (default)、Gemini 3 Pro 等 15 个

    摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。

    深度解读完整解读
  7. 评测与基准arXiv 2607.14611

    论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险

    评测编码智能体记忆文件中的提示注入及其跨会话持久性

    发表
    测试
    Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2 等 4 个
    摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。

    Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。

    深度解读完整解读
  8. PatchBench:马里兰大学团队发布 C/C++ 漏洞修补评测基准

    提出 PATCHBENCH,评测编程智能体对 C/C++漏洞的真实修补能力

    发表
    测试
    Codex + GPT-5.6 Sol、OpenHands + GPT-5.6 Sol、Claude Code + Claude Opus 4.8 等 11 个

    摘要论文揭示漏洞修复评测的记忆与表面防护问题,提出离栈变异基准与双重验证,测得智能体实际解决率仅约五成。

    深度解读完整解读
  9. 评测与基准arXiv 2608.22103

    Hack-Verifiable Terminal Bench:评测终端任务中的奖励作弊

    提出 HVTB,在终端编程任务植入蜜罐评测奖励作弊

    发表
    测试
    claude-opus-5、gpt-5.6-sol、gemini-3.1-pro 等 5 个
    摘要用蜜罐测量终端任务上的 reward hacking,并比较五档提示词。

    HVTB 用来在真实终端与编程任务上测量 reward hacking:智能体读取被植入的参考解答或验收测试,从而偏离任务意图。作者认为这一失败模式会随智能体更自主而更重要,且事后人工或 LLM judge 可能失效。

    深度解读完整解读
  10. 评测与基准arXiv 2609.29465

    SWE-Prometheus:衡量真实代码仓库工程治理改进的基准

    提出 SWE-Prometheus,评测编码智能体改进真实仓库工程治理

    发表
    测试
    GPT-5.6-Sol、Claude-Opus-5、Kimi-K3 等 10 个
    摘要SWE-Prometheus 把治理改造拆成改进、行为保持和证据质量。

    SWE-Prometheus 评测编码智能体能否在没有给定缺陷的情况下,提高真实仓库的工程治理状态。

    深度解读完整解读
  11. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒
    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读