跳到正文
10月8日 · 周四

全部论文

找到 25 篇

另有 1081 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2604.02947 ·

    AgentHazard:评估计算机使用智能体有害行为的基准

    提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为

    网页与电脑操作编程 Agent测试Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct、Qwen3-32B 等 12 个应用层
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    完整解读
  2. 评测与基准arXiv:2608.11469 ·

    SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

    构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力

    编程 Agent测试GPT-6-Astra、GPT-5.6-Sol、GPT-5.6-Cyber 等 11 个应用层
    摘要SRE-Bench 用从零编写的大规模保护二进制评测智能体 RE,公开设置下多数模型完全解开比例不高。

    作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。

    完整解读
  3. 评测与基准arXiv:2607.14611 ·

    论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险

    评测编码智能体记忆文件中的提示注入及其跨会话持久性

    编程 Agent测试Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2 等 4 个应用层
    摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。

    Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。

    完整解读
  4. 评测与基准arXiv:2609.09798 ·

    CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    编程 Agent攻击者黑盒无盒测试CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个应用层

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    完整解读