跳到正文
10月9日 · 周五

全部论文

找到 17 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 519 篇还没打标签,不在筛选结果里。

另有 519 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.06584

    论文:AI 在非公开漏洞上更帮攻击者还是防御者

    评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击

    发表
    被测模型
    Opus 5、GPT-5.6 Sol、GPT-6 Sol 等 10 个
    摘要攻防孰强随环境、系统和弱点改变。

    作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。

    深度解读完整解读
  2. 其他arXiv 2609.26457

    Weco AI 提出 AIDE2:AI 研究智能体递归自我改进 8 天获七次提升

    提出双层系统 AIDE2,使研究智能体自改进 Harness 并对比人类研发基线

    发表
    被测模型
    gemini 3 flash、gpt-5.6-sol、fable 5

    摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。

    深度解读完整解读
  3. 其他arXiv 2609.18120

    PentestChain:面向免费层 LLM 的成本感知 MCP 编排自动化渗透测试框架

    提出成本感知的 MCP 编排框架,用确定性利用图与免费层模型做自动化渗透测试

    发表
    摘要确定性利用图加免费层级联在十次自建运行上测得付费成本为零。

    PentestChain 是一个十阶段、经 MCP 暴露的自动渗透框架,用确定性利用图把 7B 本地模型挡在利用关键路径之外,并把每次交战的美元成本当作实测指标。。

    深度解读完整解读
  4. 评测与基准arXiv 2609.15939

    VLoc Bench 发布:评测 Agent 在完整仓库中的漏洞定位能力

    提出 VLoc Bench,评测智能体在完整仓库中定位漏洞文件并抑制修复后误报

    发表
    被测模型
    GPT-5.5 (xhigh)、GPT-5.5 (default)、Gemini 3 Pro 等 15 个

    摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。

    深度解读完整解读
  5. PatchBench:马里兰大学团队发布 C/C++ 漏洞修补评测基准

    提出基准 PATCHBENCH,评测编程 Agent 的漏洞修补是否真正修复根因

    发表
    被测模型
    Codex + GPT-5.6 Sol、OpenHands + GPT-5.6 Sol、Claude Code + Claude Opus 4.8 等 11 个

    摘要论文揭示漏洞修复评测的记忆与表面防护问题,提出离栈变异基准与双重验证,测得智能体实际解决率仅约五成。

    深度解读完整解读
  6. 评测与基准arXiv 2608.11469

    SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

    提出 SRE-Bench 评测智能体的真实规模二进制逆向能力

    发表
    被测模型
    GPT-6-Astra、GPT-5.6-Sol、GPT-5.6-Cyber 等 11 个
    摘要SRE-Bench 用从零编写的大规模保护二进制评测智能体 RE,公开设置下多数模型完全解开比例不高。

    作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。

    深度解读完整解读
  7. 评测与基准arXiv 2607.27191

    研究者提出影子评测:前沿 Agent 六天未能完成两篇 NeurIPS 投稿级研究

    提出影子评测,衡量 Agent 自主完成开放式 AI 科研的能力

    发表
    被测模型
    Claude Opus 4.8、GPT-5.6 Sol、GPT-5.3 Codex

    摘要论文通过影子评测发现前沿智能体能独立胜任科研工程实现,但在科学探索与有效利用反馈上未达到顶会门槛。

    深度解读完整解读
  8. 评测与基准arXiv 2607.18665

    SciHazard:面向科研安全的危险能力评测基准与分解式危害评分

    构建 SciHazard 基准,评测科研智能体与 LLM 的科学危险能力

    发表
    被测模型
    WebThinker + DeepSeek-R1、InternAgent、Gemini Deep Research 等 19 个
    摘要SciHazard 用分解评分测科学滥用风险,作者称智能体抬高了可执行危害。

    SciHazard 是一个科学滥用风险基准,配一个把危害拆开再合成的自动分数。

    深度解读完整解读
  9. 评测与基准arXiv 2606.18936

    SciRisk-Bench:面向 AI4Science 安全的风险维度感知基准

    提出 SciRisk-Bench,按风险维度与学科评测 AI4Science 安全

    发表
    被测模型
    kimi-k2.6、glm-5.1、gemini-3-flash-preview 等 14 个
    摘要SciRisk-Bench 以风险维度和学科诊断 AI4Science 安全。

    SciRisk-Bench 是一个按风险维度和科学学科组织的 AI4Science 安全基准,用来看清失败来自哪一种风险机制、出现在哪个学科情境。作者认为 LLM 已介入科研问答、文献分析、实验规划和自主发现,而不安全输出不限于事实错误。现有科学能力基准不测安全,领域安全基准又多集中在化学、医学或生物,或只按宽泛安全类别打分。

    深度解读完整解读
已经到底了