跳到正文
10月10日 · 周六

全部论文

找到 22 篇

另有 350 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.09964

    研究比较连续训练阶段对大语言模型说服力的影响

    比较连续后训练阶段如何改变语言模型的说服力

    发表
    被测模型
    mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated、GPT-4
    摘要作者称说服性 SFT 提高失调模型的态度变化,IPO 无额外收益,GPT-4 不异于中性文本。

    作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。

    深度解读完整解读
  2. 评测与基准arXiv 2610.06584

    论文:AI 在非公开漏洞上更帮攻击者还是防御者

    评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击

    发表
    被测模型
    Opus 5、GPT-5.6 Sol、GPT-6 Sol 等 10 个
    摘要攻防孰强随环境、系统和弱点改变。

    作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。

    深度解读完整解读
  3. 评测与基准arXiv 2610.03853

    报告评估 LLM Agent 选择和使用生物工具的能力

    评测 Agent 选择并早期操作高风险生物工具的能力

    发表
    场景
    AI Agent
    被测模型
    Claude Opus 4.7、Gemini 3.1 Pro Preview、GPT-5.5 等 7 个
    摘要七模型能选工具并部分操作 EVEscape 与 ESM3。

    这项评估测量七个前沿 LLM 智能体与生物工具交互的最早两步:为设计任务选工具,以及在仓库里完成玩具级操作。作者关心的是,有生命科学背景但不会专门操作高风险工具的行为者,能否借此降低门槛。范围限于预测性、生成性工具。

    深度解读完整解读
  4. 其他arXiv 2609.36054

    多作者论文评估 AI 研发自动化触发智能爆炸的可能与政策应对

    评估自动化 AI 研发触发智能爆炸的可能并提出政策应对

    发表
    摘要软件驱动智能爆炸可能把数年进展压进数月,作者要求三项政策先做好。

    Chan 等论证:自动化 AI 研发可能经软件反馈环形成智能爆炸,把本需数年的进展压进数月或更短。他们关心的不是换硬件的建设周期,而是 AI 扩大有效研发劳动力、再产出更强系统,以及社会能否在能力跃迁前看见、约束并适应这一过程。

    深度解读完整解读
  5. 其他arXiv 2609.26457

    Weco AI 提出 AIDE2:AI 研究智能体递归自我改进 8 天获七次提升

    提出双层系统 AIDE2,使研究智能体自改进 Harness 并对比人类研发基线

    发表
    被测模型
    gemini 3 flash、gpt-5.6-sol、fable 5

    摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。

    深度解读完整解读
  6. 评测与基准arXiv 2609.15939

    VLoc Bench 发布:评测 Agent 在完整仓库中的漏洞定位能力

    提出 VLoc Bench,评测智能体在完整仓库中定位漏洞文件并抑制修复后误报

    发表
    被测模型
    GPT-5.5 (xhigh)、GPT-5.5 (default)、Gemini 3 Pro 等 15 个

    摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。

    深度解读完整解读
  7. PatchBench:马里兰大学团队发布 C/C++ 漏洞修补评测基准

    提出基准 PATCHBENCH,评测编程 Agent 的漏洞修补是否真正修复根因

    发表
    被测模型
    Codex + GPT-5.6 Sol、OpenHands + GPT-5.6 Sol、Claude Code + Claude Opus 4.8 等 11 个

    摘要论文揭示漏洞修复评测的记忆与表面防护问题,提出离栈变异基准与双重验证,测得智能体实际解决率仅约五成。

    深度解读完整解读
  8. 评测与基准arXiv 2608.11469

    SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

    提出 SRE-Bench 评测智能体的真实规模二进制逆向能力

    发表
    被测模型
    GPT-6-Astra、GPT-5.6-Sol、GPT-5.6-Cyber 等 11 个
    摘要SRE-Bench 用从零编写的大规模保护二进制评测智能体 RE,公开设置下多数模型完全解开比例不高。

    作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。

    深度解读完整解读
  9. 其他arXiv 2607.28568

    Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型

    提出 OpenMLE,后训练元进化智能体并做机器学习工程长程搜索

    发表
    被测模型
    Frontis-MA1-35B、Frontis-MA1-30B
    摘要OpenMLE 训练 Frontis-MA1-35B,用四个共享算子把 MLE 后训练和长程搜索接成元进化闭环。

    作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。

    深度解读完整解读
  10. 评测与基准arXiv 2607.27191

    研究者提出影子评测:前沿 Agent 六天未能完成两篇 NeurIPS 投稿级研究

    提出影子评测,衡量 Agent 自主完成开放式 AI 科研的能力

    发表
    被测模型
    Claude Opus 4.8、GPT-5.6 Sol、GPT-5.3 Codex

    摘要论文通过影子评测发现前沿智能体能独立胜任科研工程实现,但在科学探索与有效利用反馈上未达到顶会门槛。

    深度解读完整解读
  11. 评测与基准arXiv 2607.18665

    SciHazard:面向科研安全的危险能力评测基准与分解式危害评分

    构建 SciHazard 基准,评测科研智能体与 LLM 的科学危险能力

    发表
    被测模型
    WebThinker + DeepSeek-R1、InternAgent、Gemini Deep Research 等 19 个
    摘要SciHazard 用分解评分测科学滥用风险,作者称智能体抬高了可执行危害。

    SciHazard 是一个科学滥用风险基准,配一个把危害拆开再合成的自动分数。

    深度解读完整解读