跳到正文
10月8日 · 周四

全部论文

找到 5 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 789 篇还没打标签,不在筛选结果里。

另有 789 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2609.12039

    现实才是最终验证者:智能体软件工程的两大关键缺口

    提出双缺口框架统一智能体软件工程的奖励投机与幻觉

    发表
    摘要双缺口解释内环为何会放行部署后不可接受的实现,外环用现实证据持续修订 R、M 与 E。

    Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。

    深度解读完整解读
  2. 其他arXiv 2609.26457

    Weco AI 提出 AIDE2:AI 研究智能体递归自我改进 8 天获七次提升

    提出双层自改进系统 AIDE2,让外层智能体重写内层 Harness 代码

    发表
    测试
    claude opus 4.7、gemini 3 flash、gemini 3.1 pro 等 6 个

    摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。

    深度解读完整解读
  3. 其他arXiv 2609.39982

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    提出 Mid-Harness,在执行前验证并选择终端智能体的候选动作

    发表
    测试
    TMAX-9B、TMAX-4B、TMAX-27B 等 8 个
    摘要Mid-Harness 在执行前选择候选动作。

    Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。

    深度解读完整解读
  4. 其他arXiv 2609.38807

    PatchHolmes:基于列表式选择的智能体补丁检索系统

    提出列表式智能体补丁检索系统,在仓库中定位 CVE 修复提交

    发表
    测试
    Qwen3-235B、Qwen3-Coder-30B、gpt-oss-120B 等 6 个
    摘要PatchHolmes 用混合检索和列表式四工具智能体做补丁检索,增益主要来自联合阅读候选而非更换骨干。

    PatchHolmes 是面向补丁检索的两阶段系统:在本地 Git 仓库上用冻结开源权重模型,为一个已知 CVE 找出修复提交,不做按仓库微调,也不使用付费外部搜索 API。

    深度解读完整解读
  5. 其他arXiv 2609.23954

    Djinnlang:用 LLM 编译器实现无歧义规格的高级编程

    提出 Djinnlang,以无歧义规格约束 LLM 的实现并由 Dafny 核验

    发表
    测试
    Claude Fable 5.1 (Claude Code)、GPT 6 Astra (Codex)
    摘要无歧义规格加验证器,使 LLM 成为可丢弃代码的编译阶段。

    Djinnlang 让程序员只写规格,把 LLM 放进编译器,并用 Dafny 验证器加上无歧义约束钉住语义。

    深度解读完整解读
已经到底了