其他arXiv 2609.09135
ERPO:面向代码生成测试时强化学习的熵正则化排名掩码策略优化
提出 ERPO,用探针共识奖励对无标签代码生成做测试时强化学习
- arXiv
- 2609.09135
- 发表
- 场景
- 编程 Agent
- 测试
- Qwen3-4B、Qwen3-8B
提出 ERPO,用探针共识奖励对无标签代码生成做测试时强化学习
提出双缺口框架统一智能体软件工程的奖励投机与幻觉
Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。
提出双层自改进系统 AIDE2,让外层智能体重写内层 Harness 代码
摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。