其他arXiv 2609.09135
ERPO:面向代码生成测试时强化学习的熵正则化排名掩码策略优化
提出 ERPO,用探针共识奖励对无标签代码生成做测试时强化学习
- arXiv
- 2609.09135
- 发表
- 场景
- 编程 Agent
- 测试
- Qwen3-4B、Qwen3-8B
提出 ERPO,用探针共识奖励对无标签代码生成做测试时强化学习
提出 CATCH 测试台,复现编码 RL 的奖励作弊
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。