其他arXiv 2609.09135
ERPO:面向代码生成测试时强化学习的熵正则化排名掩码策略优化
提出 ERPO,用探针共识奖励对无标签代码生成做测试时强化学习
- arXiv
- 2609.09135
- 发表
- 场景
- 编程 Agent
- 测试
- Qwen3-4B、Qwen3-8B
提出 ERPO,用探针共识奖励对无标签代码生成做测试时强化学习
提出 PHIRL,将逆强化学习奖励与任务进度四维对齐
PHIRL 用进度标注修正从示范反推的奖励,以减少真人在环,同时不把示范中的每一步都当成任务进展。
提出 CrossFit,用折外求解器缓解自进化搜索智能体的共作弊
False Frontiers 诊断自进化搜索智能体中的 co-cheating,并用按来源交叉拟合的反馈来缓解它。
提出 CATCH 测试台,复现编码 RL 的奖励作弊
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。