跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.09135· Jiacheng Xu·· 23 天前

ERPO:面向代码生成测试时强化学习的熵正则化排名掩码策略优化

Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation

AI 导读

针对代码生成中程序无法按表面形式比较、答案级自投票无法提供训练信号的问题,研究者提出探针驱动的 TTRL,用问题陈述构造无输出探针输入,执行候选程序并依据行为一致性定义 Probe Consensus Reward(PCR)。由于 PCR 并非可靠验证器、易受虚假共识导致的奖励作弊影响,进一步提出 Entropy-Regularized Rank-Masked Policy Optimization(ERPO),通过排名掩码将低 PCR 转为保守负更新,并用熵上限控制策略漂移。在代码基准上,ERPO 在域内适配与零样本迁移中均显著提升 pass@1 与 pass@k,论文已被 EMNLP 2026 主会接收。

阅读原文arxiv.org