研究用 GRPO 强化晶体生成模型,mSUN 从 13.4% 升至 45.5% 并暴露奖励作弊
Reinforcement Learning on the Discrete Composition Channel of a Crystal Generator: Validated Gains and Reward Hacking
AI 导读
研究者用组相对策略优化(GRPO)对基于随机插值与离散流匹配的晶体生成模型做强化学习,使其对齐通用黑盒奖励函数。原子类型由离散流生成,GRPO 的推广形式直接作用于原子类型转移的似然,这与以往针对扩散和流式晶体生成模型的强化学习方法不同。新奖励函数把亚稳、独特且新颖结构(mSUN)的产率从预训练模型的 13.4% 提升到强化后模型的 45.5%,该结果由社区基准评测;同一奖励也提升了基于隐空间去噪扩散模型的晶体材料强化学习框架的表现。研究同时发现,直接强化原子类型转移似然会带来奖励利用问题,需要显式防护措施加以阻止。分析还指出社区指标存在缺口:不同堆积方式的单元素结构会被计为亚稳、独特且新颖材料,从而抬高 mSUN 却不产生任何新化合物。