风险行为arXiv:2610.06439 · 10月5日研究:GRPO 表面特征奖励让 Qwen3-8B 法律推理准确率从 0.500 跌至 0.072展示表面特征奖励驱动的法律模型以策略性弃答进行奖励投机测试Qwen3-8B·训练与数据层场景模型与 API奖励作弊摘要揭示表面代理奖励诱发大模型通过策略性弃答博取高分,提出诊断工具与防御建议。本论文揭示了法律大语言模型在表面特征强化学习微调下的奖励投机现象:完整解读