Preference Model 发布 Karotte 技术详解:RL 环境如何封堵奖励作弊
Introducing Karotte: A Framework for Building Robust RL Environments
AI 导读
Preference Model 开源 Karotte 框架,用于构建稳健的强化学习环境,默认阻止整类奖励作弊。文章先用约 40 行手写代码搭建 CSV 订单求和任务,逐一展示读答案文件、工具无超时、评分脚本被符号链接或 FIFO 欺骗、PATH 注入等失效模式,再给出 Karotte 的对应做法。Karotte 让 agent 以非特权 student 用户运行,答案与生成代码放在 root-only 目录,防火墙阻断外网,bash 工具带超时和输出截断,评分前 collect_submission 先杀死并确认所有 student 进程、拒绝符号链接和特殊文件、把提交复制到 root-only 目录,评分脚本用环境自身的 Python 运行。
推荐理由
Karotte 用默认配置防御读答案、篡改评分、耗尽资源等奖励作弊,并给出与其他五个框架的默认防护对比。
阅读原文