跳到正文
10月8日 · 周四

奖励作弊 · 论文

找到 5 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 64 篇还没打标签,不在筛选结果里。

另有 39 篇还没有研究类型,暂不在这些分类里。

  1. 综述/立场arXiv:2609.12039 ·

    现实才是最终验证者:智能体软件工程的两大关键缺口

    作者用双缺口框架统一智能体软件工程中的奖励投机与幻觉,主张靠外层保证—修订环持续收窄缺口。

    摘要双缺口解释内环为何会放行部署后不可接受的实现,外环用现实证据持续修订 R、M 与 E。

    Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。

    完整解读
  2. 其他arXiv:2609.22978 ·

    DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施

    AI 导读DeepSeek 发布生产级沙箱平台 DSec,通过统一 SDK 提供 FnCall、容器、microVM 和 full-VM 四类沙箱后端,并与强化学习框架协同设计,将带状态的 rollout 执行与可抢占的 GPU 训练解耦,同时缓解奖励作弊等智能体失范行为。

    摘要DSec 是面向大规模智能体 RL 的多后端生产沙箱,用分层、按需镜像和训练协同维持高密度。

    DSec 是 DeepSeek-AI 的生产沙箱平台,用来支撑从 DeepSeek V3.2 到 V4.1 的智能体 RL 与评测,而不是报告某个模型的任务准确率。

    完整解读
已经到底了