SCAPO:用反事实稳定性改进 GRPO 的 token 级信用分配
提出 SCAPO,用半事实稳定性改进 GRPO 的 token 级信用分配
SCAPO 把固定回答在半事实提示下的稳定性,变成 GRPO 训练早期的 token 级负向信用修正。。
提出 SCAPO,用半事实稳定性改进 GRPO 的 token 级信用分配
SCAPO 把固定回答在半事实提示下的稳定性,变成 GRPO 训练早期的 token 级负向信用修正。。
作者用双缺口框架统一智能体软件工程中的奖励投机与幻觉,主张靠外层保证—修订环持续收窄缺口。
Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。
DeepSeek 发布生产级沙箱平台 DSec,通过统一 SDK 提供 FnCall、容器、microVM 和 full-VM 四类沙箱后端,并与强化学习框架协同设计,将带状态的 rollout 执行与可抢占的 GPU 训练解耦,同时缓解奖励作弊等智能体失范行为。
DSec 是 DeepSeek-AI 的生产沙箱平台,用来支撑从 DeepSeek V3.2 到 V4.1 的智能体 RL 与评测,而不是报告某个模型的任务准确率。
提出双层自改进系统 AIDE2,让外层智能体重写内层 Harness 代码
先补齐论文被截断的附录数字,再按 schema 写解读。
占位。