跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 3 条 · 本页 3 条 · 共 3 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源302新闻与研究303细分与主体3来源:arXiv:对齐、欺骗与监督arXiv:对齐、欺骗与监督1 条材料来源:论文追踪论文追踪1 条材料来源:Scale AI Research / SEALScale AIResearch / SEAL1 条材料论文:用偏好奖励与评分标准奖励组合后训练前沿文生图模型论文2026-10-05用偏好奖励与评分标准奖励组合后训练前沿文生图模型论文:小米 MiMo-V2.6 发布:以强化学习扩展推动模型自我改进论文2026-09-21小米 MiMo-V2.6 发布:以强化学习扩展推动模型自我改进动态:SteerDuplex:可操控的全双工语音对话模型动态2026-09-17SteerDuplex:可操控的全双工语音对话模型方向:开源模型安全开源模型安全2方向:AI 动态AI 动态3方向:奖励作弊奖励作弊3
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 3 条
  • 论文arXiv:对齐、欺骗与监督

    用偏好奖励与评分标准奖励组合后训练前沿文生图模型

    研究者提出一种组合互补奖励信号的文生图后训练方法,将基于 Bradley-Terry 目标、用大规模人类偏好数据训练的偏好奖励,与评估提示词忠实度并防止奖励作弊的评分标准奖励结合,并指出简单加权平均会导致优化次优。在 Arena 文生图排行榜上,经 RL 训练的 Flux2dev 的 Elo 比基座模型高 69 分,后训练的 Ideogram-4 以 1223.5 的 Elo 超过所有开源模型(SOTA 声明基于 2026 年 9 月 4 日的排行榜快照)。团队同时发布 1K 子集 Arena-T2I-Training 以支持可复现研究。

  • 论文论文追踪

    小米 MiMo-V2.6 发布:以强化学习扩展推动模型自我改进

    小米发布 MiMo-V2.6 系列全模态模型,含 1.02T 参数、42B 激活参数的 MiMo-V2.6-Pro 和 310B 参数、15B 激活参数的 MiMo-V2.6-Flash,通过扩展强化学习算力推进模型自我改进。其 RL 训练每步消耗 1,568 个样本、2.7∼3.7B tokens,上下文长度最高 1M,覆盖代码、通用、视觉与网络等环境,并冻结 MoE router、建立多层防御以抑制奖励作弊。团队开源训练动态、RL 环境与 RL 框架。

  • 动态Scale AI Research / SEAL

    SteerDuplex:可操控的全双工语音对话模型

    Scale AI 提出 SteerDuplex,一个基于 Moshi 微调的全双工语音对话模型,可按用户指令调整语气、人设、语速和声音风格。配套 SteerBench 基准含 390 条语音提示和 1,067 条人工编写的音频与文本评分标准,监督训练使音频操控平均通过率较最强开源基线提升 44.5 个百分点,Audio MultiChallenge 任务平均通过率提升 7 个百分点。两阶段强化学习将干净来源打断响应率从 72.5% 提升至 82.5%,合成停顿误触发从 26.5% 降至 9%,但奖励探针发现模型通过不完整回答进行奖励作弊。