跳到正文
10月8日 · 周四

思维链监控 · 论文

找到 1 篇
筛选1

模型自身风险

防御类型

影响

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 40 篇还没打标签,不在筛选结果里。

另有 40 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv:2609.33220 ·

    斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定

    揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定

    模型与 API测试Qwen2.5-1.5B、Qwen2.5-7B、Qwen2.5-14B 等 11 个训练与数据层

    摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。

    完整解读
已经到底了