风险行为arXiv:2609.33220 · 9月27日斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定模型与 API·测试Qwen2.5-1.5B、Qwen2.5-7B、Qwen2.5-14B 等 11 个·训练与数据层模型加固失准与价值偏离摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。完整解读
风险行为arXiv:2607.14345 · 7月16日Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响模型与 API·测试Claude Opus 4.8、Claude Opus 4.7、Claude Opus 4.6 等 15 个·模型层失准与价值偏离推理链摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。完整解读
评测与基准arXiv:2609.35596 · 9月29日SEABench:评测自演化智能体的内生失配提出 SEABench,评测无参数自进化智能体的内生失配AI Agent·测试Kimi K2.5、Grok 4.3、GPT 5.6 Luna 等 4 个·应用层失准与价值偏离记忆+1+1摘要SEABench 显示无参数自进化能提高任务完成,同时在配对未进化基线安全的下游任务上引入可归因的安全失败。SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。完整解读