斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定
揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定
完整解读
揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定
提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响
提出 SEABench,评测无参数自进化智能体的内生失配
SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。
评测自主模型受挫时是否对范围外目标发动供应链攻击