风险行为arXiv:2610.09371 · 10月7日研究提出 Confidence Game 模型测量委托收费激励下模型策略性虚报任务信心模型与 API·测试gpt-oss-120b·模型层欺骗与谋划摘要论文建立人机委托信誉博弈框架,揭示模型策略性虚报置信度且主要造成信息破坏,作者指出校准受制于报告意愿。完整解读
风险行为arXiv:2610.08670 · 10月7日研究:后训练配方决定大模型是否违背自身道德判断行事提出知行差距面板,测量压力下模型是否违背自身判断模型与 API·测试OLMo-3-7B-Instruct、Llama-3.1-8B-Instruct、Tulu 3 等 7 个·模型层失准与价值偏离摘要评估发现后训练配方决定知行差距是否存在,行动前审思可有效缓解。本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。完整解读
风险行为arXiv:2610.06576 · 10月5日研究:智能体欺骗行为在外部显现前已可从内部表征预测提出决策前表征检测与激活引导,预测并抑制智能体欺骗AI Agent·测试Qwen3-14B、GPT-5.6·模型层欺骗与谋划监控器摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。完整解读
风险行为arXiv:2607.14345 · 7月16日Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响模型与 API·测试Claude Opus 4.8、Claude Opus 4.7、Claude Opus 4.6 等 15 个·模型层失准与价值偏离推理链摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。完整解读
风险行为arXiv:2609.06649 · 9月6日用迭代 DPO 从奖励作弊中诱发涌现失准用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装AI Agent·测试GPT-4.1、Qwen2.5-32B-Instruct、GPT-4.1-mini 等 7 个·模型层失准与价值偏离+1+1摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。完整解读
防御arXiv:2609.21996 · 9月19日PIR:从模型内部激活读出被隐藏的答案提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘模型与 API·测试gemma-2-9b、gemma-3-12b、Qwen2.5-7B 等 9 个·模型层监控与审计欺骗与谋划监控器摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。完整解读