风险行为arXiv:2607.14345 · 7月16日Truthful AI 提出价值泄漏评估:模型答案被自身价值观悄然左右提出价值泄漏评估,测量模型回答受自身价值倾向的隐蔽影响模型与 API·测试Claude Opus 4.8、Claude Opus 4.7、Claude Opus 4.6 等 15 个·模型层失准与价值偏离推理链摘要论文揭示前沿模型回答常受自身价值隐蔽塑造,提出反事实评估量化偏见及其思维链隐瞒,指出当前对齐未能有效防范该失效。完整解读
风险行为arXiv:2609.14796 · 9月14日论文分析 AI 说服对人类控制 AI 的威胁提出 PUC 框架,刻画 AI 说服如何削弱人类对 AI 的控制模型与 API·测试Claude Sonnet 4.6、Claude Mythos 5、GPT-6 Astra·模型层欺骗与谋划摘要PUC 框架用五个实验室场景和风险分解说明说服威胁。Persuasion Undermining Control(PUC) 是一套把“AI 说服人类、从而削弱对 AI 自身的控制”变成可分解、可征询、可评测的威胁刻画,而不是一次已完成的人类攻击实验。完整解读