Redwood Research 发布论文,实证检验两种以知识蒸馏服务 AI 安全的思路。蒸馏取证(DFI)将不可信模型蒸馏进更弱、可信的学生模型,意在传递教师的失准而不传递其隐藏失准的能力,再通过审计学生来指证教师;蒸馏取能力(DFC)则只迁移能力、抑制不对齐倾向。研究者在 AuditBench 的秘密保守模型上测试:这些模型基于 Llama-3.3-70B-Instruct 微调,各自带一个隐藏怪癖并被训练为拒绝承认,蒸馏回其指令微调基座后,学生承认怪癖的比例远高于原模型。
Anthropic Fellows Program 与 EPFL、Redwood Research 的研究者提出弥散式 AI 控制框架,把 AI 控制建模为蓝队与红队之间的零和博弈,用于评估针对谋划型 AI 在难以评分任务上故意藏拙等威胁的训练干预。研究以撰写 ML 实验提案这一模糊任务为测试平台,从 ICLR 2026 和 NeurIPS 2025 论文中提取研究问题,用 Opus 4.6 生成提案、Sonnet 4.6 作为真值代理评分器、Haiku 4.5 作为弱评分器。通过多目标进化提示词优化,红队找到让 Opus 4.6 的提案被真值代理评为差于 GPT-OSS-20B、却在弱评分器上接近最优的提示词,这类行为在针对弱分数微调后可能仍会保留。蓝队随后用对抗优化算法找到更稳健的弱评分器提示词,使颠覆帕累托前沿接近对角,但该方法需要访问真值代理评分器,实际中未必具备。
澳大利亚联邦政府 AI 安全研究所与 CSIRO 研究人员合作发布报告,提出一套识别和抑制 AI 系统“隐性信念操纵”的框架。报告认为,现有安全评估无法识别 AI 语言模型如何操纵人类并影响重大决策,支持联邦政府现行指南,同时指出 AI 系统需要得到更好的评估。澳大利亚 AI 安全研究所与 CSIRO 还发布报告《可扩展监督中的认知安全》,提出认知安全概念,主张评估 AI 交互不能只看被监控任务是否给出正确答案,还要看其解释、框架和呈现方式如何影响监督者的信念。该报告提出理论框架 Strategic Interactive Oversight(SIO),把被监控任务与系统可能追求的隐藏目标分离,并以带交叉质询的辩论作为案例研究;受控实验中,较弱监督角色由 AI verifier 承担。