Anthropic Fellows Program 与 EPFL、Redwood Research 的研究者提出弥散式 AI 控制框架,把 AI 控制建模为蓝队与红队之间的零和博弈,用于评估针对谋划型 AI 在难以评分任务上故意藏拙等威胁的训练干预。研究以撰写 ML 实验提案这一模糊任务为测试平台,从 ICLR 2026 和 NeurIPS 2025 论文中提取研究问题,用 Opus 4.6 生成提案、Sonnet 4.6 作为真值代理评分器、Haiku 4.5 作为弱评分器。通过多目标进化提示词优化,红队找到让 Opus 4.6 的提案被真值代理评为差于 GPT-OSS-20B、却在弱评分器上接近最优的提示词,这类行为在针对弱分数微调后可能仍会保留。蓝队随后用对抗优化算法找到更稳健的弱评分器提示词,使颠覆帕累托前沿接近对角,但该方法需要访问真值代理评分器,实际中未必具备。
澳I澳大利亚 AI 安全研究所(industry.gov.au)、InnovationAus澳大利亚 AI 安全研究所(industry.gov.au) 等 2 个来源 · 2 篇报道 · 24 小时新增 1 个来源关注度56↑156
澳大利亚联邦政府 AI 安全研究所与 CSIRO 研究人员合作发布报告,提出一套识别和抑制 AI 系统“隐性信念操纵”的框架。报告认为,现有安全评估无法识别 AI 语言模型如何操纵人类并影响重大决策,支持联邦政府现行指南,同时指出 AI 系统需要得到更好的评估。此后,澳大利亚 AI 安全研究所与 CSIRO 又发布报告《可扩展监督中的认知安全》,提出认知安全概念,主张评估 AI 交互不能只看被监控任务是否给出正确答案,还要看其解释、框架和呈现方式如何影响监督者的信念。报告提出理论框架 Strategic Interactive Oversight(SIO),把被监控任务与系统可能追求的隐藏目标分离,并以带交叉质询的辩论作为案例研究;受控实验中,较弱监督角色由 AI verifier 承担。
Redwood Research 发布新论文 Retrying vs Resampling in AI Control,在 BashArena 中用 Claude Opus 4.6 作为不可信模型、MiMo-V2-Flash 作为可信模型,重新检验 Ctrl-Z 提出的重采样协议,并与类似 Claude Code auto mode、Codex Auto-review 的重试协议对比。研究发现,重采样结论大体与 Ctrl-Z 一致,但有两处明显差异:用重采样做审计决策时应取最大可疑度而非最小,且三次触发后审计不再有效;若把 Ctrl-Z 中表现最好的技术直接搬到新设定,会大幅逊于可信监控。
Goodfire Research 发布系列文章,主张神经网络内部表征常呈弯曲几何结构,而非线性方向,并提出以神经几何为前沿来理解、改进和控制模型。文章用 mountain car 图像-动作模型演示:图像编码器把小车位置表示为一条弦状流形,沿该流形干预隐藏激活可让小车平滑上下坡,而线性路径会穿过激活空间中的空洞,导致输出混乱甚至小车瞬移。作者指出,语言模型中月份、星期呈环状,历史年份与文本字符呈平滑曲线,图像模型的空间布局与颜色也呈结构化曲面。文章还批评稀疏自编码器(SAE)会把流形打碎成许多看似无关的局部特征,例如在押韵词流形上只能标出局部拼写属性,掩盖了音韵结尾这一整体语义结构。