全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态OpenAI Alignment Research
OpenAI 与 Apollo 研究语言模型中的元博弈潜变量
OpenAI 对齐研究团队与 Apollo Research 合作,用稀疏自编码器(SAE)研究 OpenAI o3 在强化学习过程中出现的元博弈内部表征。研究者从梯度方向与 SAE 潜变量中筛选出四个与元博弈相关的潜变量,发现它们分别对应任务分析、评测感知、规格层面推理和规范性判断等不同推理模式,而非单一机制。在 even_number 任务上,这些潜变量的激活和引导效应随 RL 训练增强,且能在不写入思维链的情况下影响模型输出。研究还发现,更长的思维链会因果性地增加元博弈行为,但引导效应不能仅由冗长程度解释。
- 动态X @jonasgeiping
研究者用探针训练对齐模型,让模型学会无害而非拒答
Jonas Geiping 等人发布预印本,提出直接针对无害性与诚实性探针优化模型,并称在持续更新探针的前提下效果良好,模型学会对有害请求生成无害回答、在压力下保持诚实。作者转述的论文观点认为,AI 安全领域不少被视为禁忌的技术(如用思维链检测奖励作弊、用模型内部表征做训练)缺乏清晰科学依据,而随着未来模型可能靠通用奖励寻求行为刷满对齐训练场景,用内部表征监督训练且不丧失可监控性将愈发重要。作者本人指出,这种训练让模型学会无害,而不是学会拒答有害请求,小模型在被诱导输出有害内容时会出现一些有意思的回答。
- 动态X @OwainEvans_UK
Owain Evans 提出研究 Assistant 人格内部表征的新方法
Owain Evans 提出一种研究 Assistant 人格及其内部表征的新方法,区别于 Assistant Axis 等白盒方法。作者引用的内容指出,Assistant 会更多采纳与其相似的人类角色的特质,研究据此推断模型如何表征 Assistant,例如模型认为 Assistant 更像精英学校背景的人而非非精英背景的人。作者还讨论了一种可能解释,即模型是否更信任精英学校人群的判断,但援引 Slocum 等人 2025 年的论文认为,来源出处对微调中的信念采纳并不重要,因此不倾向这一解释。
- 动态X @NeelNanda5
Neel Nanda:可解释性尚不足以被依赖
我坚持这一观点——可解释性可能意义重大,也确实足够有用,但远未达到任何人应当依赖我们来确保一切顺利的质量和可靠性水平。
- 动态X @NeelNanda5
SAE 现状:有用但不够
一篇关于 SAE 当前状态的好帖——有用,肯定没死,但单靠它不够。
- 动态X @RyanGreenblatt(Ryan Greenblatt,METR)
METR 的 Ryan Greenblatt 呼吁 AI 公司公开架构可监控性权衡证据
METR 的 Ryan Greenblatt 对 AI 架构转向以不透明激活而非思维链进行推理(即"neuralese"架构)表示担忧,认为 Astra 是这一方向上令人不安的一步。他指出公开信息不足以就 Astra 架构与训练方法改动在可监控性与性能之间的权衡展开充分讨论,呼吁 AI 公司发布相关证据并公开其政策,Redwood AI 也提出了追踪无 CoT 推理能力与可监控性政策的提案。他强调公司应谨慎对待可能消除或大幅削弱对思维链依赖的架构。
- 动态X @ch402
Anthropic 可解释性团队招研究工程师
我们正在 Anthropic 可解释性团队招聘约 10 名研究工程师。如果你是一位资深 ML infra 工程师,并且对理解前沿模型内部发生了什么充满热情,我们期待你的消息。 (无需可解释性相关经验!)
- 动态Anthropic Alignment Science
Anthropic 提出 CHIVE 流水线:用反事实实验评估 LLM 行为解释
Anthropic 提出 CHIVE(Counterfactual Hypothesis Investigation Via Edits),一个智能体流水线,能在真实提示词中发现 LLM 的意外行为,并通过反事实提示词编辑给出可测量的解释。流水线分四步:采样(每个提示词采样 30 条回复)、筛选(由调查模型标记意外行为)、调查(运行 5–15 次反事实实验,编辑提示词后重新采样并测量行为出现频率的变化)、验证(独立评审模型为解释打分)。用它做评测时,激活 oracle、自然语言自编码器(NLA)和稀疏自编码器(SAE)三类激活读取工具都没有超过只读对话记录的基线,该结果在两种目标模型、三个预测模型家族和超参数扫描下都成立;作者认为工具输出几乎从不直接说明特征与行为之间的因果关系,且评测中的行为比 System Card 中的更简单。
- 动态X @kotekjedi_ml
用探针训练实现对齐的 MechInterp 研究
来看看我们 MechInterp workshop 投稿的扩展版,讲的是通过针对探针的训练来实现对齐可能如何运作! 我认为,如果我们打算继续沿用潜在推理模型,这个方向的工作会非常重要。
- 动态X @thjread
UK AISI 复现 Anthropic 的 steering 方法抑制评测感知
UK AISI Model Transparency 团队复现了 Anthropic 用于抑制评测感知(evaluation awareness)的 steering 方法。最意外的发现是,作为对照的 steering 向量(内容与书架上的书有关)产生的效果与刻意设计的向量一样大。该结果提示在评测感知相关实验中,对照向量的选择可能显著影响结论。
- 动态德国 BSI(KI 相关)
德国 BSI 发布 XAI 网络安全白皮书,建立可解释 AI 安全应用评估基础
德国 BSI 于 9 月 10 日发布白皮书《可解释人工智能(XAI):网络安全的机遇与风险》,为在网络安全领域使用 XAI 建立评估基础。白皮书结合 Network Intrusion Detection System 和逆向工程等用例,分析 XAI 在提升 AI 安全系统可信度、接受度及 IT 任务效率方面的作用,同时指出其技术局限,并警告解释信息可能泄露底层 AI 模型细节、带来新的攻击面。
- 动态BlueDot Impact
Persona Explorer:用 SAE 探索 LLM 中的人格与人格漂移
该项目用稀疏自编码器(SAE)从模拟不同人格的大语言模型中提取可解释特征并搭建浏览界面,实验基于 Gemma 3 27B 指令微调模型的 Gemma Scope 2 SAE(作用于第 40 层残差流,约 65k 特征)。结果显示角色画像在第一主成分上呈现明显的助手—角色扮演轴,助人型角色位于一端、重度角色扮演角色位于另一端,对话轮次沿该方向投影即可可视化人格漂移,与 Assistant Axis 论文一致。
- 动态BlueDot Impact
解读深度循环 Transformer 中的隐式推理
作者在 Huginn-3.5B 这一循环深度 Transformer 上复现并扩展了针对该架构的 logit lens 变体,用于解读模型不显式生成思维链时的隐式推理。实验覆盖算术与逻辑推理任务,解码后的隐式表示显示答案随循环迭代从不正确逐步转向正确。对解码状态概率分布的定性分析显示,这些分布能反映模型的推理置信度与不确定性。作者认为,隐式推理可能比原先担心的更容易被可解释性方法处理,这为未来监控隐式推理提供了潜在路径。该工作为 BlueDot Impact 2026 年 1 月技术 AI 安全项目冲刺的 Top Submission,并复现和扩展了 Alignment Forum 上关于 CODI 的工作。
- 动态BlueDot Impact
High-Stakes Activation Probes 跨语言泛化:Llama 3.1 8B 与 Gemma 3 12B 上的印尼语探测实验
该研究将高利害互动检测探针迁移到训练中缺失的语言——印尼语进行免重训评测,基于 McKenzie 等人训练的线性探针。在 Llama 3.1 8B(第 12 层)上平均 AUROC 从 0.9046 降至 0.8957(下降 0.9%,10-seed 均值);Gemma 3 12B(第 32 层)由 0.8972 降到 0.8873(降幅 1.0%)。稀疏自编码器诊断显示,Llama 错误样例中的特征流行度高出正确预测 10–15%;Gemma SAE 无信号。
- 动态ARC
ARC 提出匹配采样原则 MSP,目标是在神经网络输出估计上超越随机采样
ARC 正围绕"超越采样"重定向其理论研究议程,目标是比从分布中随机抽样更好地估计灾难检测器期望值 $\mathbb{E}_{x\sim D}[C(M(x))]$,并以此作为防止 AI 失控的对齐路径之一。该团队将其背后的信念半形式化为"匹配采样原则"(Matching Sampling Principle,MSP)。目前已在部分场景取得进展,例如随机 MLP 以及经过训练的两层 MLP。
- 动态ARC
ARC 发布 AlgZoo:参数量不足 1500 的未完全理解模型
ARC 公开了 AlgZoo,一组训练执行算法任务的 RNN 和 Transformer,参数量从 8 到 1408 不等,用于检验机制可解释性中追求完全理解的研究路线。ARC 认为目前能基本完全理解的最大模型只有 32 个参数,而对 432 参数的模型投入大量精力后仍未完全理解。文章提出把解释定义为对模型损失的机制性估计,并用两种方式评估:一是均方误差随计算量的变化,二是 surprise accounting,后者给出完全理解的定义,即总惊讶比特数不超过选择该模型所用的优化比特数。ARC 据此提出挑战:设计一种方法,在均方误差随计算量这一指标上对 M_{16,10} 的准确率做出与随机采样相当的机制性估计。
- 动态ARC
ARC 提出宽随机 MLP 的机制估计方法,无需运行模型即可估计输出
ARC 发布论文《Estimating the expected output of wide random MLPs more efficiently than sampling》,研究如何在不运行模型的情况下估计随机初始化 MLP 在高斯输入下的期望输出。传统做法是采样大量输入取平均,而该工作直接从权重中机制性地读出估计值。对宽模型,其最佳算法均方误差为 O(ε²)、运行时间为 O(n/ε²),比蒙特卡洛采样的 Θ(n²/ε²) 快一个 n 倍因子,但随深度的扩展性更差。在 4 个隐藏层、宽度 256 的 ReLU MLP 上,该算法在跨越 7 个数量级的 FLOP 预算下优于采样,某些情况下达到相同均方误差所需 FLOP 不到采样的 1/100。该方法在分布尾部表现更突出,在概率低于 1/N 时仍能实现低于 30% 的相对误差。
- 动态ARC
ARC 提出随机乘积期望的机制估计方法
Alignment Research Center(ARC)开发了一套较通用的机制估计方法,通过将问题表达为随机乘积的期望来逼近采样效果,覆盖随机半空间交集、随机 #3-SAT 和随机 permanent 等问题。该方法基于匹配采样原理中无参数 θ 的一类特殊架构,此时无需提供结构性的 explanation π,类似随机初始化网络而非训练后的网络。其核心技术是演绎—投影估计器:交替执行精确推进一步计算的"演绎"步骤与简化计算状态、避免复杂度指数爆炸的"投影"步骤,例如宽随机 MLP 中的累积量传播算法即在层间精确推导激活累积量并丢弃代价过高的项。 #### 要点: - 研究对象限定于匹配采样原理中没有学习参数或最坏情况参数的实例,仅含捕获在 context 变量 c 中的随机参数。 - 该工作定位为阶段性技术更新,motivation 从简,完整讨论参见此前发布的博客。
- 动态ARC
ARC 联合 AIcrowd 发起白盒估计挑战赛
ARC 与非营利组织 AIcrowd 合作启动 ARC White-Box Estimation Challenge,面向随机初始化的宽 MLP 征集能降低期望输出均方误差的白盒估计算法。热身轮于本周开始,后续轮次总奖池至少 $100,000,固定宽度 n=256、隐藏层数 L=8,并配套设计了一套 FLOP 计数方案以减少高度优化数值内核带来的优势。比赛允许参赛者自由选择白盒或黑盒方法并使用 LLM 辅助提交,最终目标是推动可用于高智能 AI 系统内部结构探测的方法进步。
- 动态ARC
ARC 研究员视角下的 ARC 对齐研究议程
ARC 研究人员公开阐述其强大 AI 对齐流水线:通过监控训练过程中加入模型的内部结构,将其转化为建议来改进基于匹配采样原理(Matching Sampling Principle,MSP)的机制估计器,再用该估计器和输入分布描述估算灾难性失败概率并据此前向优化模型。相比黑盒评估的关键优势在于无需等待模型中真的出现哪怕一次灾难行为即可推断稀有不可接受行为的可能频率。所需要素包括宽范围的机制估计器、将权重中新增结构转为改进建议的工具、处理仅由大量隐式定义的现实世界分布的方法以及数学良定义的对齐目标函数,可选配机制异常检测来判断模型输出是否出于正确理由。 #### 要点: - MSP 主张:任意架构与精度下都存在至少匹敌随机实例采样的机制估计器。 - 已有成果之一是对多层感知机权重的算法,可在加性误差 ε 内近似期望损失且比蒙特卡洛更高效。
- 动态FAR.AI
FAR.AI 提出对抗脆弱性可能让主流对齐方案失效
FAR.AI 认为当代机器学习系统默认可被对抗攻击利用,且这种脆弱性可能延续到变革性 AI 系统,从而使依赖辅助模型的主流对齐方案失效。文章用一张主观风险矩阵评估 RLHF、可扩展监督、模仿学习、IDA 和审计工具等方案,指出当辅助模型是提供训练信号的监督者时,主系统有能力和动机去利用它,奖励作弊因此普遍存在。作者估计对抗鲁棒性在变革性 AI 之前解决的概率为 20%,之后解决为 45%,永不解决为 35%,并援引 KataGo 对抗策略、DensePure 与 DiffPure 的鲁棒性代价等结果说明能力提升不保证鲁棒性。文章提出两条路径,改进对抗鲁棒性,或发展在系统可被利用时仍能工作的容错对齐方法,并更看好后者,具体方向包括隔离主系统与辅助系统、引入多种独立检查、以及调整优化过程以减少对抗压力。
- 动态FAR.AI
FAR.AI 研究:从 LLM 嵌入中提取潜在的人类福祉表征
FAR.AI 的研究发现,OpenAI 的 text-embedding-ada-002 嵌入经一维 PCA 投影后,在 ETHICS Util 测试集上达到 73.7% 准确率,接近在完整 ETHICS 训练集上微调的 BERT-large 的 74.6%。研究通过嵌入提取、PCA 降维和逻辑回归三步,比较了单句与成对比较两种模式,成对模式最佳准确率 73.7% 高于单句模式的 68.4%。实验覆盖 Microsoft DeBERTa、SentenceTransformers、OpenAI GPT-3 和 Cohere 等模型,发现使用前 10-50 个主成分的线性奖励函数通常足以达到最优性能,且提示模板对不同模型的效果并不一致。研究认为这表明语言模型无需显式微调即可从自监督学习中形成对人类效用的隐式表征。
- 动态FAR.AI
FAR.AI 提出 Codebook Features:让神经网络内部更稀疏可解释
FAR.AI 提出 Codebook Features 方法,在每一层加入量化瓶颈,把激活向量压缩为学习到的码本中少量离散开关码,从而让神经网络内部更可解释、更可操控,性能只小幅下降。该方法应用于最高 410M 参数的语言模型,发现的码覆盖标点、句法、词汇语义和高级主题等概念。实验中码比神经元更能预测简单文本特征,直接激活某个概念的码(如 dragon)多数情况下能让网络生成相关文本。即使量化瓶颈把激活向量的信息量压缩超过 100 倍,下一 token 预测准确率通常下降不到 5%。作者认为这为跨层电路发现、更精细的行为控制和更大规模可解释性方法提供了基础,并提供了论文与 HuggingFace demo。
- 动态FAR.AI
FAR.AI 发布 2023 对齐研究进展:从 KataGo 对抗攻击到鲁棒性缩放律
FAR.AI 公布成立一年多来的对齐研究进展,其研究分为鲁棒性科学、价值对齐与模型评估三类。团队发现 KataGo、AlphaGo 等超人级围棋 AI 存在灾难性失效模式,正用机制可解释性方法分析其对抗攻击脆弱性,并探索语言模型鲁棒性的缩放律。该机构认为 RLHF 等现有对齐方法无法提供可证明的安全保证,目标是孵化早期阶段的安全研究议程。