全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
研究用因果审计揭示多模态模型视觉工具调用的假象
研究者对多模态大语言模型的“thinking-with-images”范式做因果审计,发现视觉工具调用带来的准确率提升并非普遍来自返回的视觉证据。作者把视觉工具使用建模为因果图,区分观察中介路径与动作引发的捷径,并在策略、轨迹、步骤三个层面做干预,其中步骤层面的 Visual Evidence Gain 用于分离单次返回观察的贡献。在六个代表性模型和五个细粒度感知基准上,审计发现两类失败模式:Calling Without Looking 中返回的观察对答案没有因果影响,Looking Without Planning 中观察有信息但调用时序不连贯。轨迹层面的诊断显示,策略层面的准确率增益集中在少数校准良好的样本上,作者将这种总体增益与因果无效并存的现象称为视觉工具使用的假象。代码已公开,论文被 EMNLP 2026 Findings 收录。
- 论文论文追踪
TULIP:按输入定位层级的定向大模型遗忘方法
研究者提出 TULIP,一种按输入定位层级的表示层遗忘方法,用于从大语言模型中移除指定知识。作者先做劫持实验,把目标模型的隐藏状态移植到只在保留集上训练的 oracle 中,oracle 本身无法生成遗忘答案,却能依据移植状态输出该答案,说明答案在中间层形成、之后只是被读出,遗忘应针对形成环节而非读出环节,且形成结束的层在不同输入间差异很大。TULIP 对每个输入用 logit lens 定位形成与读出的边界,在该处移除隐藏状态与遗忘答案 unembedding 向量的对齐。在 TOFU、PISTOL 和 WMDP 上,TULIP 在 Llama、Qwen 和 Zephyr 模型上持续优于输出层和表示层基线,并对改写和量化攻击保持稳健;其逐输入层选择还可作为即插即用组件提升现有方法。
- 论文论文追踪
论文:智能体知道被监控后,激活探针仍能识别其串谋
研究者测试了基于内部激活的探针在智能体知情时是否仍能检测多智能体串谋。实验固定模型、探针与阈值,只改变智能体被告知的内容,分为不知情、知道存在激活监控、以及额外收到上一轮监控分数三种条件,在四人 blackjack 与两人 Simmons 囚徒博弈中进行,使用 Qwen3-32B-AWQ 和 GPT-OSS-20B 的同构与混合配对。结果显示,告知智能体监控存在并不能让它们隐藏,最佳探针在三种条件下都保持准确,智能体也继续串谋。
- 论文论文追踪
研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关
研究者对 Qwen3-8B、Qwen3-32B、Olmo3-7B、Olmo3-32B、Gemma4-31B、Nemotron3-49B 六个开源权重模型做了评测感知的系统研究,从内部表征、口头表达、因果影响和训练阶段演化四个维度测量。用 16 组对比提示构造的线性探针在最佳层对全部六个模型都能区分评测与部署提示,AUROC 均超过 0.7。但探针分数与 LLM 评判(GPT-5.4,0 至 3 分)的口头表达分数在单条提示层面几乎不相关,Spearman 相关系数绝对值低于 0.19,互信息低于 0.04 nats;全部模型中至少 93.9% 的生成被判为 0 分。沿探针方向做激活引导可把评判分数提高 0.2 至 1.5 分,Qwen3-8B 峰值约 1.5。在 Olmo3 的基座、SFT、DPO、Think 各阶段检查点上,评测与部署提示的线性区分在基座模型里已经存在,后训练使这一方向趋于稳定,而沿它引导的效果随训练阶段逐步增强。作者认为评测需要同时考虑表征、口头表达与干预三个不同侧面。
- 论文论文追踪
研究者总结因果可解释性中的六类测量失效与校准协议
Distiller Labs 的 Orion Reblitz-Richardson 发布方法笔记,记录其因果可解释性项目在拒答与道德表征研究中遇到的六类测量失效,这些失效都会返回一个看似合理的数值而非报错。六类失效包括:正对照低于协方差零假设导致测量位置无效、把只出现在内容位置的 massive activation 离群维度误当成污染了决策位置、协方差匹配零假设在 massive activation 家族中饱和、逐头 OV 归因在重排归一化架构上高估约三倍、推理/预填充不对称统计被操作点混淆、以及在模型已完成决策的层之后测量造成的读数伪影。这些失效出自同一研究项目在 OLMo-3-7B-Instruct、Qwen2.5-7B、Llama-3.1-8B、GPT-OSS-20B 四个开源权重模型上的工作,每一类只在其中一到两个模型上确立,跨项目复现留待以后。作者给出对应协议:用正对照阶梯校准、用正交单元认证、先算统计功效再花算力、把读数结论标注在相对模型决策点的深度上。
- 动态X @jonasgeiping
研究者用探针训练对齐模型,让模型学会无害而非拒答
Jonas Geiping 等人发布预印本,提出直接针对无害性与诚实性探针优化模型,并称在持续更新探针的前提下效果良好,模型学会对有害请求生成无害回答、在压力下保持诚实。作者转述的论文观点认为,AI 安全领域不少被视为禁忌的技术(如用思维链检测奖励作弊、用模型内部表征做训练)缺乏清晰科学依据,而随着未来模型可能靠通用奖励寻求行为刷满对齐训练场景,用内部表征监督训练且不丧失可监控性将愈发重要。作者本人指出,这种训练让模型学会无害,而不是学会拒答有害请求,小模型在被诱导输出有害内容时会出现一些有意思的回答。
- 论文论文追踪
Persistent SAE:为语言模型特征学习特定时间尺度
研究者提出 Persistent Sparse Autoencoders(Persistent SAEs),在标准 SAE 基础上为每个特征学习一个持久性系数,仅靠重构目标就能学到特征特定的时间尺度。实验显示,Persistent SAEs 在保持有竞争力的重构质量的同时学到一组时间尺度谱:短时间尺度(快)特征保持局部可解释性,长时间尺度(慢)特征则累积用于识别当前上下文的信息。在提示注入监控案例研究中,慢特征能保留与注入相关的信号,并在长上下文中保持因果有效性。作者认为这为通过持久稀疏特征解释和监控语言模型提供了新途径。
- 论文论文追踪
研究提出 FEGA 框架分析 SAE 特征干预的 logit 变化几何
研究者提出 Feature-Effect Geometry Analysis(FEGA)框架,通过在不同上下文中移除同一个活跃 SAE 特征,分析由此产生的 logit 变化云,以研究特征干预对模型输出的影响几何。结果显示,在多种 SAE 变体中,表现出一致一维效应的特征很少,即少有特征能像可复用方向那样起作用。作者据此区分值型特征(关联事实属性等静态信息)与指针型特征(关联依赖上下文的操作):值型特征更常呈现结构化的低维效应,但通常跨越多个方向;指针型特征则主要呈现弥散效应。研究结论是,一个特征可以既可解释又具因果相关性,却未必能提供稳定的引导方向。
- 论文论文追踪
研究:思维链推理步骤的可读性不等于可解释性
Kevin Du、Alexander Hoyle、Laura Ruis、Acyr Locatelli 的论文将推理步骤的重要性定义为该步骤带来的期望奖励变化,用蒙特卡洛 rollout 估计作为基准,检验 LLM 评判者能否识别高重要性步骤。结果显示,能力足够强的 LLM 能超过流行度基线,但远未达到噪声上限;将模型微调为步骤级评判者后,对错误回答的识别有明显提升,对正确回答仍与上限差距较大。作者据此认为,步骤重要性只能部分从推理轨迹文本中恢复,提醒不要把思维链的可读性当作可解释性,这一结论对过程奖励模型有直接影响。论文发表于 COLM 2026。
- 论文论文追踪
研究者提出基于参考的隐藏状态相对表示偏见检测方法
研究者提出一种基于参考的偏见审计方法,通过隐藏状态的相对表示检测模型变体(如微调前后)的偏见变化。由于微调会重塑表示几何,绝对隐藏状态不可直接比较,方法用每个句子与固定锚句的相似度编码,在共享比较空间中衡量目标群体与正负属性的关联偏移,称为表示偏见偏移 ΔB。在三个模型族和 WildGuardMix、DecodingTrust、ToxiGen 基准上,ΔB 在 18 个测试设置中的 15 个与输出级偏见变化相关,全量微调下达到 |r| = 0.84(p < 0.001),参数高效适配下更依赖具体模型。对 ΔB 设阈值可识别偏见上升的检查点,ROC AUC 在 0.65 到 0.99 之间,在 WildGuardMix 和 DecodingTrust 上对三个模型族的区分效果均优于基于 SEAT 的基线。作者认为该方法与基于输出的审计互补而非替代。
- 动态X @OwainEvans_UK
Owain Evans 提出研究 Assistant 人格内部表征的新方法
Owain Evans 提出一种研究 Assistant 人格及其内部表征的新方法,区别于 Assistant Axis 等白盒方法。作者引用的内容指出,Assistant 会更多采纳与其相似的人类角色的特质,研究据此推断模型如何表征 Assistant,例如模型认为 Assistant 更像精英学校背景的人而非非精英背景的人。作者还讨论了一种可能解释,即模型是否更信任精英学校人群的判断,但援引 Slocum 等人 2025 年的论文认为,来源出处对微调中的信念采纳并不重要,因此不倾向这一解释。
- 动态X @NeelNanda5
Neel Nanda:可解释性尚不足以被依赖
我坚持这一观点——可解释性可能意义重大,也确实足够有用,但远未达到任何人应当依赖我们来确保一切顺利的质量和可靠性水平。
- 动态X @NeelNanda5
SAE 现状:有用但不够
一篇关于 SAE 当前状态的好帖——有用,肯定没死,但单靠它不够。
- 动态X @RyanGreenblatt(Ryan Greenblatt,METR)
METR 的 Ryan Greenblatt 呼吁 AI 公司公开架构可监控性权衡证据
METR 的 Ryan Greenblatt 对 AI 架构转向以不透明激活而非思维链进行推理(即"neuralese"架构)表示担忧,认为 Astra 是这一方向上令人不安的一步。他指出公开信息不足以就 Astra 架构与训练方法改动在可监控性与性能之间的权衡展开充分讨论,呼吁 AI 公司发布相关证据并公开其政策,Redwood AI 也提出了追踪无 CoT 推理能力与可监控性政策的提案。他强调公司应谨慎对待可能消除或大幅削弱对思维链依赖的架构。
- 动态X @ch402
Anthropic 可解释性团队招研究工程师
我们正在 Anthropic 可解释性团队招聘约 10 名研究工程师。如果你是一位资深 ML infra 工程师,并且对理解前沿模型内部发生了什么充满热情,我们期待你的消息。 (无需可解释性相关经验!)
- 动态Anthropic Alignment Science
Anthropic 提出 CHIVE 流水线:用反事实实验评估 LLM 行为解释
Anthropic 提出 CHIVE(Counterfactual Hypothesis Investigation Via Edits),一个智能体流水线,能在真实提示词中发现 LLM 的意外行为,并通过反事实提示词编辑给出可测量的解释。流水线分四步:采样(每个提示词采样 30 条回复)、筛选(由调查模型标记意外行为)、调查(运行 5–15 次反事实实验,编辑提示词后重新采样并测量行为出现频率的变化)、验证(独立评审模型为解释打分)。用它做评测时,激活 oracle、自然语言自编码器(NLA)和稀疏自编码器(SAE)三类激活读取工具都没有超过只读对话记录的基线,该结果在两种目标模型、三个预测模型家族和超参数扫描下都成立;作者认为工具输出几乎从不直接说明特征与行为之间的因果关系,且评测中的行为比 System Card 中的更简单。
- 论文arXiv
研究:隐蔽推理必然留下信息痕迹,但思维链未必可读
萨尔兰大学的研究者从信息论角度分析思维链监控的边界,指出隐蔽计算能否被监控取决于任务难度与模型规模。当任务复杂度超过模型容量时,成功求解必然向思维链泄漏关于隐蔽输入的近线性信息量,即信息论痕迹;模型容量与思维链长度只以多对数方式影响这一阈值。但泄漏不等于可读:在合理的密码学假设下,单层 Transformer 可用私有随机数在线加密思维链,使多项式时间监控者无法提取隐蔽计算信息。实验在 Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 等模型上验证了三种隐蔽推理模式随输入长度的变化,并训练单层 Transformer 实现了加密思维链的概念验证。作者据此提出,思维链监控对计算复杂的推理更有效,而黑盒监控受加密思维链限制。
- 动态X @kotekjedi_ml
用探针训练实现对齐的 MechInterp 研究
来看看我们 MechInterp workshop 投稿的扩展版,讲的是通过针对探针的训练来实现对齐可能如何运作! 我认为,如果我们打算继续沿用潜在推理模型,这个方向的工作会非常重要。
- 动态X @thjread
UK AISI 复现 Anthropic 的 steering 方法抑制评测感知
UK AISI Model Transparency 团队复现了 Anthropic 用于抑制评测感知(evaluation awareness)的 steering 方法。最意外的发现是,作为对照的 steering 向量(内容与书架上的书有关)产生的效果与刻意设计的向量一样大。该结果提示在评测感知相关实验中,对照向量的选择可能显著影响结论。
- 动态德国 BSI(KI 相关)
德国 BSI 发布 XAI 网络安全白皮书,建立可解释 AI 安全应用评估基础
德国 BSI 于 9 月 10 日发布白皮书《可解释人工智能(XAI):网络安全的机遇与风险》,为在网络安全领域使用 XAI 建立评估基础。白皮书结合 Network Intrusion Detection System 和逆向工程等用例,分析 XAI 在提升 AI 安全系统可信度、接受度及 IT 任务效率方面的作用,同时指出其技术局限,并警告解释信息可能泄露底层 AI 模型细节、带来新的攻击面。
- 动态BlueDot Impact
Persona Explorer:用 SAE 探索 LLM 中的人格与人格漂移
该项目用稀疏自编码器(SAE)从模拟不同人格的大语言模型中提取可解释特征并搭建浏览界面,实验基于 Gemma 3 27B 指令微调模型的 Gemma Scope 2 SAE(作用于第 40 层残差流,约 65k 特征)。结果显示角色画像在第一主成分上呈现明显的助手—角色扮演轴,助人型角色位于一端、重度角色扮演角色位于另一端,对话轮次沿该方向投影即可可视化人格漂移,与 Assistant Axis 论文一致。
- 动态BlueDot Impact
解读深度循环 Transformer 中的隐式推理
作者在 Huginn-3.5B 这一循环深度 Transformer 上复现并扩展了针对该架构的 logit lens 变体,用于解读模型不显式生成思维链时的隐式推理。实验覆盖算术与逻辑推理任务,解码后的隐式表示显示答案随循环迭代从不正确逐步转向正确。对解码状态概率分布的定性分析显示,这些分布能反映模型的推理置信度与不确定性。作者认为,隐式推理可能比原先担心的更容易被可解释性方法处理,这为未来监控隐式推理提供了潜在路径。该工作为 BlueDot Impact 2026 年 1 月技术 AI 安全项目冲刺的 Top Submission,并复现和扩展了 Alignment Forum 上关于 CODI 的工作。
- 动态BlueDot Impact
High-Stakes Activation Probes 跨语言泛化:Llama 3.1 8B 与 Gemma 3 12B 上的印尼语探测实验
该研究将高利害互动检测探针迁移到训练中缺失的语言——印尼语进行免重训评测,基于 McKenzie 等人训练的线性探针。在 Llama 3.1 8B(第 12 层)上平均 AUROC 从 0.9046 降至 0.8957(下降 0.9%,10-seed 均值);Gemma 3 12B(第 32 层)由 0.8972 降到 0.8873(降幅 1.0%)。稀疏自编码器诊断显示,Llama 错误样例中的特征流行度高出正确预测 10–15%;Gemma SAE 无信号。
- 动态ARC
ARC 提出匹配采样原则 MSP,目标是在神经网络输出估计上超越随机采样
ARC 正围绕"超越采样"重定向其理论研究议程,目标是比从分布中随机抽样更好地估计灾难检测器期望值 $\mathbb{E}_{x\sim D}[C(M(x))]$,并以此作为防止 AI 失控的对齐路径之一。该团队将其背后的信念半形式化为"匹配采样原则"(Matching Sampling Principle,MSP)。目前已在部分场景取得进展,例如随机 MLP 以及经过训练的两层 MLP。