全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:对齐、欺骗与监督
循环 Transformer 长度泛化的机制与边界:MR-Loop 与 DR-Loop 的机制对比研究
研究机制性对比了两种循环 Transformer 配置 MR-Loop 与 DR-Loop,在多项式迭代、有限状态组合和知识图谱遍历任务上分析其长度泛化机制。MR-Loop 在固定读出下更新中间状态,通过相邻 token 交互推进关系选择;DR-Loop 则跨关系位置传播中间状态,形成推进式计算前沿。两者在更深层均不可靠:MR-Loop 读出状态与进度线索退化,DR-Loop 状态传播可靠性下降,且有限的自纠正使局部错误持续累积。循环状态还编码内容的计算状态,可迁移的 live-consumed 与 fresh-aged 残差方向因果控制信息能否参与后续计算,且长度泛化不必依赖忠实的逐步推理。
- 论文arXiv:可解释性
S^3martCirc:自监督智能电路发现框架
S^3martCirc 是一个同时发现电路并解释其功能的统一框架,将节点行为抽象为两种可跨任务泛化的计算角色,并定义量化指标进行分配,使重要性与功能角色被联合发现而非分两步进行。该框架针对现有 LLM 机制可解释性方法中电路发现与功能解释相互割裂、功能角色依赖主观解读的问题,在电路发现任务上优于现有方法。
- 论文arXiv:可解释性
RISA:面向大语言模型拒答校准的响应检查与选择性干预
RISA 是一个推理时框架,通过检查 LLM 的初始响应并选择性纠正拒答错误,在不更新基座模型参数的前提下提升拒答可靠性。它先用固定上下文规则为明确案例打拒答分数,未匹配案例则由末层提示词隐藏状态经校准线性探针得出分数,并分别校准探针分数、表征支持边界与动作阈值以适配不同基座模型。运行时结合提示词分数与初始拒答状态,仅在必要时干预,实验显示其在提升拒答可靠性的同时基本保持模型效用。
- 论文arXiv:可解释性
在文本因果混杂调整中探索稀疏自编码器(SAE)
研究提出一种基于稀疏自编码器(SAE)的因果调整流程,通过条件独立性检验迭代筛选最小 SAE 特征集,以在保留混杂变量与满足有限样本重叠之间取得平衡。在二元混杂变量的半合成评测中,SAE 表示比替代表示实现更优调整,偏差更低、覆盖率更高,且其可解释性提供了证伪机会。作者还引入以多标签数据作为未观测混杂变量的更真实半合成评测,发现现成调整方法在这类更复杂设定下仍需进一步研究。
- 论文arXiv:可解释性
Gemma-3-27B-PT 内部激活中的可解释抑郁症状向量
研究用机制可解释性方法分析 Gemma-3-27B-PT 的残差流,发现症状描述在第 21 层的几何分离度最高。基于临床量表构建的 Symptom Vectors 在留出自然文本上的逐症状系数,保留了临床医生标注的情绪、躯体与自杀倾向轴排序;第 21 层的单一抑郁向量可区分抑郁与非抑郁文本(AUC = 0.789),并可作为情绪效价门控限制症状投影范围。
- 论文arXiv:可解释性
GAPS:面向条件激活引导的维度级门控
GAPS(Gated Activation steering via Posterior and Separability)通过维度级条件选择决定对哪些神经元施加激活引导,由两个免训练门控组成:静态可分性门控用 AUROC 筛选携带可靠概念信息的神经元,动态后验门控仅当神经元当前激活更符合目标概念时才干预。
- 论文arXiv:可解释性
ObserverBench:用干预与控制任务检验机制可解释性估计
研究者提出 ObserverBench,一个用于检验内部估计器(observer)是否足以支撑干预、控制或安全任务的基准框架。每个任务固定模型、信息边界、允许动作、决策规则、留出案例和损失,并分别报告估计准确率与所选动作造成的损失。在 GPT-2-small 和 Qwen2.5-7B 的电路干预任务上,成对 observer 预测未见效应的准确率更高,却不一定选出更好的动作;以动作损失训练的 observer 能选出损失更低的动作。在安全分诊中,能完美区分违规的分数在违规成本不同时仍可能分配不好固定干预预算。
- 论文arXiv:可解释性
LLM 如何处理上下文知识冲突:ContextConflict 数据集与机制可解释性分析
论文研究 LLM 如何处理上下文知识内部的冲突,而非模型参数知识与外部上下文之间的冲突,提出包含事实、推断、时间、粒度、视角和歧义六类的分类体系,并构建数据集 ContextConflict。该数据集含 5,781 条样本,覆盖推理与摘要任务,同时包含显式矛盾与需要多步推理的隐式冲突。在九个 LLM 上的实验显示,当前模型在解决上下文知识冲突方面仍有不足。作者进一步从机制可解释性角度分析模型处理冲突的过程,发现模型对冲突存在潜在感知,并刻画了冲突处理的表征几何。分析还发现模型一致偏向较早出现的证据,这种位置偏好是有效解决冲突的主要障碍。
- 论文arXiv:可解释性
FailSAE:用稀疏自编码器实现视觉语言模型的可解释失败预测
研究提出 FailSAE,用稀疏自编码器(SAE)对 CLIP 等视觉语言模型做可解释的失败预测,将失败预测建模为 SAE 稀疏隐激活上的分类任务,并设计三阶段失败感知训练流程。实验显示该框架在失败预测上优于所评估的基线,失败感知训练使 SAE 隐方向捕获更多类别特定概念。分析还发现模型失败时表征从类别特定概念转向更模糊或风格相关概念,并探索了用学到的 SAE 隐方向支持运行时失败恢复。
- 论文arXiv:可解释性
多语言 LLM 在语义保持结构扰动下的结构敏感性:IndicReStruct 基准与机制可解释性分析
研究用印地语和马拉雅拉姆语的成分重排与主动被动语态转换两种语义保持扰动,构建了基于 GSM8K 的 IndicReStruct 基准(含 GSM8K-Reordered 和 GSM8K-Voice 两个变体),在六款 SOTA LLM 和多种提示策略下观察到数学推理性能一致且显著的下降。残差流激活修补实验显示,推理失败常源于实体与数量对齐被破坏,中间 Transformer 层对推理恢复贡献最大。结果表明当前多语言 LLM 对表层句法实现高度敏感,缺乏对语义等价输入的组合不变性。
- 论文arXiv:可解释性
EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除
EraseSAE 通过稀疏自编码器在 DiT 架构的文生视频扩散模型中实现精准概念擦除,先以 Partitioned Convolutional Sparse Autoencoder 将稠密时空激活分解为可解释稀疏特征,再用对比归因机制定位概念专属特征核,推理时按时间步生成时空掩码限制擦除范围。实验显示该方法在多种扩散模型和概念擦除任务上实现精确稳健的移除,生成质量损失极小,显著优于现有方法。该工作已被 ECCV 2026 接收,代码已公开。
- 论文arXiv:可解释性
LLM 如何表征与检索单复数实体:复指回指的机制可解释性研究
研究用机制可解释性与注意力模式分析,考察 LLM 预测代词回指前文实体时如何表征和检索单复数实体。通过多种因果干预手段,识别出一组注意力头,分别负责在输入中表征共指信息、识别构成复数指代的实体,以及把信息传递给负责选择先行词并预测代词的组件。研究还发现 LLM 在复数代词偏好上与人类一致:本体上相似、并由 "and" 连接的实体更可能被复数指代。
- 论文arXiv:可解释性
SharedSAE:跨语言模型共享一套特征字典的稀疏自编码器
SharedSAE 提出用一套共享字典加各模型专属编码器-解码器对,替代为每个模型单独训练的稀疏自编码器(SAE)。与丢弃激活幅值、且推理时需要全部模型在场的先前方法不同,SharedSAE 只对选择分数做归一化以保留幅值,并用模型 dropout 支持单模型推理。作者在四个 1B 规模、分属不同模型家族与 tokenizer 的基础语言模型上训练 SharedSAE,其平均解释方差保留了专属 SAE 的 96.6%,潜在激活的跨模型相关性是事后对齐的独立 SAE 的 1.8 倍,潜在特征描述也能跨模型迁移。字典冻结后,新模型可高效适配,在复用共享潜在描述的同时达到接近专属 SAE 的重建质量。
- 论文arXiv:可解释性
研究:SAE 特征复现不足以证明跨语言因果作用,Gemma 2 与 3 中各存一个翻译启动方向
研究者在 Gemma 2 与 Gemma 3 上复现并扩展了 Wu 等人的 SAE 翻译启动特征发现方法,检验跨语言场景下特征是否具有相同因果作用。在两种模型中,虽然能找到 20 多个在所有发现设置下频繁激活的特征,但因果验证显示其中绝大多数影响很小或不一致。相比之下,Gemma 2 的 (L10, 5717) 与 Gemma 3 的 (L20, 2456) 在 23 种语言设置下放大时稳定提升 COMET 分数、消融时使其下降。结果表明特征复现会高估跨语言迁移,同时识别出 Gemma 2 和 Gemma 3 中一个与语言无关的翻译启动方向。该论文被 BlackboxNLP 2026 Special Track 接收。
- 论文arXiv:可解释性
Capsule Lens:定位并追踪模型表示中的概念几何
作者提出 Capsule Lens 框架,用胶囊这一由若干可解释参数定义的几何形式刻画概念在表示空间中占据的区域,参数以闭式解拟合并在留出样本上验证。该框架应用于静态与动态两类表示:在静态表示上定位不同模型中的概念几何,并用跨度与范数曲线揭示几何特征;在动态表示上通过三个案例追踪训练带来的表示漂移,包括 CLIP 预训练、视觉问答的 RL 后训练和数学推理的 RL 后训练。分析显示不同训练设置下的几何动态存在质的差异,从 CLIP 预训练中网络范围的广泛重构,到 RL 后训练中局部且概念特定的变化。作者认为 Capsule Lens 可用于定位、分析和追踪静态与动态表示中的概念几何。
- 论文arXiv:可解释性
Spillover-Aware Multi-Value Steering:面向多元对齐的 LLM 激活引导去纠缠方法
针对多元对齐中同时引导多个价值维度时出现的溢出效应,研究者提出 Spillover-Aware Multi-Value Steering 方法,将溢出归因于引导方向的几何纠缠(由 Gram 矩阵刻画),并从激活范数惩罚目标推导出零成本校正以精确解耦各方向贡献。该流程无需微调、奖励模型或人工提示工程,仅凭领域问题即可自动发现价值维度、提取方向、诊断纠缠并施加校正。在气候议题上,校正将净引导效果从 +5.9% 提升至 +14.0%,经 100,000 次成对判断验证。
- 论文arXiv:可解释性
动物重识别模型学到了什么?DINOv3 中线性生物概念及其来源
基于 DINOv3 骨干、用 triplet-margin loss 微调的西部低地大猩猩重识别模型,其表征中性别与年龄以线性方向存在,对留出个体可达 0.91 AUROC,且每个个体仅需一张图像即可恢复。激活引导显示性别方向被模型因果使用,能显著改变预测性别;对比现成与微调骨干表明重识别训练并未创造这些概念,而是将其在网络中重新分布。数据归因进一步显示该表征反映渐变的生物轴、在群体中冗余编码,并受视觉模糊个体影响。
- 论文arXiv:可解释性
LLM 激活引导空间能否反映人类价值几何?EMNLP 2026 研究发布 26K 样本基准
研究用 Schwartz 基本人类价值理论检验 LLM 激活引导向量是否编码连贯的价值语义结构,构建了覆盖 20 种人类价值的 26K 样本基准。分布驱动方法(CAA、SphericalSteer、ODESteer)恢复的价值拓扑与理论预测一致,Spearman ρ 最高 0.51(p < 10^-13);以行为为中心的方法(COLD-Steer、BiPO)引导性能相当,但与预期价值几何几乎不相关。几何保真度随模型规模提升,却在指令微调后下降;几何对齐更好时,引导某一价值会正确提升相容价值、抑制对立价值。
- 论文arXiv:可解释性
量化 LLM 中的激活引导:剂量响应、能力成本与失败不对称性
研究系统考察了仅权重量化(INT8 与 NF4)下激活引导的表现,覆盖四个 7-9B 开源模型和情感、推理长度两个行为目标。情感引导在量化后基本不受影响,INT8 合并对比为 -0.010(90% CI [-0.026, +0.007]),判定为等效;推理长度则呈不对称剂量响应,缩短仅 12-30% 后即出现不连续失败。Mistral-NF4 在 alpha=0 时 GSM8K 从 0.545 降至 0.365,显示压缩本身可主导引导效果,但引导向量与 FP16 版本仍高度共线(INT8 余弦相似度 0.989-0.998,NF4 为 0.945-0.990)。
- 论文arXiv:可解释性
研究:激活引导的干扰反映模型默认倾向而非行为方向
论文发现激活引导(activation steering)的干扰由模型自身决定,而非被引导的行为方向。作者在 24 种行为和 10 个指令微调模型上得到三项结果,所有效果均由语言模型评判器从生成文本读出,而非探针。第一,一个不含行为内容、仅在与真实引导所加向量大小上匹配的方向,会以与真实引导相同的顺序移动相同的行为,却不产生任何需要特定方向的行为。第二,多数干扰是单向的,因此不能解释为两个方向的重叠:引导脏话会让模型变得有毒,而引导毒性不会影响脏话。第三,完全留出某一行为时,用其他行为测得的几何几乎无法解释它参与的干扰。
- 论文arXiv:可解释性
通过稀疏自编码器特征追踪查询扩展效果
研究用稀疏自编码器(SAE)特征追踪查询扩展(QE)对稠密检索器的内部影响,将原始与扩展查询的逐层表示分解为稀疏隐激活,从扩展引发的激活偏移中识别出 QE 相关隐变量。分析显示有效 QE 引发与检索意图和实体属性对齐的层级集中变化,而非仅扰动最终查询嵌入。基于 SAE 的激活引导在四个基准上比随机干预或原始 QE 更稳定地提升检索效果,无需查询改写或检索器微调。
- 论文arXiv:可解释性
Steering Vector Dissection:将激活引导向量拆解为独立语义特征
论文提出 Steering Vector Dissection 框架,用于把激活引导中纠缠多个语义与风格概念的复合方向拆解为各自独立的语义一致特征。方法上,作者配对正负激活并取差值生成实例级引导向量,再直接在这些向量上训练专用的 Sparse Autoencoder(SAE)。在 2 个数据集、2 个模型和 2 种干预深度上的定量评估显示,该方法得到的基向量语义一致,且引导效果彼此可区分,从而支持对模型行为更精确的控制。论文共 31 页、5 张图。
- 论文arXiv:可解释性
PhysSAE:用稀疏自编码器对 PINN 做机制可解释性分析
PhysSAE 是一个针对物理信息神经网络(PINN)的机制可解释性框架,在 PINN 倒数第二层激活上训练过完备稀疏自编码器(SAE),并通过在原始冻结隐状态中直接做因果干预(h_cf = h - α z_k d_k)评估字典原子,绕过 SAE 解码器。在六类 PDE、各 3 个 PINN 种子和 3 个 SAE 种子上,发现的 SAE 原子与独立定义的物理可观测量对齐(最大 Pearson |r|=0.951),高对齐原子消融的因果足迹比 PCA 或 ICA 干预在空间上集中 1.2–4.2 倍,并在结构化物理概念上优于匹配随机对照(ESF80 优势 0.04–0.44)。
- 论文arXiv:可解释性
Mamba 的召回缩放定律:基于哈希的理论与机制可解释性研究
研究从机制可解释性角度逆向出 Mamba 执行联想召回(AR)的内部算法,发现其通过隐式学习线性哈希函数完成召回,并定位了实现该行为的底层电路。受 Johnson-Lindenstrauss 引理等保相似哈希理论启发,作者提出"召回缩放定律"框架,可依据词表规模和上下文中事实数量,预测 Mamba 实现完美召回所需的嵌入与状态维度、给定模型维度下的召回成功概率,并分析多层模型与多头 SSM 模式。实验表明该理论预测准确,揭示了 AR 能力随词表、状态、嵌入规模和架构的缩放规律。