全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文Hugging Face Daily Papers
ConEx:通过概念感知归因生成人类可解释的显著性图
ConEx 是一个将显著性可视化与概念推理结合的可解释性框架,可自动发现类别专属概念并用概念激活向量(CAVs)表示,无需人工监督。它通过架构特定的掩码机制降低分割掩码噪声以提升概念纯度,生成能显示各概念出现位置及其对预测贡献的显著性图。作者提出 VCM 和 CCM 两项指标量化概念对齐,实验显示 ConEx 在忠实性、分割和概念质量基准上达到 SOTA。
- 论文arXiv:可解释性
研究:LLM 潜在空间去偏方向主要编码置信度而非公平性
剑桥大学与 Visa 风险与安全 AI 实验室的研究发现,通过对比偏见与反偏见提示激活得到的去偏方向主要编码模型置信度,而非偏见本身。研究在 Llama-3.1-8B、Falcon3-7B、Ministral-3-8B 和 Qwen3.5-9B 的基座与指令微调版本上训练线性分类器,该分类器在 BBQ 去歧义语境下区分偏见与反偏见提示的 AUROC 仅 0.57,但按最高与最低概率答案划分时 AUROC 达 0.94。在 MMLU 和 OpenBookQA 等不含社会偏见概念的数据集上,该分类器区分高低概率答案的 AUROC 仍高达 0.88。激活引导实验显示,沿去偏方向引导会降低模型置信度:在提供弃答选项时模型弃答率上升,BBQ 歧义提示的偏见分数从 0.08 降至 0.01,但去歧义语境的偏见分数基本不变;不提供弃答选项时各选项概率趋于均衡、熵上升。
- 论文arXiv:可解释性
AnyBottle:只保留真正需要的概念,构建紧凑任务专属概念瓶颈模型
AnyBottle 是一种构建紧凑、任务专属概念瓶颈模型(CBM)的方法,只需一个冻结骨干网络和一个无监督概念池(如稀疏自编码器),由在同一骨干上训练的黑盒教师模型逐轮引导概念选择,候选概念限定在师生分歧区域。模型按选择顺序做嵌套 dropout 训练,使最终瓶颈可从任意概念前缀准确预测,推理时对简单输入用更少概念、对困难输入用更多概念。在六个视觉和两个文本数据集、两种教师范式下,AnyBottle 比无标注基线概念更少、概念一致性更高,同时接近黑盒参考模型。
- 论文arXiv:可解释性
研究:LLM 比人类更易产生错觉模式感知并导致虚假推理
论文研究大语言模型是否表现出人类的错觉模式感知,即从随机数据中推断出并不存在的有意义关联。作者称这是首个针对 LLM 错觉模式感知的系统研究,将经典心理学范式改造为三项任务,并与人类行为做直接实证对比,发现 LLM 的错觉模式感知往往强于人类,模型倾向于把频繁出现的正面属性过度关联到多数群体或大型组织,也更易从模糊事件中构建因果叙事。为揭示机制,作者基于 Sparse Autoencoders(SAEs)构建特征可解释性框架分析内部表征,结果显示整体频率感知与分析性认知取向与错觉感知的出现相关。代码见 https://github.com/NusIoraPrivacy/illusory。
- 论文arXiv:可解释性
GraphCast 大气河机制的机制可解释性研究
研究团队在 GraphCast 上训练稀疏自编码器(SAE),发现该 AI 天气模型将大气河强度(以积分水汽输送 IVT 衡量)作为稳定的内部变量进行计算,尽管 IVT 既非输入也非预测目标。标准 SAE 与 Matryoshka SAE 均能捕捉这一变量,后者还按重要性排序并揭示概念间关系;大气河概念贯穿模型各层,直接干预实验证实了其因果作用。
- 论文arXiv:可解释性
COMPASS:在语言模型中定位推理发生的注意力头
研究者提出 COMPASS,一种推理时激活引导方法,用于找出语言模型中承载推理的注意力头。该方法不依赖预定义的推理刻画,而是以模型自身直接作答的正确性作为信号,得到一条可诱发推理的潜在方向;该方向在多数注意力头的激活中可解码,但只有少数头能被有效干预。COMPASS 通过 logit 空间的归因分数识别这些头,并沿正确性方向引导其激活,只需每个头的激活统计量。在三个模型家族和多个数学基准上,COMPASS 优于所比较的激活引导基线,GSM8K 准确率平均提升 16 个百分点,并以少生成 20-70% token 的方式接近 CoT 准确率;干预无需重新拟合即可迁移到未见基准,消融实验显示正确性方向与承载它的少数头都不可或缺。
- 论文arXiv:可解释性
BeFOND 将稀疏自编码器的推断与学习统一为自然梯度流
研究提出 BeFOND,一个无编码器的稀疏编码模型,把稀疏自编码器的推断与字典学习统一为同一变分自由能上的自然梯度流。该方法用循环 explaining away 减少重叠特征之间的干扰,并用 Fisher 预条件补偿稀有特征学习偏慢的问题。在合成数据上,其字典恢复与稀有特征检测优于 amortized 基线,且随叠加程度提高优势扩大;在语言模型激活上,单特征概念检测与选择性干预优于预训练参考 SAE,所用训练数据明显更少。其特征质量随字典宽度继续提升,而所评估的基线大多趋于停滞。
- 论文arXiv:可解释性
超越线性表征假设:KANSteer 用非线性激活引导文本到图像模型
针对文本到图像模型中概念表征偏离线性方向的问题,研究者提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)将概念遍历建模为穿过中间状态的曲线,使引导方向可随概念变化并保持可解释性。在多个概念和文本到图像扩散 Transformer 上,其激活轨迹明显偏离直线,KANSteer 比线性引导拟合更贴近、对中间属性的遍历更平滑。
- 论文arXiv:可解释性
研究揭示 Transformer 拒答机制中的组件与维度稀疏性
研究将拒答激活引导分解为组件级干预,在四个开源权重模型上识别出足以复现完整行为效果的稀疏注意力与 MLP 组件子集。这些拒答方向集中在占上游组件 28% 至 48% 的稀疏机制中,仍保留 88% 至 101% 的引导效果;在这些机制内部,有效引导进一步集中在约 50% 的残差流维度上,保留组件机制基线的 85% 至 98%,与存在特权基结构的判断一致。作者据此认为拒答并非弥散编码于整个 Transformer,而是由结构化、可识别的机制组装而成,并将代码与原始实验结果开源在 https://github.com/wang-research-lab/Refusal_Mechanisms。
- 论文Hugging Face Daily Papers
MEA:面向忠实模型解释的奖励驱动多智能体系统
研究者提出 MEA 多智能体框架,用 Proposer agent 按问题和模态选择并配置解释工具,再用 Actor agent 针对忠实度端到端优化,把输出转成基于模型行为的自然语言解释,覆盖表格、文本和视觉三种模态。作者同时设计了涵盖特征归因、反事实推理和虚假特征检测的问题类型,并为每类配备基于扰动的忠实度指标。研究发现前沿 LLM 会系统性地产生不忠实的解释;在六份数据集上,加入模态自适应惩罚的忠实度奖励优化,使 MEA 相比未训练骨干分别提升 28%(表格)、21%(文本)和 34%(视觉),并优于事后解释方法、智能体式和闭源基线。
- 论文论文追踪
论文提出 Operational Validity Contract,审计激活监控从探针分数到告警策略的有效性
论文区分激活探针的高 AUROC 与部署中按误报预算设定的告警阈值,指出二者衡量的目标不同。作者提出 Operational Validity Contract,用目标、可观测性、身份、时机、单元、对照、校准与成本八个字段限定监控声明,强调探针分数不能直接证明实际告警策略有效。
- 论文arXiv
神经网络的具体算法可解释性:以纹理分类为例
研究者提出一套框架,用于构建参数实现可被显式算法解释的神经网络。该方法将每个数据点建模为类别相关随机过程的样本,构造初始参数精确实现统计量估计算法的网络,再通过控制偏离算法初始化的幅度进行微调,使训练后的网络大致保留初始解释;PAC-Bayesian 分析给出复杂度项随微调半径缩放的泛化界。框架以散射变换估计判别统计量,在纹理分类上实例化。
- 论文arXiv:越狱、提示注入、投毒与防御
TrustMI:通过模型激活因果控制助手对用户的信任
研究把助手对用户的信任定义为愿意接受对方行为带来的脆弱性,并检验这种信任能否通过模型激活被因果控制。作者构建了覆盖能力、善意与诚信三个维度的 2000 组对比对话,每组回答完成同一请求但在是否信任用户上不同,在冻结模型参数的前提下学习引导矩阵。在来自三个模型家族的六个指令微调模型上,引导在两个方向上单调改变信任决策。研究进一步在涉及有害请求、提示注入和内部威胁的 Agent 安全场景中检验该效应,并以良性任务和推理作为对照,结果显示对用户的信任可沿激活空间中的线性方向被因果控制。
- 论文arXiv:可解释性
研究:智能体欺骗行为在外部显现前已可从内部表征预测
上海人工智能实验室等机构的研究者提出把智能体欺骗监测转化为行为发生前的内部状态预测问题,在行为决定性步骤之前提取隐藏状态并聚合成轨迹级表征,用基于 MMD 的深度核检测器区分未来诚实与欺骗结果。在 Qwen3-14B 上,提前七个步骤的表征即可达到 90.4% AUROC,与最新决策前表征的 89.4% 相当;从轨迹起点累积前缀时,平均 AUROC 由第一步的 51.2% 升至第十步的 80.0%。研究者还沿诚实与欺骗方向做激活引导,在 α=2.0 时把诚实结果比例从 50.0% 提升到 71.6%,被选中干预的基线欺骗轨迹中有 56.0% 转为诚实。作者指出标签来自可观察行为而非潜在意图,且仅在单一模型族的白盒设定下验证。
- 论文arXiv:可解释性
基于影响力的曲率感知数据加权激活引导方法
研究提出影响加权激活传输方法,用影响函数估计每个数据点对模型概念表征的贡献,并按影响分数加权概念样本,通过最优传输将非概念文本的激活引导向概念文本。在毒性抑制(Jigsaw)、物体概念诱导(OneSec)和真实性诱导(TruthfulQA)上优于现有激活传输基线,同时用困惑度和 MMLU 准确率追踪能力,发现引导效果提升且基本保持模型质量。影响函数能捕捉激活方法遗漏的概念相关信息,两种方法对数据点的排序显著不同。
- 论文arXiv:可解释性
研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答
研究者提出反事实激活潜力(CAP)指标,用编码器对齐、抑制强度和安全性关键度三项乘积刻画被压制的安全特征,并给出 CAP 引导的安全特征发现(CSFD)两阶段筛选算法,从数十万 transcoder 特征中筛出候选而无需穷举消融。在 Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT、Qwen3-1.7B 和 Llama-3.2-1B 五个模型上,78% 至 100% 的候选特征经消融验证具有因果作用,单个特征置零可使最高 82.5% 的拒答转为顺从。使用 PAIR 攻击时,最高 CAP 特征受到的抑制强度上升 2 至 4 倍,激活相应下降最多 80%;放大抑制特征本身即可降低其激活并提高有害顺从率,而随机特征无此效果。作者据此认为越狱部分通过压制安全关键特征而非仅激活有害特征实现,被压制特征是激活式可解释性的必要补充。
- 论文arXiv:可解释性
One Token Can Be Enough:用 Prefix Steering 连接提示与激活引导
研究提出 Prefix Steering,从提示末尾 token 起在短跨度内施加已有的引导方向和算子,之后不再直接干预。作者在固定状态注意力假设下给出单 token 与多 token 引导匹配提示所诱导注意力头输出的充分条件,并刻画输入表示变化对匹配及其近似误差的影响。在四个模型和五个任务上,短跨度干预甚至单 token 干预常能保留完整引导的大部分行为控制力,同时更好地保持通用能力,在部分设置下优于提示和其他引导强度策略。该方法在推理后的最终答案格式任务上仍然有效,说明短暂的初始干预可以影响引导结束后才表现出的行为。
- 论文arXiv:可解释性
TSAE:用于解释时间序列预测模型的结构化稀疏自编码器
TSAE 是一种结构化稀疏自编码器,将时间序列预测模型的隐藏状态分解为可单独检查的特征,通过共享与变量路由的私有字典组织跨变量结构,并用门控编码分离特征检测与幅度估计。在冻结 PatchTST 于 ETTh1、ETTh2、ETTm1 的三种子实验中,TSAE 在五种 SAE 中取得最低隐藏状态重构误差、归一化预测重构误差(NFRE)和特征转移率,NFRE 较次优均值下降 4.3-26.4%。配套 TSEVAL 协议分别审计保真度、特征一致性与物理校准,但选择性、物理相关性和校准存在数据集相关权衡,保真度与时序稳定性提升仍需独立语义验证。
- 论文arXiv:可解释性
ScopeSAE 按预测相关性选择建模子空间,实现重建优于原始激活
研究者提出 ScopeSAE,用归一化梯度归因把每个预测归到最有影响的 token-层状态,从而按 token 选择建模子空间,而非按层固定子空间。作者称该方法出现重建优于原始的效果,即 SAE 写回重建的下一 token 交叉熵低于原始激活,并称此前未见 SAE 报告过这一现象。通过干预分析和 KL 微调对照实验,作者认为该效果来自预测相关的子空间本身,而非架构改动。相比现有按层基线,ScopeSAE 在有效特征数、可解释性、利用率和字典冗余上均有改善。
- 论文arXiv:可解释性
SpeechLLM 免训练任务特化:对比激活加法引导语音语言模型
研究者提出免训练的对比激活加法(CAA)协议,用少量带标注语音样本为 SpeechLLM 推导出针对转录等常见语音任务的引导向量,在推理时将其加入表示空间以强化目标任务。与提示词结合后,这些向量在 ASR、情感识别等多数评测任务上稳定优于单独使用提示词,并可迁移到域外数据;脚本归一化方向还能强制模型输出特定语言的文字系统。
- 论文arXiv:可解释性
用迭代零空间投影提取人格子空间以调控 LLM 行为
研究者提出 PaSS,一种无需重训练的推理时控制范式,把 LLM 的人格建模为潜空间中的多维子空间,并通过迭代零空间投影(INLP)逐层剥离出人格专属方向。在 MATH-500、TinyAlpaca、GSM8K 和 IFEval 等任务上对六种人格做因果评估,结果显示迭代子空间提取比单方向加性方法实现更强、幅度更大的调控,同时保持内容保真度。研究还逐一分析子空间中被剥离的方向,揭示其编码的人格行为不同侧面。
- 论文arXiv:可解释性
First-Order Steering:将权重适配转化为激活引导
研究者提出 First-Order Steering,把激活引导表述为权重更新矩阵的一阶近似,由引导强度向量参数化,并给出该近似的理论误差上界。基于此,他们开发了模型合并方法 HeRD-Merging,通过最小化一阶近似误差项提升引导精度。作者称该方法生成的引导向量在控制单一行为和组合行为时都比现有激活引导方法更准确,同时 HeRD-Merging 在性能上与传统模型合并基线相当,且其权重适配能产生更准确的一阶引导向量。
- 论文arXiv:可解释性
研究揭示语言模型拒答行为的转向维度差异
研究提出用转向子空间维度衡量控制某一行为所需的最小维度,并检验两类拒答行为。结果显示,由安全对齐触发的拒答是 1 维可转向的,多个不同转向方向都能实现相近控制;而一般语境中的拒答激活几何更复杂,即使 5 维转向子空间也无法可靠覆盖其全部可转向变化。作者据此指出,拒答背后的激活几何高度依赖语境,可能远比单一线性转向方向复杂。
- 论文arXiv:可解释性
研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制
加州理工等机构的研究者用激活引导(activation steering)在四个开源权重模型上考察风险偏好,发现自我报告与行为由近乎正交的内部方向控制。研究比较了九种引导向量提取方法,覆盖任务指令、模型自身选择、风险特质描述和 Big-Five 人格画像四类监督来源,在 Columbia Card Task 和 BART 两个行为任务以及 BFI-44 和 DOSPERT 两个自评量表上评估。结果显示,基于特质描述的方向能改变自我报告但几乎不影响行为,基于模型自身任务选择的方向则相反,只有任务指令类方向能同时触及两个通道,但其行为效应在剔除表面混杂因素后仅保留 32%。两个通道的方向近乎正交,移除另一通道的方向族后仍保留 92% 至 102% 的效应。组合一个行为方向和一个自我报告方向可同时驱动两者,反转其中一个符号后,四个模型在 69% 至 89% 的反向组合中出现报告与行为相反的状态。