跳到正文
10月8日 · 周四

可解释性 · 论文

精选论文 20 篇
  1. 分析/可解释性arXiv:2610.10203 · ↑162

    研究者提出模型生物体多目标验证框架并给出训练建议

    研究者针对模型生物单一目标训练致能力退化的问题提出多目标验证与模型合并方法,发现模型验证质量直接关联可解释性工具效用。

    • 85.7%Pando 原始 SFT 模型 MT-Bench 相对于基座的留存率(Figure 2)
    • 94.1%Pando 经 DPO 重训后 MT-Bench 相对于基座的留存率(Figure 2)
    • 46.7%Pando 原始 SFT 模型 CoT 自然度相对于基座的留存率(Figure 2)
    6 问速览单一目标训练导致模型生物通用能力和自然度退化,影响可解释性评测结论。
    1. 这篇论文试图解决什么问题?

      单一目标训练导致模型生物通用能力和自然度退化,影响可解释性评测结论。

    2. 有哪些相关研究?

      涵盖模型生物评测、涌现失齐、激活伪影及多目标受限优化等研究。

    3. 论文如何解决这个问题?

      构建三维验证框架,基于 DPO 与权重合并向基座插值以保留通用能力。

    4. 论文做了哪些实验?

      跨多个套件验证表明 DPO 与模型合并显著保留能力,验证指标与审计工具表现强相关。

    5. 有什么可以进一步探索的点?

      局限在于临床数据较简化、证据为相关性及代理指标存在古德哈特风险。

    6. 总结一下论文的主要内容

      提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。

    完整解读
  2. 分析/可解释性arXiv:2610.08559 · 56

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    作者发现对比偏见与反偏见提示词得到的激活引导方向主要表征模型置信度,引导减少偏见实为促使模型弃答或概率均分。

    • 0.57Llama-3.1-8B-Instruct,BBQ消歧偏见分类AUROC(Fig. 1)
    • 0.94Llama-3.1-8B-Instruct,BBQ消歧置信度AUROC(Fig. 1)
    • 0.01Llama-3.1-8B-Instruct,BBQ歧义引导后偏见分(Table 4)
    6 问速览探究大语言模型中通过对比偏见与反偏见提示词提取的激活引导去偏见方向,在隐藏空间中实际编码了何种表征。
    1. 这篇论文试图解决什么问题?

      探究大语言模型中通过对比偏见与反偏见提示词提取的激活引导去偏见方向,在隐藏空间中实际编码了何种表征。

    2. 有哪些相关研究?

      涵盖激活引导及其鲁棒性、推理期去偏见方法,以及利用词元似然或困惑度评估模型偏见的既有研究。

    3. 论文如何解决这个问题?

      构建线性偏见分类器与对比激活相加去偏见向量,并在有无弃答格式下评估激活引导对模型置信度的影响。

    4. 论文做了哪些实验?

      评测八个模型在三个偏见基准与两个通用问答基准上的表现,展示引导向量对弃答率、熵及置信度的一致影响。

    5. 有什么可以进一步探索的点?

      作者提出探索独立于置信度的去偏见方向与更广泛的引导向量可靠性,评测覆盖八个开源模型及多项选择问答任务。

    6. 总结一下论文的主要内容

      论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。

    完整解读
  3. 分析/可解释性arXiv:2610.05541 · 54

    研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答

    作者提出CAP与CSFD挖掘被抑制安全特征,消融特征在Gemma-3-4B-IT上使82.5%拒答翻转。

    • 82.5%Gemma-3-4B-IT 上消融单个特征的最大拒答翻转率(Table 1)
    • 100%Qwen3-1.7B 与 Llama-3.2-1B 的候选因果有效率(Table 1)
    • 0.29有害拒答提示词上特征抑制源放大 8 倍时的顺从翻转率(Table 2)
    6 问速览现有工具忽略静默特征,论文提出 CAP 与 CSFD 挖掘被抑制的安全特征以分析越狱机制。
    1. 这篇论文试图解决什么问题?

      现有工具忽略静默特征,论文提出 CAP 与 CSFD 挖掘被抑制的安全特征以分析越狱机制。

    2. 有哪些相关研究?

      相关研究涵盖残差流拒答方向、稀疏自编码器回路与安全神经元,本文聚焦被抑制特征。

    3. 论文如何解决这个问题?

      论文提出 CAP 指标量化特征抑制潜能,并通过两阶段过滤算法 CSFD 快速筛选与验证。

    4. 论文做了哪些实验?

      实验显示 CSFD 候选特征具有高因果有效性,自然越狱与干预实验均观察到特征抑制现象。

    5. 有什么可以进一步探索的点?

      作者指出转码器重建误差、静态权重归因、裁判一致性分歧、模型规模及攻击单一性等局限。

    6. 总结一下论文的主要内容

      论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。

    完整解读
  4. 分析/可解释性arXiv:2610.04125 · 55

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    研究表明大模型风险自述与行为由近正交表征控制,反向组合向量在四模型中诱导 69–89% 言行不一。

    • 32%任务指令向量在消除表面捷径特征后的行为效应保留率(DerSimonian-Laird 池化)
    • 42.1自身决策向量在 16 个行为单元格中的中位数摆幅(对照 SD)
    • 69–89%四模型反向组合向量诱导抗连贯状态的比例区间
    6 问速览探究大模型自我报告与实际行为的脱节是提示词表象还是内部表征事实。
    1. 这篇论文试图解决什么问题?

      探究大模型自我报告与实际行为的脱节是提示词表象还是内部表征事实。

    2. 有哪些相关研究?

      梳理大模型人格心理测量、激活导向与概念擦除三类相关研究并确立对比基线。

    3. 论文如何解决这个问题?

      设计 4 类 9 种导向向量,配合正交投影消融与正负加权混合实现因果分析。

    4. 论文做了哪些实验?

      多模型实验证实特质导向无法改变行为,正交组合可诱发 69–89% 言行不一。

    5. 有什么可以进一步探索的点?

      作者指出局限在于单一构念、单步决策及中型开源模型,未覆盖多步智能体。

    6. 总结一下论文的主要内容

      论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    完整解读
  5. 分析/可解释性arXiv:2609.14759 · 54

    研究:拒答只读取模型道德表征中的伤害切片

    作者分析OLMo-3等,发现拒绝仅读取一维伤害感知(OLMo-3拒绝因果输入76%在道德基外),跨架构有早承诺等差异。

    • 0.999OLMo-3预训练结束时道德子空间与最终状态的余弦相似度(Figure 1a)
    • 0.155OLMo-3基座proto-refusal与对齐拒绝门的余弦相似度(Figure 1)
    • 76%OLMo-3在42对request-twins上位于rank-16道德基底外的拒绝因果输入比例(Table 7)
    6 问速览研究模型拒绝决策时实际读取了哪些内部表征,探究后训练对齐易被移除的机制解释与跨模型表征差异。
    1. 这篇论文试图解决什么问题?

      研究模型拒绝决策时实际读取了哪些内部表征,探究后训练对齐易被移除的机制解释与跨模型表征差异。

    2. 有哪些相关研究?

      涵盖后训练对齐与拒绝消除、表征阅读与因果交换干预、道德与伤害表征编码等相关研究。

    3. 论文如何解决这个问题?

      结合校准投影梯与嵌套因果交换干预,在控制token瓶颈处解耦表征读取与行为承诺时机。

    4. 论文做了哪些实验?

      多模型参与率确认决策瓶颈,因果交换显示OLMo拒绝在rank-1伤害饱和,消融实验显示Llama存在道德纠缠。

    5. 有什么可以进一步探索的点?

      作者指出了两轴规律的架构混杂、GPT-OSS非因果测试、部分模型行为耦合偏弱等局限与后续方向。

    6. 总结一下论文的主要内容

      作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    完整解读
  6. 分析/可解释性arXiv:2607.12166 · 55

    研究:SAE 相关性恢复的特征最高 77% 因果无效

    论文用消融与转向干预审计SAE,发现余弦≥0.90特征中退化SAE有77%、良好SAE有9%因从不激活而因果惰性。

    • 91.2%L1 SAE保留激活支持重优化幅度时MSE改善比例(Table 3)
    • +22.5%L1 SAE保留激活支持重优化幅度时活跃激活幅度变化(Table 3)
    • 77%退化TopK SAE(k=13)中余弦>=0.90但因从不激活而因果惰性的特征比例(第6.3节)
    6 问速览仅凭解码器余弦相似度评估SAE特征,混淆了几何对齐与编码器激活,导致因果失效。
    1. 这篇论文试图解决什么问题?

      仅凭解码器余弦相似度评估SAE特征,混淆了几何对齐与编码器激活,导致因果失效。

    2. 有哪些相关研究?

      相关研究涵盖叠加假说、TopK与L1字典学习及特征吸收,缺乏逐特征因果验证工具。

    3. 论文如何解决这个问题?

      通过消融与带符号转向干预度量因果特异性,提出成因与方向双轴分类体系及审计工具。

    4. 论文做了哪些实验?

      实验覆盖合成模型相图、L1收缩验证、两套SAE因果普查及GPT-2-small真实模型审计。

    5. 有什么可以进一步探索的点?

      作者指出结论源自小型合成模型且未测多特征交互;实验覆盖单层残差流与83个概念。

    6. 总结一下论文的主要内容

      论文揭示SAE特征存在几何匹配与因果有效性脱节现象,提出读写解离机制与实践准则。

    完整解读
  7. 分析/可解释性arXiv:2609.14754 · 54

    研究者总结因果可解释性中的六类测量失效与校准协议

    Orion Reblitz-Richardson评估四款大模型的因果可解释性测量,发现决策点存在低维瓶颈与伪影,提出四项校准规范。

    • 14.7OLMo-3-7B-Instruct决策点原始PR值(Figure 1)
    • 8.6Qwen2.5-7B决策点原始PR值(Figure 1)
    • 3.05OLMo-3-7B未折叠RMSNorm的Stage-1重构率(Section 3.4)
    6 问速览大模型因果可解释性工具易受低维瓶颈与归一化等架构伪影干扰产生假象读数,需建立成套校准与验证规程。
    1. 这篇论文试图解决什么问题?

      大模型因果可解释性工具易受低维瓶颈与归一化等架构伪影干扰产生假象读数,需建立成套校准与验证规程。

    2. 有哪些相关研究?

      论文梳理了离群维度、归因归一化、激活修补方法学和转向干预相关工作,强调仪器校准与防假象机制。

    3. 论文如何解决这个问题?

      作者提出了包含低维通道检验、零假设标准化、RMSNorm增益折叠与承诺相对深度对齐的校准框架。

    4. 论文做了哪些实验?

      在四款模型上测定决策点低维瓶颈,修正了3倍归因高估与层16读出层伪影。

    5. 有什么可以进一步探索的点?

      作者指出了单项目与单面板泛化、门控假阴性、各向异性信号抹平及幸存者偏差等局限。

    6. 总结一下论文的主要内容

      论文系统梳理并实证揭示了大模型可解释性测量的六种伪影陷阱,提出了四项严格的校准与验证规程。

    完整解读
  8. 分析/可解释性arXiv:2609.37312 · 54

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    作者分析指出复杂隐蔽推理必须在 CoT 泄露足迹并承担长度税,但单层 Transformer 在密码假设下可在线加密。

    • 99.83%单层Transformer在1024位PARITY上的联合准确率(Table 15)
    • 99.0%Qwen2.5-7B在128–255位Parity的Piggy准确率(Table 6)
    • 99.3%Qwen在19步S5的SpecialTokens隐蔽准确率(Table 6)
    6 问速览论文从理论与实证探究 Transformer 推理模型能否在思维链中隐匿计算,以及监视器能从中提取多少信息。
    1. 这篇论文试图解决什么问题?

      论文从理论与实证探究 Transformer 推理模型能否在思维链中隐匿计算,以及监视器能从中提取多少信息。

    2. 有哪些相关研究?

      相关研究涵盖 CoT 监控与忠实度、填充词元隐式计算、语言模型隐写以及 Transformer 电路复杂度分析。

    3. 论文如何解决这个问题?

      论文通过定精度电路复杂度分析确立足迹下界与长度税,并基于 Goldreich 伪随机生成器构建单层在线加密思维链。

    4. 论文做了哪些实验?

      实验涵盖 2 个模型微调与 5 个家族大模型评测,证实信息足迹机制在长序列上的优势与在线加密可行性。

    5. 有什么可以进一步探索的点?

      作者指出了加密思维链的拟真度、白盒检测可行性及训练依赖等局限,后续可在白盒监控与语义隐写展开探索。

    6. 总结一下论文的主要内容

      论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    完整解读
  9. 分析/可解释性arXiv:2609.37616 · 55

    语言模型中的权威偏差:来源顺从与用户认同并非同一行为

    作者发现验证源背书使7款模型在TriviaQA翻转45%–88%基准正确项,并通过干预区分了源依从与用户迎合。

    • 87.5%Grok-4.20 TriviaQA验证源翻转率(Table 15)
    • 44.9%Qwen3.5-27B TriviaQA验证源翻转率(Table 15)
    • -77.5 ppGPT-OSS L16移除源方向后源错误率变化(Table 4)
    6 问速览论文研究语言模型对验证源的权威依从与对用户的迎合是否由相同内部通路驱动,并检验其因果可分性。
    1. 这篇论文试图解决什么问题?

      论文研究语言模型对验证源的权威依从与对用户的迎合是否由相同内部通路驱动,并检验其因果可分性。

    2. 有哪些相关研究?

      论文梳理了阿谀现象、权威归因、检索风险与表征工程等研究,强调本文在固定答案下因果分离了来源与用户背书。

    3. 论文如何解决这个问题?

      论文通过对比激活提取权威、源与用户方向,结合正交投影移除与双向跨度归因补丁因果解耦来源依从与用户迎合。

    4. 论文做了哪些实验?

      实验覆盖8款模型,发现验证源诱导45%–88%翻转,干预区分了源与用户表征,权威移除降低了顺从且保持通用能力。

    5. 有什么可以进一步探索的点?

      作者指出网格最优选择未校正区间、机理分析限于开源模型、缺乏智能体动态环境与正向利用检验等局限。

    6. 总结一下论文的主要内容

      论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。

    完整解读
  10. 分析/可解释性arXiv:2609.25366 · 55

    研究:思维链对答案的约束随模型相对任务难度而变化

    作者通过扰动续写发现CoT承重性随难度上升:Gemma在GSM8K错误传播率3.9%,在BBH达40.9%。

    • 94.5%Gemma-2-9B-IT,GSM8K,旁路率(Table 1)
    • 40.9%Gemma-2-9B-IT,BBH,错误传播率(Table 1)
    • 98.8%Gemma-2-9B-IT,序贯模型已解释离差中难度项占比(Table 5)
    6 问速览探究思维链是否真正因果约束最终答案,发现思维链承重性随任务难度提升而由装饰性向承重性转变。
    1. 这篇论文试图解决什么问题?

      探究思维链是否真正因果约束最终答案,发现思维链承重性随任务难度提升而由装饰性向承重性转变。

    2. 有哪些相关研究?

      围绕思维链忠实性行为分析、机制可解释性与模型自我修正展开,本文在可扩展的因果扰动与表征分析上确立定位。

    3. 论文如何解决这个问题?

      提出基于续写的因果测试协议,通过单步扰动与截断续写度量思维链承重性,并结合探针与激活引导检验其表征与可控性。

    4. 论文做了哪些实验?

      作者在被测模型和正确多步基线中比较难度、扰动、表征与干预;结果支持承重性与模型相对难度相关,但不构成跨模型的普遍因果规律。

    5. 有什么可以进一步探索的点?

      汇总作者明确提出的模型规模、单步扰动与标签噪声等局限,并客观梳理实验覆盖的边界。

    6. 总结一下论文的主要内容

      在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变;这种单向承重性不能等同完整机制忠实性。

    完整解读
  11. 分析/可解释性arXiv:2609.38205 · 56

    系统提示词幻觉:指令前导如何改变语言模型内部计算

    作者分析17个模型的表征,发现角色指令深度重构中间表征,而安全指令仅浅层变化且与无限制指令路径近乎一致。

    • 0.99714个核心模型安全与无限制指令CKA相关均值
    • 50.3% ± 19.5%14个核心模型角色类提示词平均渗透深度
    • 7.3% ± 9.2%14个核心模型安全类提示词平均渗透深度
    6 问速览分析系统提示词如何改变模型内部逐层表征,探究其究竟是深层重构还是表层微调,并阐释安全提示词的越狱脆弱机理。
    1. 这篇论文试图解决什么问题?

      分析系统提示词如何改变模型内部逐层表征,探究其究竟是深层重构还是表层微调,并阐释安全提示词的越狱脆弱机理。

    2. 有哪些相关研究?

      梳理表征相似度、机械可解释性、系统提示词与对齐、层级分析与缩放四类研究,指出此前缺乏对单模型内部表征的系统测量。

    3. 论文如何解决这个问题?

      构建结合CKA表征渗透深度、因果激活修补、二阶微扰界与逐层线性探测的分析框架,量化并验证提示词的内部影响。

    4. 论文做了哪些实验?

      横跨17个模型评估表征渗透率,显示角色指令深度重构而安全指令仅浅层微调,且安全与解除限制指令路径近乎重合。

    5. 有什么可以进一步探索的点?

      作者指出了模型未达前沿尺度、CKA缺乏特征级分辨率、未测多轮解码动态及提示词全为英文等局限。

    6. 总结一下论文的主要内容

      系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。

    完整解读
已经到底了