跳到正文
10月9日 · 周五

全部论文

找到 110 篇

另有 479 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.12361

    研究:法律推理模型引用法条不等于依据法条

    用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条

    发表
    被测模型
    Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
    摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。

    本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。

    深度解读完整解读
  2. 可解释性arXiv 2610.09600

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路

    发表
    被测模型
    Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个

    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    深度解读完整解读
  3. 可解释性arXiv 2610.09087

    U-Space:揭示语言模型不确定性何时与为何产生

    提出 U-SPACE 与 U-LENS,从残差流估计推理轨迹不确定性

    发表
    被测模型
    Gemma-4-31B-it、Qwen3.5-27B、Magistral-Small-2507
    摘要U-SPACE 与 U-LENS 用语义方向和预测熵读推理不确定性,长度控制后仍高于所比基线。

    U-SPACE 与 U-LENS 是面向推理模型的无训练读出:用语义方向定位不确定性的形式,并用一个轨迹分数区分更可能错的回答。

    深度解读完整解读
  4. 可解释性arXiv 2610.08559

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    分析 LLM 去偏激活方向,发现其编码置信度而非公平性

    发表
    被测模型
    Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个

    摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。

    深度解读完整解读
  5. 可解释性arXiv 2610.04925

    TSAE:用于解释时间序列预测模型的结构化稀疏自编码器

    提出 TSAE,用结构化稀疏自编码器解释时间序列预测模型隐特征

    发表
    被测模型
    PatchTST、iTransformer、DLinear 等 4 个
    摘要TSAE 用结构化 SAE 分解冻结预测隐状态。

    TSAE 是插在冻结时间序列预测骨干上的结构化稀疏自编码器,用来把隐 token 分成可检查特征,并配有分轴协议 TSEVAL。

    深度解读完整解读
  6. 可解释性arXiv 2610.04907

    为什么潜意识学习需要海量数据:从引导向量恢复看含噪逆问题

    用转向向量恢复把阈下学习解释为含噪逆问题

    发表
    被测模型
    Qwen2.5-7B-Instruct、Gemma-2-9B-IT
    摘要作者用含噪 Fisher 求逆解释:软监督数百条可恢复转向向量,硬标签要大量独立载体。

    这篇工作用可控的转向向量回收,解释阈下学习为什么通常要很多语义无关的载体。

    深度解读完整解读
  7. 可解释性arXiv 2610.04905

    ScopeSAE 按预测相关性选择建模子空间,实现重建优于原始激活

    提出 ScopeSAE,按预测相关度选层训练 SAE 以发现特征

    发表
    被测模型
    Llama-3.2-1B-Instruct、Qwen2.5-0.5B-Instruct、Qwen2.5-7B-Instruct 等 4 个
    摘要ScopeSAE 按预测相关子空间训练 SAE,写回后的下一 token 交叉熵可以更低。

    ScopeSAE 是一种为 SAE 选择建模子空间的可解释性方法,对象是 LLM 残差流上的下一 token 预测。

    深度解读完整解读
  8. 可解释性arXiv 2610.04676

    用迭代零空间投影提取人格子空间以调控 LLM 行为

    提出 PaSS,在推理时提取并缩放已嵌入的人格子空间

    发表
    被测模型
    Llama3-8B-Instruct、Qwen2.5-7B-Instruct
    摘要PaSS 用 INLP 调制已嵌入人格。

    PaSS 是推理时的人格调制方法:人格已经写在输入里时,把它当成潜空间中的多维子空间来缩放,而不是再注入一个固定方向。

    深度解读完整解读
  9. 可解释性arXiv 2610.04125

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    发表
    被测模型
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    深度解读完整解读
  10. 可解释性arXiv 2610.04119

    研究揭示 Pythia 训练早期低于随机水平的暂时性偏好成因

    因果检验训练早期重复名偏好来自复制早于抑制

    发表
    被测模型
    Pythia 160M、Pythia 410M、Pythia 1B 等 16 个
    摘要早期重复名复制已有害,成熟抑制仍弱,二者时间差对应低于随机的窗口。

    这篇工作分析 Pythia 在 IOI 上学到“续写只出现一次的名字”时,中间为何会出现一段更偏好重复名的窗口。

    深度解读完整解读
  11. 可解释性arXiv 2610.04112

    Spatial-SAE:用空间依赖先验改进视觉概念分解

    提出 Spatial-SAE,用空间依赖先验改进视觉概念分解

    发表
    摘要Spatial-SAE 用空间 Markov 先验替换 patch 独立先验,换取更对齐的视觉概念。

    Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。

    深度解读完整解读
  12. 可解释性arXiv 2610.04017

    WISE 与 JuntaLearner:面向语言模型的交互感知电路发现方法

    提出 WISE 与 JuntaLearner 以发现考虑交互的语言模型电路

    发表
    被测模型
    GPT-2 small、Qwen3-1.7B-Base、Llama-3.1-8B 等 5 个
    摘要用可学习的集合效应给组件排序,并同时看必要性、忠实性与任务特异性。

    JUNTA LEARNER 用集合级因果效应为语言模型组件排序,用来定位任务电路。

    深度解读完整解读
  13. 可解释性arXiv 2610.03698

    DINOv2 中 register token 与高范数 patch token 的功能角色解析

    用 SAE 解析 ViT 中 register 与高范数 patch 的功能角色

    发表
    被测模型
    facebook/dinov2-small、facebook/dinov2-with-registers-small
    摘要register 特征更偏高层语义且消融影响大,outlier 更偏纹理且消融影响小。

    作者用 SAE 比较 DINOv2 中 register token 与高范数 outlier patch token 的语义和功能。register 能减少背景区高范数伪影,但两类 token 编码什么、特征是否分开、消融影响是否不同,此前没有充分建立。在 ImageNet-1k 上取 layer-8 激活:facebook/dinov2-small 用于 outlier 与 Base full,facebook/dinov2-with-registers-small 用于 register 与 Register full。

    深度解读完整解读
  14. 可解释性arXiv 2610.02910

    论文提出用路由梯度敏感度定位稀疏 MoE 模型中的安全敏感专家

    用路由梯度敏感度定位稀疏 MoE 的安全敏感专家

    发表
    被测模型
    Mixtral-8x7B、Qwen1.5-MoE、DeepSeek-MoE 等 5 个
    摘要频率不是敏感度。

    在五个稀疏 MoE 上,用 router 梯度而不是激活频率挑选要抑制的专家,留出恶意提示词上的拒答降得更多。。推理时让少数路由专家不被选中,就可以不重训练地改变拒答,但频率只记录使用次数。

    深度解读完整解读
  15. 可解释性arXiv 2610.02098

    研究揭示机制可解释性中的目标层恢复缺口

    比较等规模电路的忠实度与行为准则,揭示目标层恢复缺口

    发表
    被测模型
    GPT-2 small、four-layer attention-only width-512 code model、InterpBench compiled transformers
    摘要同等规模下 faithfulness 会错排行为更好的电路。

    作者研究电路发现的评测目标:干预定义的 faithfulness 可能偏好一个规模相同、但在固定行为测试上更差地复现完整模型的电路,即 objective-level recovery gap。

    深度解读完整解读