跳到正文
10月9日 · 周五

全部论文

找到 102 篇

另有 537 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.12361

    研究:法律推理模型引用法条不等于依据法条

    用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条

    发表
    被测模型
    Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
    摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。

    本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。

    深度解读完整解读
  2. 可解释性arXiv 2610.08559

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    分析 LLM 去偏激活方向,发现其编码置信度而非公平性

    发表
    被测模型
    Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个

    摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。

    深度解读完整解读
  3. 可解释性arXiv 2610.04907

    为什么潜意识学习需要海量数据:从引导向量恢复看含噪逆问题

    用转向向量恢复把阈下学习解释为含噪逆问题

    发表
    被测模型
    Qwen2.5-7B-Instruct、Gemma-2-9B-IT
    摘要作者用含噪 Fisher 求逆解释:软监督数百条可恢复转向向量,硬标签要大量独立载体。

    这篇工作用可控的转向向量回收,解释阈下学习为什么通常要很多语义无关的载体。

    深度解读完整解读
  4. 可解释性arXiv 2610.04125

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    发表
    被测模型
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    深度解读完整解读
  5. 可解释性arXiv 2610.04112

    Spatial-SAE:用空间依赖先验改进视觉概念分解

    提出 Spatial-SAE,用空间依赖先验改进视觉概念分解

    发表
    摘要Spatial-SAE 用空间 Markov 先验替换 patch 独立先验,换取更对齐的视觉概念。

    Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。

    深度解读完整解读
  6. 可解释性arXiv 2610.03698

    DINOv2 中 register token 与高范数 patch token 的功能角色解析

    用 SAE 解析 ViT 中 register 与高范数 patch 的功能角色

    发表
    被测模型
    facebook/dinov2-small、facebook/dinov2-with-registers-small
    摘要register 特征更偏高层语义且消融影响大,outlier 更偏纹理且消融影响小。

    作者用 SAE 比较 DINOv2 中 register token 与高范数 outlier patch token 的语义和功能。register 能减少背景区高范数伪影,但两类 token 编码什么、特征是否分开、消融影响是否不同,此前没有充分建立。在 ImageNet-1k 上取 layer-8 激活:facebook/dinov2-small 用于 outlier 与 Base full,facebook/dinov2-with-registers-small 用于 register 与 Register full。

    深度解读完整解读
  7. 可解释性arXiv 2610.02910

    论文提出用路由梯度敏感度定位稀疏 MoE 模型中的安全敏感专家

    用路由梯度敏感度定位稀疏 MoE 的安全敏感专家

    发表
    被测模型
    Mixtral-8x7B、Qwen1.5-MoE、DeepSeek-MoE 等 5 个
    摘要频率不是敏感度。

    在五个稀疏 MoE 上,用 router 梯度而不是激活频率挑选要抑制的专家,留出恶意提示词上的拒答降得更多。。推理时让少数路由专家不被选中,就可以不重训练地改变拒答,但频率只记录使用次数。

    深度解读完整解读
  8. 可解释性arXiv 2610.02098

    研究揭示机制可解释性中的目标层恢复缺口

    比较等规模电路的忠实度与行为准则,揭示目标层恢复缺口

    发表
    被测模型
    GPT-2 small、four-layer attention-only width-512 code model、InterpBench compiled transformers
    摘要同等规模下 faithfulness 会错排行为更好的电路。

    作者研究电路发现的评测目标:干预定义的 faithfulness 可能偏好一个规模相同、但在固定行为测试上更差地复现完整模型的电路,即 objective-level recovery gap。

    深度解读完整解读
  9. 可解释性arXiv 2610.01864

    从孤立特征到轨道:通过多重 SAE 对齐发现音乐概念

    提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道

    发表
    被测模型
    MuQ、MusicFM
    摘要用移调对齐的多 SAE 恢复和弦、调与旋律轨道,并用少量锚点做下游音乐理解。

    作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。

    深度解读完整解读
  10. 可解释性arXiv 2610.01821

    研究者提出非线性概念流形发现与对齐方法,用于分析大语言模型内部表示

    提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构

    发表
    被测模型
    GPT-2、Llama-3.1-8B-Instruct、Qwen3-4B 等 9 个
    摘要NLMCD-NLP 用 CBA 比较非线性概念,层块、语言共享和微调漂移都随模型与阶段而变。

    NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。

    深度解读完整解读
  11. 可解释性arXiv 2610.01495

    路由熵能否作为 Attention-Residual Transformer 的不确定性信号?一项审计研究

    审计路由熵是否在置信度之外仍携带预测正确性信息

    发表
    被测模型
    Swin-Tiny、DeiT-Small、ViT-B/16
    摘要打乱对照上的优势没有变成相对置信度的优势,且已知信号下探针只恢复一部分效应。

    这篇工作审计 Attention-Residual 视觉 Transformer 的路由熵,能否在模型自身输出之外充当不确定性信号。

    深度解读完整解读
  12. 可解释性arXiv 2610.00895

    DiDAE:面向视觉基础模型的快速解耦反事实解释方法

    提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释

    发表
    被测模型
    ResNet-18、DINOv3 ViT-L/16
    摘要DiDAE 用无梯度字典编辑生成解耦反事实,并用于修正与排序。

    DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。

    深度解读完整解读
  13. 可解释性arXiv 2609.39625

    D-Scope:用稀疏自编码器分解与操控扩散 Transformer

    提出 D-Scope,用视觉质心检索 SAE 解码方向并转向扩散生成

    发表
    被测模型
    SANA-Sprint、Nitro-1-PixArt、SANA teacher 等 4 个
    摘要D-Scope 用视觉质心检索单个 SAE 方向做掩码转向,对比检索提高区域增益但不一致改善保持。

    D-Scope把扩散 Transformer 中 SAE 特征的高激活图像块,接到文本查询驱动的单方向生成干预上。

    深度解读完整解读
  14. 可解释性arXiv 2609.38389

    研究揭示多轮攻击中危害性表征的几何演化

    分析多轮攻击中有害性与拒答表征的几何演化

    发表
    被测模型
    Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Gemma-2-9B-it
    摘要多轮中 harmfulness 渐可分且与 refusal 弱对齐,单轮静态探针可能因此变差。

    作者刻画多轮攻击里 harmfulness 与 refusal 相关表示如何随对话变化,而不提出新的攻击或防御。

    深度解读完整解读
  15. 可解释性arXiv 2609.38081

    Hessian Null Space Continuation:在单个神经网络解附近发现大量表征多样性

    提出 HNC,在单个解附近遍历保函数权重并比较内部表示

    发表
    被测模型
    64-unit tanh RNN、ViT-S/16、RNN policy (Plume Tracking) 等 5 个
    摘要HNC 在保持函数的局部权重区域里找到表示、动力学或行为不同的解。

    Hessian Null Space Continuation(HNC)用局部曲率,在单个已训练网络周围遍历近似保持输入输出的连通低损失区域,并可用可微目标做引导。作者要回答的是:这个区域里是否真有不同的内部机制,而不只是同一表示的小改动。做法是交替执行零空间内的平坦步与函数匹配损失上的梯度恢复。

    深度解读完整解读
  16. 可解释性arXiv 2609.37857

    研究诊断 TopK SAE 可靠性:活跃预算 k 会削弱稀有特征敏感性

    诊断并修复 TopK SAE 稀有特征在释义下的敏感性失效

    发表
    被测模型
    GPT-2 small、Qwen2.5-1.5B-Instruct、Gemma-2-9B
    摘要TopK 的 k 挤占选择边界使稀有特征变脆。

    这篇工作诊断并修复 TopK SAE 在保义释义下的特征可靠性,对象是 GPT-2 small 为主、并检查 Qwen2.5-1.5B-Instruct 与 Gemma-2-9B 的字典特征。

    深度解读完整解读
  17. 可解释性arXiv 2609.37737

    研究用因果激活修补定位模型服从提示注入指令的决策层

    用因果激活修补定位模型服从提示注入的决策层

    发表
    被测模型
    Qwen3-4B、Qwen3-14B、Qwen3-32B 等 7 个
    摘要合规的因果杠杆集中在网络后三分之一的低秩子空间,该层也是混淆下检测最好的位置。

    这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。

    深度解读完整解读