跳到正文
10月10日 · 周六

全部论文

找到 124 篇

另有 244 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.12361

    研究:法律推理模型引用法条不等于依据法条

    用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条

    发表
    被测模型
    Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
    摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。

    本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。

    深度解读完整解读
  2. 可解释性arXiv 2610.10865

    用路由稀疏自编码器解耦语音编码器中的语言学与副语言学信息

    提出路由 TopK SAE,把语音编码器稀疏码拆成语言与副语言通路

    发表
    被测模型
    SPEAR XLarge、WavLM Large
    摘要路由 SAE 在冻结 SPEAR 与 WavLM 上分开语言和副语言因子,探针与交换支持通路分工。

    TopK SAE 的稀疏码被分成语言通路与副语言通路,用来分开冻结语音编码器里同时存在的音素信息和说话人、情感、韵律。只重构不能得到作者选定的这一分解。语言通路由音素识别监督,副语言通路由说话人识别、情感分类和韵律预测监督,作用在对方通路上的梯度反转对抗用来压低交叉因子。

    深度解读完整解读
  3. 可解释性arXiv 2610.09600

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路

    发表
    被测模型
    Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个

    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    深度解读完整解读
  4. 可解释性arXiv 2610.09087

    U-Space:揭示语言模型不确定性何时与为何产生

    提出 U-SPACE 与 U-LENS,从残差流估计推理轨迹不确定性

    发表
    被测模型
    Gemma-4-31B-it、Qwen3.5-27B、Magistral-Small-2507
    摘要U-SPACE 与 U-LENS 用语义方向和预测熵读推理不确定性,长度控制后仍高于所比基线。

    U-SPACE 与 U-LENS 是面向推理模型的无训练读出:用语义方向定位不确定性的形式,并用一个轨迹分数区分更可能错的回答。

    深度解读完整解读
  5. 可解释性arXiv 2610.08559

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    分析 LLM 去偏激活方向,发现其编码置信度而非公平性

    发表
    被测模型
    Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个

    摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。

    深度解读完整解读
  6. 可解释性arXiv 2610.08552

    AnyBottle:只保留真正需要的概念,构建紧凑任务专属概念瓶颈模型

    提出 ANYBOTTLE,按教师残差从无监督概念池筛选紧凑概念瓶颈

    发表
    被测模型
    CLIP-DINOiser、Gemma-2-2B、Gemma-3-1B-it
    摘要ANYBOTTLE 用教师残差选出紧凑概念集,并以 nested dropout 按样本调节概念预算。

    ANYBOTTLE 是一套用冻结骨干和无监督概念池构建任务专用概念瓶颈的配方,目标是去掉概念标注后仍保持小词表。

    深度解读完整解读
  7. 可解释性arXiv 2610.07791

    研究:LLM 比人类更易产生错觉模式感知并导致虚假推理

    比较 LLM 与人类的错觉模式知觉,并用 SAE 分析内部表示

    发表
    被测模型
    GPT-3.5、GPT-4o、GPT-5 等 9 个
    摘要作者称多数 LLM 的错觉模式知觉强于人类,并把行为联系到频率印象与分析特征。

    作者研究 LLM 是否会在证据不支持时构造关系,并将这一失败称为错觉模式知觉,用来区别偏差、幻觉和鲁棒性。

    深度解读完整解读
  8. 可解释性arXiv 2610.07518

    TRACE:仅凭 checkpoint 更新审计大语言模型有害目标

    提出 TRACE,仅凭检查点更新审计有害合规微调目标

    发表
    被测模型
    Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Qwen3-8B 等 6 个
    摘要作者称有害合规 SFT 在检查点更新中留下可排序坐标,并据此做只读权重审计。

    作者在检查点更新里寻找有害合规 SFT 的目标组成,并把读数做成不查询模型、不看未知训练数据的审计分 TRACE。

    深度解读完整解读
  9. 可解释性arXiv 2610.07389

    BeFOND 将稀疏自编码器的推断与学习统一为自然梯度流

    提出 BeFOND,将稀疏自编码器的推断与学习统一为自然梯度流

    发表
    摘要BeFOND 把推断与学习写成自然梯度流,并在合成词典恢复和 Gemma 特征指标上报告更高分数。

    BeFOND是无编码器的迭代稀疏编码模型,把推断和词典学习写成同一变分自由能上的自然梯度流,用来恢复重叠或很少激活的特征。问题在于摊销编码器的一次前向难以处理 superposition,而在已学词典上只改推断也填不上恢复差距。推断误差会进入词典更新。

    深度解读完整解读
  10. 可解释性arXiv 2610.04925

    TSAE:用于解释时间序列预测模型的结构化稀疏自编码器

    提出 TSAE,用结构化稀疏自编码器解释时间序列预测模型隐特征

    发表
    被测模型
    PatchTST、iTransformer、DLinear 等 4 个
    摘要TSAE 用结构化 SAE 分解冻结预测隐状态。

    TSAE 是插在冻结时间序列预测骨干上的结构化稀疏自编码器,用来把隐 token 分成可检查特征,并配有分轴协议 TSEVAL。

    深度解读完整解读
  11. 可解释性arXiv 2610.04907

    为什么潜意识学习需要海量数据:从引导向量恢复看含噪逆问题

    用转向向量恢复把阈下学习解释为含噪逆问题

    发表
    被测模型
    Qwen2.5-7B-Instruct、Gemma-2-9B-IT
    摘要作者用含噪 Fisher 求逆解释:软监督数百条可恢复转向向量,硬标签要大量独立载体。

    这篇工作用可控的转向向量回收,解释阈下学习为什么通常要很多语义无关的载体。

    深度解读完整解读
  12. 可解释性arXiv 2610.04905

    ScopeSAE 按预测相关性选择建模子空间,实现重建优于原始激活

    提出 ScopeSAE,按预测相关度选层训练 SAE 以发现特征

    发表
    被测模型
    Llama-3.2-1B-Instruct、Qwen2.5-0.5B-Instruct、Qwen2.5-7B-Instruct 等 4 个
    摘要ScopeSAE 按预测相关子空间训练 SAE,写回后的下一 token 交叉熵可以更低。

    ScopeSAE 是一种为 SAE 选择建模子空间的可解释性方法,对象是 LLM 残差流上的下一 token 预测。

    深度解读完整解读
  13. 可解释性arXiv 2610.04676

    用迭代零空间投影提取人格子空间以调控 LLM 行为

    提出 PaSS,在推理时提取并缩放已嵌入的人格子空间

    发表
    被测模型
    Llama3-8B-Instruct、Qwen2.5-7B-Instruct
    摘要PaSS 用 INLP 调制已嵌入人格。

    PaSS 是推理时的人格调制方法:人格已经写在输入里时,把它当成潜空间中的多维子空间来缩放,而不是再注入一个固定方向。

    深度解读完整解读
  14. 可解释性arXiv 2610.06945

    超越线性表征假设:KANSteer 用非线性激活引导文本到图像模型

    提出 KANSteer,用非线性激活引导拟合文生图有序概念轨迹

    发表
    被测模型
    FLUX.1-schnell、FLUX.1-dev
    摘要KANSteer 用曲线替代固定方向。

    KANSteer 研究文生图扩散模型里,有序视觉概念能否沿单一激活方向被遍历,并改用一维曲线做 steering。

    深度解读完整解读