研究:法律推理模型引用法条不等于依据法条
用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条
- arXiv
- 2610.12361
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。
本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。
用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条
本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。
提出人格层级模型并设计 PPR 抑制奖励作弊的跨上下文泛化
摘要提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。
分析 LLM 去偏激活方向,发现其编码置信度而非公平性
摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
用转向向量恢复把阈下学习解释为含噪逆问题
这篇工作用可控的转向向量回收,解释阈下学习为什么通常要很多语义无关的载体。
提出 PaSS,在推理时提取并缩放已嵌入的人格子空间
PaSS 是推理时的人格调制方法:人格已经写在输入里时,把它当成潜空间中的多维子空间来缩放,而不是再注入一个固定方向。
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
因果检验训练早期重复名偏好来自复制早于抑制
这篇工作分析 Pythia 在 IOI 上学到“续写只出现一次的名字”时,中间为何会出现一段更偏好重复名的窗口。
提出 Spatial-SAE,用空间依赖先验改进视觉概念分解
Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。
提出 ClasSAE,在 SAE 训练中学习特征与类别的可微亲和
ClasSAE 把已知类别写进 SAE 的训练,而不是在冻结词典上事后找特征。。
提出 WISE 与 JuntaLearner 以发现考虑交互的语言模型电路
JUNTA LEARNER 用集合级因果效应为语言模型组件排序,用来定位任务电路。
用 SAE 解析 ViT 中 register 与高范数 patch 的功能角色
作者用 SAE 比较 DINOv2 中 register token 与高范数 outlier patch token 的语义和功能。register 能减少背景区高范数伪影,但两类 token 编码什么、特征是否分开、消融影响是否不同,此前没有充分建立。在 ImageNet-1k 上取 layer-8 激活:facebook/dinov2-small 用于 outlier 与 Base full,facebook/dinov2-with-registers-small 用于 register 与 Register full。
用路由梯度敏感度定位稀疏 MoE 的安全敏感专家
在五个稀疏 MoE 上,用 router 梯度而不是激活频率挑选要抑制的专家,留出恶意提示词上的拒答降得更多。。推理时让少数路由专家不被选中,就可以不重训练地改变拒答,但频率只记录使用次数。
用 SAE 在开源 LLM 中定位临床概念中心并检验因果使用
用 J-lens 检测辩论中屈从多数的智能体是否仍内部表征原前提
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
比较等规模电路的忠实度与行为准则,揭示目标层恢复缺口
作者研究电路发现的评测目标:干预定义的 faithfulness 可能偏好一个规模相同、但在固定行为测试上更差地复现完整模型的电路,即 objective-level recovery gap。
提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道
作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。
提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
审计路由熵是否在置信度之外仍携带预测正确性信息
这篇工作审计 Attention-Residual 视觉 Transformer 的路由熵,能否在模型自身输出之外充当不确定性信号。
提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释
DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。