研究:法律推理模型引用法条不等于依据法条
用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条
- arXiv
- 2610.12361
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。
本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。
用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条
本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。
用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
提出人格层级模型并设计 PPR 抑制奖励作弊的跨上下文泛化
摘要提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。
分析 LLM 去偏激活方向,发现其编码置信度而非公平性
摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
用转向向量恢复把阈下学习解释为含噪逆问题
这篇工作用可控的转向向量回收,解释阈下学习为什么通常要很多语义无关的载体。
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
提出 Spatial-SAE,用空间依赖先验改进视觉概念分解
Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。
用 SAE 解析 ViT 中 register 与高范数 patch 的功能角色
作者用 SAE 比较 DINOv2 中 register token 与高范数 outlier patch token 的语义和功能。register 能减少背景区高范数伪影,但两类 token 编码什么、特征是否分开、消融影响是否不同,此前没有充分建立。在 ImageNet-1k 上取 layer-8 激活:facebook/dinov2-small 用于 outlier 与 Base full,facebook/dinov2-with-registers-small 用于 register 与 Register full。
用路由梯度敏感度定位稀疏 MoE 的安全敏感专家
在五个稀疏 MoE 上,用 router 梯度而不是激活频率挑选要抑制的专家,留出恶意提示词上的拒答降得更多。。推理时让少数路由专家不被选中,就可以不重训练地改变拒答,但频率只记录使用次数。
用 SAE 在开源 LLM 中定位临床概念中心并检验因果使用
用 J-lens 检测辩论中屈从多数的智能体是否仍内部表征原前提
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
比较等规模电路的忠实度与行为准则,揭示目标层恢复缺口
作者研究电路发现的评测目标:干预定义的 faithfulness 可能偏好一个规模相同、但在固定行为测试上更差地复现完整模型的电路,即 objective-level recovery gap。
提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道
作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。
提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
审计路由熵是否在置信度之外仍携带预测正确性信息
这篇工作审计 Attention-Residual 视觉 Transformer 的路由熵,能否在模型自身输出之外充当不确定性信号。
提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释
DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。
提出 D-Scope,用视觉质心检索 SAE 解码方向并转向扩散生成
D-Scope把扩散 Transformer 中 SAE 特征的高激活图像块,接到文本查询驱动的单方向生成干预上。
分析多轮攻击中有害性与拒答表征的几何演化
作者刻画多轮攻击里 harmfulness 与 refusal 相关表示如何随对话变化,而不提出新的攻击或防御。
提出 HNC,在单个解附近遍历保函数权重并比较内部表示
Hessian Null Space Continuation(HNC)用局部曲率,在单个已训练网络周围遍历近似保持输入输出的连通低损失区域,并可用可微目标做引导。作者要回答的是:这个区域里是否真有不同的内部机制,而不只是同一表示的小改动。做法是交替执行零空间内的平坦步与函数匹配损失上的梯度恢复。