研究:法律推理模型引用法条不等于依据法条
用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条
- arXiv
- 2610.12361
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3-8B、Qwen3-14B、Llama-3.1-8B 等 7 个
摘要作者通过依据置换反事实与内部承诺追踪发现法律 CoT 裁决对依据依赖度有限,且易受提示注入操纵。
本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。
用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条
本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。
用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
提出人格层级模型并设计 PPR 抑制奖励作弊的跨上下文泛化
摘要提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。
提出 U-SPACE 与 U-LENS,从残差流估计推理轨迹不确定性
U-SPACE 与 U-LENS 是面向推理模型的无训练读出:用语义方向定位不确定性的形式,并用一个轨迹分数区分更可能错的回答。
定位安全敏感参数并稀疏改动权重以削弱安全对齐
分析 LLM 去偏激活方向,发现其编码置信度而非公平性
摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
提出 ANYBOTTLE,按教师残差从无监督概念池筛选紧凑概念瓶颈
ANYBOTTLE 是一套用冻结骨干和无监督概念池构建任务专用概念瓶颈的配方,目标是去掉概念标注后仍保持小词表。
比较 LLM 与人类的错觉模式知觉,并用 SAE 分析内部表示
作者研究 LLM 是否会在证据不支持时构造关系,并将这一失败称为错觉模式知觉,用来区别偏差、幻觉和鲁棒性。
用 SAE 识别天气模型内部的大气河概念并检验预报依赖
作者用稀疏自编码器读 GraphCast 如何在内部表示大气河,而不是只做输入归因。
提出 TRACE,仅凭检查点更新审计有害合规微调目标
作者在检查点更新里寻找有害合规 SFT 的目标组成,并把读数做成不查询模型、不看未知训练数据的审计分 TRACE。
提出 BeFOND,将稀疏自编码器的推断与学习统一为自然梯度流
BeFOND是无编码器的迭代稀疏编码模型,把推断和词典学习写成同一变分自由能上的自然梯度流,用来恢复重叠或很少激活的特征。问题在于摊销编码器的一次前向难以处理 superposition,而在已学词典上只改推断也填不上恢复差距。推断误差会进入词典更新。
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
提出 TSAE,用结构化稀疏自编码器解释时间序列预测模型隐特征
TSAE 是插在冻结时间序列预测骨干上的结构化稀疏自编码器,用来把隐 token 分成可检查特征,并配有分轴协议 TSEVAL。
用转向向量恢复把阈下学习解释为含噪逆问题
这篇工作用可控的转向向量回收,解释阈下学习为什么通常要很多语义无关的载体。
提出 ScopeSAE,按预测相关度选层训练 SAE 以发现特征
ScopeSAE 是一种为 SAE 选择建模子空间的可解释性方法,对象是 LLM 残差流上的下一 token 预测。
提出 PaSS,在推理时提取并缩放已嵌入的人格子空间
PaSS 是推理时的人格调制方法:人格已经写在输入里时,把它当成潜空间中的多维子空间来缩放,而不是再注入一个固定方向。
提出 ConEx,自动发现类别概念并生成可定位解释图
ConEx 是不重训练分类器的 post-hoc 框架,把自动概念变成带位置的视觉解释。
提出 KANSteer,用非线性激活引导拟合文生图有序概念轨迹
KANSteer 研究文生图扩散模型里,有序视觉概念能否沿单一激活方向被遍历,并改用一维曲线做 steering。
测量安全拒绝与一般语境拒绝的转向维数
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。