研究:LLM 潜在空间去偏方向主要编码置信度而非公平性
分析 LLM 去偏激活方向,发现其编码置信度而非公平性
- arXiv
- 2610.08559
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Ministral-3-8B-Base、Ministral-3-8B-Instruct、Llama-3.1-8B 等 8 个
摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
另有 75 篇论文还没打上分类标签,暂不在筛选结果里。
分析 LLM 去偏激活方向,发现其编码置信度而非公平性
摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
用几何投影与因果交换干预,分析拒绝机制读取的道德表征
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。
用探针与激活导向分析语言模型的评测意识表征及言语化
摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。
提出因果可解释性仪器校准规程,识别决策位点测量失效
摘要论文系统梳理并实证揭示了大模型可解释性测量的六种伪影陷阱,提出了四项严格的校准与验证规程。
用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变
Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。
分析隐蔽推理在思维链监控下的信息足迹下界与不可读性
摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。
提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
因果解耦来源依从与用户迎合的内部机制
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
提取疼痛方向并检验激活转向是否驱动有害删除选择
提出 LocUS,用词汇子空间选择注意力头并约束激活转向
LocUS 是不更新权重的推理时转向方法,把差分均值更新限制在少数注意力头及其属性对齐子空间。
B IAS R EDUCER 只改奖励头,按数据集选择属性编辑。
BIASREDUCER 是一种只改线性奖励头的奖励模型编辑框架,用来降低模型对预定义表面属性的依赖,并按新数据集决定改哪些属性。
用价态转向检验模型是否依据隐藏效价做出选择
作者研究语言模型是否会按价态相关的隐藏状态行动。他们不直接询问感受,因为回答可能来自内省、表面匹配或训练脚本。
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
提出 HERALD,用跨层有害投影轨迹检测越狱提示
摘要HPD 用跨层投影形状区分有害与良性提示。
测量系统提示词对模型逐层计算的重构程度
摘要系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。
用权重余弦给 GLU 神经元做读写功能分类并检验消融影响
这篇分析工作用输入权重与输出权重的余弦,给 GLU 神经元的读写功能分类,并检查这些类的层分布、激活频率和对下一 token 分布的影响。
检验激活引导向量的几何是否符合人类价值结构
作者研究推理时 activation steering 的向量,是否在几何上符合人类价值理论,而不只是改变单一目标行为。
分析激活引导干扰反映模型默认倾向而非行为方向
Activation steering 的跨行为干扰由模型的默认集合决定,而不是由行为方向的几何重叠决定。。
揭示相邻 Transformer 层相互抵消残差写入的 TLCM