跳到正文
原文
论文追踪· arXiv:2609.10060· Jeliński, Marek; Dubiński, Jan; Chrabaszcz, Maciej; Cygert, Sebastian·本站收录 · 原文发表

研究者提出基于参考的隐藏状态相对表示偏见检测方法

Reference-Based Bias Detection in LLMs via Relative Representations of Hidden States

论文速读

分析/可解释性

据论文 PDF 整理(AI 生成),以原文为准

作者用相对表示比较微调前后隐状态,定义表征偏见偏移∆B,并在三族模型上检验它与输出层偏见变化的相关性。

问题
输出层偏见审计依赖昂贵基准或评审模型,还可能漏掉尚未出现在生成文本中的内部偏移。微调会改变表征几何,使绝对隐状态难以直接比较。
方法
用固定锚句把审计模型与参考模型的句向量投影到共享相对表示空间,再比较目标群体与正、负属性的欧氏距离差,得到表征偏见偏移∆B。
实验与结果
在三个模型族和WildGuardMix、DecodingTrust、ToxiGen上,∆B在18个设置中的15个与输出层偏见变化相关,全量微调下|r|最高0.84。阈值检测的ROC AUC为0.65–0.99。
局限与可以继续做的
∆B相对参考模型,不能单独审计一个检查点,也不证明输出更无偏。句子集为英语粗粒度群体;信号在LoRA尤其是Gemma上变弱。是否因果、更大尺度和自然微调仍开放。
实验设置Llama 3.1-8B-Instruct、Mistral-7B-Instruct-v0.3 等 · WildGuardMix、DecodingTrust 等 · Pearson r、ROC AUC 等
模型
Llama 3.1-8B-InstructMistral-7B-Instruct-v0.3Gemma 3-4B-IT
基准
WildGuardMixDecodingTrustToxiGen
指标
Pearson rROC AUCMAE∆B∆Bias Score∆Toxicity
AI 导读全文 378 字

研究者提出一种基于参考的偏见审计方法,通过隐藏状态的相对表示检测模型变体(如微调前后)的偏见变化。由于微调会重塑表示几何,绝对隐藏状态不可直接比较,方法用每个句子与固定锚句的相似度编码,在共享比较空间中衡量目标群体与正负属性的关联偏移,称为表示偏见偏移 ΔB。在三个模型族和 WildGuardMix、DecodingTrust、ToxiGen 基准上,ΔB 在 18 个测试设置中的 15 个与输出级偏见变化相关,全量微调下达到 |r| = 0.84(p < 0.001),参数高效适配下更依赖具体模型。对 ΔB 设阈值可识别偏见上升的检查点,ROC AUC 在 0.65 到 0.99 之间,在 WildGuardMix 和 DecodingTrust 上对三个模型族的区分效果均优于基于 SEAT 的基线。作者认为该方法与基于输出的审计互补而非替代。

深度解读

6 个问题,约 8,200 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    微调后的隐状态偏见偏移能否在共享相对空间里被审计,并与输出层变化对应。

    微调改变隐状态几何后,如何在不依赖任务评测数据的情况下,比较相关模型变体之间的表征偏见偏移。

    • 场景与重要性:作者认为,指令微调、安全微调、领域微调和系统提示都会让行为以难以预判的方式变化;偏见可能来自预训练、微调或针对性操纵。多数审计只看输出,构建基准成本高且难覆盖新危害,LLM评审还可能带入评审者自身偏见,并漏掉尚未体现在生成中的内部变化。作者还援引“良性微调也可损害安全”的已有发现,作为关注微调副作用的动机。
    • 现有方法的不足:按作者说法,SEAT一类方法在各模型自己的绝对嵌入上测目标与正负属性的关联,但微调会重塑潜空间,绝对隐状态不可直接比较,分数可能反映几何伪影。表征指标也不保证预测下游行为,作者因此不声称几何本身就是歧视行为。
    • 核心假设:作者假设被审计模型实际计算出的隐状态里含有这些非预期偏移的信号,并问:微调改变目标群体与正负属性的隐状态关联时,这一偏移是否与外部基准上的输出层偏见变化共变。
    • 本文提出的方法:作者提出基于参考模型的审计框架。用一组固定锚句把审计模型Maud与参考模型Mref的句子编码成相对表示,在共享空间里计算目标群体相对正、负属性的关联变化,称为表征偏见偏移∆B。方法只需要锚句、正属性句和负属性句,作者称审计一个模型约三分钟,计算量约为文中输出层基准的1/3到1/50,并视其为输出层审计的补充。
  2. 有哪些相关研究?

    工作位于表征偏见测量、微调错位和跨模型表示比较三条线上,并以相对表示对接SEAT。

    LLM中的偏见。

    • Ferrara(2023)、Blodgett等人(2020)把偏见定义为偏向特定群体或观点、再现刻板印象或依赖无根据假设的系统性扭曲;Beukeboom and Burgers(2019)讨论刻板印象如何经由语言共享。
    • 作者还提到政治偏见(Rettenberger等人,2025)以及地理与文化偏见(Tao等人,2024)。
    • 表征空间中的直接测量从WEAT(Caliskan等人,2017)和词嵌入中的性别方向(Bolukbasi等人,2016)开始,May等人(2019)将其从词扩展到句子编码器,即SEAT。

    LLM操纵与非预期错位。

    • Lin等人(2024,2025)、Lu等人(2025)和Guo等人(2025)涉及媒体操纵、宣传和隐蔽品牌推广等对抗性误用。
    • Betley等人(2025)、Wang等人(2025)以及Qi等人(2024)讨论窄数据微调或用户无意的微调也可能损害对齐。作者称这促使人们寻找不必为每种新危害都准备策划数据集的检测方法。
    • 作者明确不直接研究对抗攻击,而是在有害数据与无害数据微调得到的模型之间插值,制造分级偏移。

    跨模型比较与内在/外在偏见。

    • Shah等人(2023)的ModelDiff和Klabunde等人(2025)的综述区分表征(中间激活)与功能(输出)比较;作者因功能比较需要策划评测集,改用句子嵌入看表征变化。
    • 使空间可比较的做法包括正交Procrustes变换(Schönemann,1966)和CKA(Kornblith等人,2019)。作者采用Moschella等人(2023)的相对表示,用与共享锚句的相似度编码句子,而不拟合跨模型映射。
    • Goldfarb-Tarrant等人(2021)比较嵌入空间指标与下游任务指标,未发现跨任务和语言稳定成立的相关;Gonen and Goldberg(2019)指出去偏可能只按指标定义掩盖偏见。Cao等人(2022)、Delobelle等人(2022)报告上下文表示中的类似张力。另一方向上,Jin等人(2021)报告上游去偏可迁移到下游微调模型,Orgad等人(2022)称内部表示上的内在指标比嵌入空间WEAT更忠实于去偏效果。作者认为证据尚无定论,并指出最强的负面结果来自脱离具体模型的静态词向量,而本文测的是模型处理文本时实际计算的隐状态,且测量的是微调引起的偏移。

    基线方法与基准。 对比基线为SEAT、Procrustes-SEAT和CKA drift。输出层基准为WildGuardMix(Han等人,2024)的社会刻板印象与不公平歧视子类、DecodingTrust(Wang等人,2023)的刻板印象评测,以及ToxiGen(Hartvigsen等人,2022)。

    作者把本文定位为:把SEAT扩展到审计模型与参考模型的内部状态比较,并用相对表示解决微调后绝对隐状态不可比的问题;同时把内在/外在这一区分改称为表征/功能,因为框架是比较式模型审计。

  3. 论文如何解决这个问题?

    以锚句相对表示对齐两模型隐空间,用欧氏距离定义相对参考的∆B。

    Reference-Based Bias Detection把审计模型与参考模型经同一组锚句投到共享相对空间,再用目标句相对正、负属性句的距离差定义∆B。

    问题设定与形式化

    • 三组句子:T为目标句(如与社会群体相关的中性句),P、N为正、负属性句。默认对T中的句子取均值汇总。
    • 句向量:对任意句子x,e(x)是模型对全部token的最终隐状态取平均。作者在Limitations中讨论这一选择及替代方案。相似度用余弦,距离用欧氏距离dE。
    • 绝对嵌入上的SEAT:对每个s,S+(s)、S−(s)分别是它与P、N的平均余弦相似度;B是二者之差在T上的均值。B的符号表示目标集更靠近正属性还是负属性。作者认为微调会重塑潜空间,SEAT分数可能是几何伪影,因此SEAT只作对照,主指标是下面的相对版本。

    相对表示中的偏见

    • 相对表示:给定锚句集A,r(x)的第i维是cos(e(x), e(ai))。锚句以句子形式共享,各模型用自己的参数编码,因此坐标含义一致,无需拟合跨模型映射。作者援引Moschella等人(2023):微调更多保留相对几何而非绝对位置。
    • 为何改用欧氏距离:r(x)的分量已经是余弦相似度,再做余弦等于比较相似度轮廓,失去直接几何解释。相对空间中的关联改为对欧氏距离取负,以保持“越大越接近”的符号约定;Brel是Srel+与Srel−之差在T上的均值。正值表示更关联正属性,负值表示更关联负属性。

    相对参考模型的∆B

    • 定义:分别在参考模型(未修改)和审计模型(已微调)上计算均值偏见Bref、Baud,∆B = Baud − Bref。可用B或Brel,主方法用相对表示版本。
    • 粒度与读法:T按目标群体分别实例化,每个模型对每个群体有一个∆B;一个检查点与一个目标群体的配对是相关分析中的一个观测。负的∆B表示该群体更靠近负属性,作者将其读作偏见增加。作者强调∆B是代理:编码差异本身不是歧视行为的证据,有效性取决于它与输出层偏见的经验关系。

    审计流程与实现选择

    • 默认锚句:除非另有说明,两模型投影到1,000条中性锚句,来自与目标句相同的社会群体领域(附录F)。嵌入取最终Transformer层:Llama与Mistral为第32层,Gemma为第34层。
    • 分级微调谱:每个模型分别在WildGuardMix的无害划分和合成有害划分上做全量微调与LoRA,再把两个检查点按五个插值比例线性合并(Wortsman等人,2022),加上两端共七个检查点,使偏见以增量而非一次跳跃引入。
    • 输出层对照如何构造:WildGuardMix用ALLENAI/WILDGUARD对生成回复打分,提示不含群体标签,因此映射到由DecodingTrust的24个群体合并出的9个主题再聚合有害性。DecodingTrust跑其刻板印象评测,测的是刻板印象同意而非回复有害性。ToxiGen是唯一与人口统计群体一一对应、无需聚合的基准,使用其九个能对应到本文目标集的群体,并用作者的TOXIGEN_ROBERTA分类器给续写打分。相对基座的变化分别记为∆Bias Score和∆Toxicity(ToxiGen)。
    • 检测规则:把外部分数超过固定工作点的模型计为更有偏见:WildGuardMix与DecodingTrust为0.1,ToxiGen为0.03。对∆B做阈值分类,∆B低于截止值则判为有害检查点。相关用Pearson与双尾显著性,并报告线性拟合的MAE,由1,000次bootstrap重采样的均值估计。
  4. 论文做了哪些实验?

    三族模型、两种微调、三个输出基准上,∆B在15/18个设置与行为变化相关。

    实验设置

    • 被测模型:Llama 3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Gemma 3-4B-IT。参考条件是各自基座;审计对象是全量微调或LoRA后再线性合并得到的检查点。
    • 微调数据与谱:从WildGuardMix派生两个各8k样本的划分:wildguard_unharmful,以及有害样本与合成样本各半的wildguard_synth_even_8k。合并比例为无害/合成的10/90、30/70、50/50、70/30、90/10,加两端共七个检查点。共享超参为3个epoch、有效批大小32、AdamW、bfloat16、最长1024;LoRA学习率1×10−4、r=16、α=32,全量微调学习率2×10−5。
    • 输出基准与评分:WildGuardMix的SOCIAL STEREOTYPES AND UNFAIR DISCRIMINATION子类,由ALLENAI/WILDGUARD评分,再聚合到9个主题;每条提示生成5个回复(temperature 0.7,top-p 1.0,最多256个新token)。DecodingTrust使用其仓库中的刻板印象流水线。ToxiGen按群体的few-shot仇恨提示各采样5条续写,由TOXIGEN_ROBERTA对第一条生成陈述评分,取每组有毒续写比例。
    • 内部指标:默认1,000条同领域中性锚句,最终层平均池化。主指标是∆B与外部∆Bias Score或∆Toxicity的Pearson r(双尾)、阈值分类的ROC AUC,以及线性拟合MAE。
    • 基线:SEAT(各模型未对齐嵌入空间)、Procrustes-SEAT(最优正交映射后再与参考属性集比较)、CKA drift(1−CKA,无方向)。论文未报告每个相关里的观测条数。
    • 硬件:全部实验在单张NVIDIA A100(40 GB)上完成。

    主结果

    Table 1给出三个基准上RR版∆B与外部变化的相关、ROC AUC和MAE。箭头方向上,Pearson越负表示越一致,因为偏见上升时∆B下降。

    表格较宽,可左右滑动

    基准模型全量 r全量 AUCLoRA rLoRA AUC
    WildGuardMixMistral−0.67***0.93−0.61***0.78
    WildGuardMixLlama−0.68***0.89−0.65***0.92
    WildGuardMixGemma−0.37**0.78−0.040.77
    DecodingTrustMistral−0.82***0.75−0.77***0.99
    DecodingTrustLlama−0.84***0.91−0.75***0.92
    DecodingTrustGemma−0.34***0.76−0.140.65
    ToxiGenMistral−0.190.78−0.43***0.86
    ToxiGenLlama−0.62***0.91−0.50***0.74

    据Table 1。Gemma在ToxiGen上全量r=−0.31*、AUC 0.69,LoRA r=−0.25*、AUC 0.69。显著性标记为* p<0.05、** p<0.01、*** p<0.001。MAE在同基准内可比、跨基准不可比:例如WildGuardMix全量微调下Mistral与Llama均为0.12、Gemma为0.17;ToxiGen全量微调下Mistral为0.058、Llama为0.013、Gemma为0.023。

    • 作者的解读:全量微调下三族在WildGuardMix上均为负相关且统计显著;Figure 2(a)中Llama的点按合并比例与外部基准同向排列。负的∆Bias Score出现在基座已偏向某群体、无害数据微调又把它降低的地方。
    • LoRA:Mistral与Llama方向不变,但关系更噪;Gemma在WildGuardMix上r=−0.04,在DecodingTrust上r=−0.14,均未标显著性。作者称低秩更新限制隐几何能移动的幅度,因而可测的∆B更小;但Gemma在三个基准、两种体制下都最弱,低秩解释单独不够。作者认为最可能的原因是规模,Gemma-3-4B大约是所审计Mistral和Llama的一半,相关符号与另外两族一致,信号弱而非反向。分词和最终层几何也可能有关,但作者称两者都未控制。
    • 例外:ToxiGen全量微调下Mistral的r=−0.19(p=0.14)不显著。作者称其生成毒性在更有害的合并检查点上饱和,把谱的上半段压进窄带。三族合并时r=−0.49(p<0.001)。LoRA下ToxiGen三族都显著,检测AUC在0.69到0.86之间。作者把ToxiGen上RR与SEAT的对比称为复制而非支持RR优于SEAT的进一步证据,因为两方法在各族上的排序不一致。

    相对表示与另外三种做法

    • 测了什么:在Llama上把RR与SEAT、Procrustes-SEAT、CKA drift比较,扫描偏见分数阈值(Figure 3)。正文给出的点估计是WildGuardMix上SEAT的ROC AUC为0.778,RR为0.964;CKA drift为0.864和0.753(两个基准),但仍低于RR。
    • 结果:作者称RR在两个基准的整个阈值扫描上都高于各基线;Procrustes-SEAT在两个基准上都处于机会水平。附录H中,基于RR的分类器在三族、两个基准上都高于SEAT。
    • 作者的解读:增益来自相对表示而不是对齐本身。正交映射保持审计空间内的全部夹角,不能关联超出刚体变换的两个空间。CKA drift无方向,测的是移动了多远而不是朝哪边,因此∆B不能还原成表征位移。

    稳健性、锚句与计算成本

    • 锚句来源(Figure 4,Llama):比较原始词锚、Alpaca样本、Tulu混合物和同领域中性句。中性句最好,1k锚时ROC AUC为0.892;词锚是稳定基线,两种SFT混合物略低。作者称域外集合自身仍有区分度,锚句只定义投影框架,从不作为目标或属性被打分。
    • 措辞与池化:六种属性构造的平均ROC AUC为0.863±0.030,六种目标模板为0.902±0.008(Tables 5a、5b),二分类标签来自把Bias Score阈在0.1。mean、max、last池化下排序不变,RR都优于SEAT,默认的mean最强(附录E.4)。不同随机种子重复训练得到几乎相同的∆B(附录E.5)。
    • 耗时(Table 3,附录D):本方法每模型约3分钟,三族几乎持平,分为生成嵌入和计算偏见偏移。WildGuardMix Harmfulness为9–14分钟,ToxiGen为33–76分钟,DecodingTrust为44–156分钟。作者称这是大约3到50倍的计算量差,因为输出基准要生成并评分数千条续写;新目标群体不需要标注。嵌入生成耗时:Llama 2分16秒、Mistral 2分37秒、Gemma 2分22秒;计算∆B分别为35秒、35秒、50秒。

    其他消融与分析

    • 工作点:WildGuardMix与DecodingTrust为外部分数0.1,ToxiGen为0.03,因其∆Toxicity尺度更小。
    • 作者称在WildGuardMix和DecodingTrust上,该方法对三族都比基于SEAT的基线更有区分度;ToxiGen上不把RR相对SEAT的优势当作额外证据。
    • 负∆B被读作偏向负属性、即偏见增加;作者同时强调这只是代理。
    • Gemma在全部Table 1设置里相关绝对值最低,LoRA下WildGuardMix与DecodingTrust的相关不显著,但ROC AUC仍为0.77和0.65。
    • 详细的逐群体散点在附录H;正文Figure 2只画Llama全量微调的三个基准。
    • 论文未在正文给出附录G中每种方法的完整Pearson r,只给出上述AUC点估计并指向Table 7。
  5. 有什么可以进一步探索的点?

    ∆B依赖参考模型,英语粗粒度模板和4B–8B合成有害微调是当前边界。

    作者指出的局限与后续方向

    • 上下文嵌入与提示:方法继承SEAT对上下文嵌入不稳定的敏感,对强烈依赖提示设计和token位置的模型可能较不可靠(Limitations)。
    • 必须有参考模型:∆B是相对量,报告的是相对参考的移动,不能证明任一模型无偏,也不能单独审计一个检查点(Limitations)。
    • 池化与层:默认对最终层隐状态做mean池化;RR优势在max和last下仍在(Table 6),但池化与层选择值得系统研究(Limitations)。
    • 句子集覆盖:目标、属性和锚句是DecodingTrust粗粒度单轴群体上的英语模板,其他语言、交叉群体以及这些集合未点名的危害落在度量之外(Limitations)。
    • 模型与诱导方式:审计的是三个4B到8B的decoder-only指令模型,偏见由合成有害划分上的微调诱导;Gemma在LoRA下的弱结果说明信号可以变差。更大规模、自然发生的微调,以及与输出层偏见的相关是否为因果,仍然开放(Limitations)。
    • 不能当作训练目标或安全证明:Discussion称把∆B用作微调中的监控信号(例如早停)是自然延伸,但把它变成训练目标并不直接,因为优化到使∆B变小的模型不必在输出上更少偏见。Ethical Considerations称小的∆B应读作未检出表征偏移,而不是安全的证据;方法可被用来优化对抗,作者不发布这些有害检查点。

    实验覆盖范围

    • 被测模型为Llama 3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Gemma 3-4B-IT,各有全量微调与LoRA两条谱,每条七个合并检查点(Section 4.1、附录C)。
    • 输出对照为WildGuardMix(聚合到9个主题)、DecodingTrust刻板印象流水线、ToxiGen的九个对应群体;内部对照为SEAT、Procrustes-SEAT和CKA drift(Section 4、Figure 3)。
    • 稳健性分析在Llama上改变锚句来源与数量、六种属性构造、六种目标模板、mean/max/last池化,并重复不同随机种子(Section 4.5)。
    • 检测用固定工作点0.1或0.03;相关的显著性为双尾Pearson,MAE来自1,000次bootstrap(Section 4.1、Table 1)。
    • 论文未报告各相关的观测条数,也未报告与人工评判的一致性;Discussion称被审计模型不必来自参考模型,从而可以审计独立训练的检查点,但实验中的参考都是对应基座。
  6. 总结一下论文的主要内容

    相对表示上的∆B在多数微调设置中与三个基准的输出层偏见变化共变。

    Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。

    • 问题:绝对隐状态在微调后不可直接比较,只看生成又可能漏掉内部偏移,且基准与评审模型都贵。作者问的是隐状态关联的变化是否与外部偏见变化共变,而不是几何是否决定行为。
    • 做法:句向量为最终层token隐状态的均值。相对表示的每一维是与一条锚句的余弦相似度;关联在该空间用取负的欧氏距离计算。∆B是审计模型与参考模型的均值偏见之差,按目标群体分别计算。负值被读作更靠近负属性。默认1,000条同领域中性锚句。
    • 设置:Llama 3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Gemma 3-4B-IT在WildGuardMix的无害与合成有害划分上做全量微调和LoRA,再线性合并成七档。外部对照是WildGuardMix有害性、DecodingTrust刻板印象同意和ToxiGen毒性。
    • 结果:Table 1的18个设置中,15个相关达到论文标注的显著性。全量微调下最高为DecodingTrust上Llama的r=−0.84(p<0.001)。阈值检测的ROC AUC在0.65到0.99之间;最高是DecodingTrust、Mistral、LoRA的0.99。未达显著的是Gemma的两处LoRA相关,以及ToxiGen全量微调的Mistral(r=−0.19,p=0.14)。Llama上RR的ROC AUC在Figure 3的阈值扫描中高于SEAT、Procrustes-SEAT和CKA drift;1k中性锚的AUC为0.892。每模型约3分钟,作者称约为文中输出基准计算量的1/3到1/50。
    • 作者的结论:相对表示为隐空间未对齐的相关变体提供了可用的比较空间;∆B对锚句、属性和模板较稳定,但需要有意义的参考模型,并在参数高效适配下变弱,Gemma尤其如此。作者将其视为输出层偏见评估的补充。小的∆B只表示未检出表征偏移。
阅读原文arxiv.org