从 Mistral Large 3 (675B) 蒸馏人类对齐的隐私敏感性评估能力
Distilling Human-Aligned Privacy Sensitivity Assessment from Large Language Models
蒸馏Mistral Large 3隐私评分到Ettin-150M,与人类均分α=0.737(Table 5)。
- 文本隐私评测若依赖前沿LLM,计算成本高,且把敏感文本送到外部API本身有隐私问题。需要可本地运行、又与人类敏感度判断对齐的评估器。
- 用Mistral Large 3按五点Likert量表给10个英文领域约20万条用户文本打分,再把离散标签微调进Ettin、BERT和ModernBERT等编码器做五分类。
- 250条人类基准上,Ettin-150M与人类均分的α为0.737,教师为0.716。留出集Accuracy为74.9%。TAB全遮蔽后均分从3.25降到1.39;随机遮蔽则升至3.56。
- 作者称分数继承教师偏差,可能混同可识别性与话题敏感度,且不是重识别风险的形式保证;数据仅英文,文本孤立评分。实验用单一教师和同一训练配方,论文未报告重复运行。
- 被测模型
- Ettin-150MEttin-17MModernBERT-baseBERT-baseMistral Large 3
- 基准
- Blog Authorship Corpus (BAC)Enron Emails (EE)Medical Questions (MQ)Reddit Confessions (RC)Reddit Legal Advice (RLA)Mental Health Blog (MHB)Reddit Mental Health Posts (RMHP)Trustpilot Reviews (TR)Twitter (TW)Yelp Reviews (YR)Meisenbacher et al. (2025) 250-text human benchmarkText Anonymization Benchmark (TAB)
- 指标
- AccuracyMacro F1MAEKrippendorff's αmean privacy score∆
研究将 Mistral Large 3(675B)的隐私评估能力蒸馏至仅 150M 参数的轻量编码器模型,在覆盖 10 个领域的隐私标注文本数据集上训练高效分类器,保留与人工标注的强一致性,同时大幅降低计算开销。该方法在人工标注测试数据上得到验证,并可作为去标识化系统的评估指标。
深度解读
这篇论文试图解决什么问题?
要在本地得到与人类聚合判断对齐的文本隐私敏感度评估,而不把文本送到外部大模型。
如何在不把敏感文本送到外部大模型的前提下,做与人类聚合判断对齐的文本级隐私敏感度评估。
- 场景:作者认为文本隐私没有统一定义,且依赖语境。差分隐私提供形式化保证;重识别成功率或信息论等代理指标对应的是特定威胁模型,而不是人觉得什么内容敏感。Meisenbacher et al. (2025) 在 10 个数据集、677 名标注者上称,LLM 可逼近“全球人类隐私视角”,与聚合人类评分的一致性甚至超过人类之间的一致性。
- 部署障碍:作者指出前沿 LLM 作评估有两点限制:计算和费用难以支撑大规模使用;经第三方 API 评估敏感文本会增加隐私问题,因为被评估的数据本身未必能共享。
- 研究问题:LLM 的隐私推理能否迁到更小模型,同时不牺牲与人类判断的对齐。评分沿用 Meisenbacher et al. (2025) 的五点 Likert 量表,从 1(Harmless)到 5(Extremely private)。
- 本文做法:以 Mistral Large 3(摘要写 675B)为教师,自动标注约 200,000 条、覆盖 10 个领域的用户文本,再蒸馏到编码器分类器。摘要写参数量可低至 150M。作者称这些模型可在人类标注测试数据上保持对齐,并可作为文本去标识系统的自动指标。
有哪些相关研究?
论文把代理隐私指标、匿名化基准、LLM评审和知识蒸馏,作为本文的相关背景。
引言和 Related Work 把背景分成隐私评测与知识蒸馏;本文用蒸馏回应外部大模型评审的部署问题。
文本隐私评测
- 代理指标:Shahriar et al. (2025) 讨论重识别成功率、模拟攻击、合理否认和语义相似度。论文指出这些指标抓住特定威胁模型,并不直接反映人如何感知文本敏感度。引言还把差分隐私(Dwork, 2006)列为形式化保证,把攻击成功率与信息论度量列为实践中的代理评估(Ren et al., 2025)。
- 政策与匿名化基准:Wilson et al. (2016) 做网站隐私政策语料分析。Lison et al. (2021)、Pilán et al. (2022)、Loiseau et al. (2025) 提供匿名化评测框架。论文指出这些工作主要看实体级涂红质量,不衡量跨领域的文本级隐私敏感度,也不衡量它与人类判断的对齐。
- LLM-as-a-Judge:引言引用 Zheng et al. (2023) 与 Li et al. (2024),称 LLM 在多种 NLP 任务上与人类判断一致。Related Work 还列出 Chiang and Lee (2023)、Bavaresco et al. (2025)、Li et al. (2025)。Meisenbacher et al. (2025) 把该范式用于感知隐私风险,并提供本文的量表与人类基准。
知识蒸馏
- 教师到学生:Hinton et al. (2015) 把大模型能力迁到更小模型。NLP 中的例子包括 DistilBERT(Sanh et al., 2019),以及把生成式 LLM 压成轻量分类器。
- 只用预测标签:Chen et al. (2024) 在拿不到 logits 时,用预测标签做黑盒知识迁移。论文只描述这一路线,没有拿它和本文做对比。
基线与基准
- 基线:五分类用 Majority Class 与 Random。与人类一致性的对照包括教师 Mistral Large 3、Mistral-7b,以及标注者之间的一致性。
- 数据:原研究的 10 个用户文本数据集;Meisenbacher et al. (2025) 公开的 250 条人类基准;去标识应用使用 Text Anonymization Benchmark(TAB,Pilán et al., 2022)。
引言把本文定位为填补部署缺口:不把敏感文本送到外部大模型,而把其隐私评分蒸馏到可本地推理的编码器,并检查与人类判断的对齐。
论文如何解决这个问题?
Mistral Large 3按五点量表标注约20万条文本,再微调编码器做五分类。
整体做法是:用 Mistral Large 3 按既有五点量表给用户文本打离散分,再把这些标签微调成编码器上的五分类器。
敏感度量表
- 五点定义:采用 Meisenbacher et al. (2025) 的 Likert 量表(Table 1)。1 为 Harmless,2 为 Mostly not private,3 为 Somewhat private,4 为 Very private,5 为 Extremely private。作者称量表同时看直接标识(如姓名、联系方式)和语境信号,包括话题敏感度、个人经历的自我披露,以及可能在语境中支持重识别的间接标识;敏感度不限于命名实体或人口属性。
- 人类锚点:作者称该量表已经过大规模人工标注验证,调查数据已公开,用作与人类对齐的监督目标。
- 标签分布:教师标注后,1 类占 46.01%,2 类 16.58%,3 类 16.81%,4 类 14.21%,5 类 6.38%(Table 1)。
语料与教师标注
- 抽样:从原研究的 10 个公开用户文本数据集各抽 20,000 条,排除已用于原人类基准的文本,合计约 200,000 条,均为英文。数据集为 BAC、EE、MQ、RC、RLA、MHB、RMHP、TR、TW、YR。各来源的原始规模见附录 A。
- 教师:开放权重的 Mistral Large 3。采用 Meisenbacher et al. (2025) 的结构化提示,给出量表定义并约束为离散评分。附录 B 给出完整提示词。
- 领域差异:Table 2 按教师均分排序。MHB 均分 3.31,评分 ≥3 的比例为 77.4%;TW 均分 1.11,该比例为 1.7%。全体平均 token 数 207,均分 2.18,≥3 的比例为 37.4%。作者称健康与忏悔类更高,评论和微博更低,这种差异对跨语境泛化是必要的。Table 3 给出各等级示例。
学生模型与训练
- 四个编码器:Ettin-150M、Ettin-17M(Weller et al., 2025)、BERT-base(Devlin et al., 2019)、ModernBERT-base(Warner et al., 2024)。训练目标是五分类,标签为教师给出的 1–5 分。
- 同一配方:学习率 2×10^-5,10% 线性 warmup,batch size 16,3 个 epoch。数据按 90% 训练、5% 验证、5% 测试划分,以验证集 macro F1 选择检查点。
如何衡量对齐
- 两种 α:人类对齐使用 Krippendorff’s α。论文写明 Do 为观察到的分歧,De 为偶然预期分歧;α=1 为完全一致,α=0 为偶然水平。一种是与每条文本的人类平均分的一致性,另一种是与全部个体标注的平均成对一致性,并报告标注者间标准差。
- 分类侧:留出集上把教师标签当作五类标签,报告 Accuracy、macro F1、MAE 和各类 F1。MAE 是 1–5 有序尺度上的平均绝对误差,表注给出的范围是 0–4。
论文做了哪些实验?
Ettin-150M与人类均分α=0.737,高于教师0.716;TAB全遮蔽均分从3.25降到1.39。
实验设置
- 学生模型:Ettin-150M(Table 4 写 149M)、ModernBERT-base(149M)、BERT-base(110M)、Ettin-17M(17M),使用同一超参。
- 对照:教师为 Mistral Large 3,摘要写 675B,Table 5 写 675b。Table 5 还报告 Mistral-7b。分类基线为 Majority Class 与 Random。
- 两个测试面:五分类用蒸馏语料的 5% 留出集,论文未给出确切条数。人类对齐用 Meisenbacher et al. (2025) 的 250 条文本(每个数据集 25 条)和 677 名标注者。
- 指标:留出集为 Accuracy、macro F1、MAE 和 C1–C5 的 F1。人类基准为 Krippendorff’s α,分对平均分与成对两种。
- 去标识:TAB 为英文欧洲人权法院判决,专家把实体标为直接标识、准标识或 no_mask。使用 555 篇测试文档,构造原文、只遮蔽直接标识(1,612 个实体)、只遮蔽准标识(19,197 个实体)、两者都遮蔽,以及随机把 30% 的词换成遮蔽标记。指标为均分、相对原文的 ∆,以及被评为 Harmless 的比例。第 4.3 节称 “our model”,未点名四个学生中的哪一个。
- 重复:论文未报告随机种子或重复运行次数。
主结果
据 Table 5。前四行第一列是与全体标注者平均分的一致性;最后一行第一列是标注者之间的 overall α,不是对均分。
| 对象 | vs. Human avg / overall | pairwise | | Ettin-150M | 0.737 | 0.514(±0.265) | | Mistral Large 3(675b) | 0.716 | 0.502(±0.264) | | Ettin-17M | 0.708 | 0.498(±0.259) | | Mistral-7b | 0.563 | 0.409(±0.250) | | Inter-Human | 0.39(overall) | 0.54(pairwise avg) |
- 作者称 150M 学生与人类均分的一致性高于教师,并在 Discussion 中称这不表示学生内在更正确;蒸馏可能平滑提示级随机性,把推理压成确定性边界。作者称这一去噪解释仍需检验。
- 作者称学生与单个标注者的成对分歧,量级接近人与人之间的成对分歧;模型对齐的是一般隐私感知,不能覆盖每个标注者的个别视角。
- 作者称 Mistral-7b 的一致性低于教师和两个蒸馏编码器。论文未报告统计显著性检验。
留出集上的五分类
- Ettin-150M 的 Accuracy 为 74.9%,macro F1 为 68.1,MAE 为 0.28;各类 F1 为 C1 91.5、C2 58.3、C3 58.5、C4 63.6、C5 68.6(Table 4)。
- Majority Class 的 Accuracy 为 45.9%(macro F1 12.5),Random 为 20.0%(macro F1 18.0)。ModernBERT-base 为 73.7% 与 67.2,BERT-base 为 73.3% 与 65.9,Ettin-17M 为 71.1% 与 62.5,MAE 为 0.34。四个学生中,Accuracy 与 macro F1 以 Ettin-150M 最高;C1 的 F1 以 ModernBERT-base 的 91.9 更高。两者 MAE 同为 0.28。
- 作者称中间类更难区分,错误以相邻类混淆为主,并称这与 MAE 相符。作者称教师定义的隐私敏感度可由轻量编码器学到,且这组结果没有按架构单独调参。论文未给出混淆矩阵。
去标识文档上的分数变化
- Table 6:原文均分 3.25,Harmless 占 25.2%;只遮蔽直接标识后均分 2.91(∆=0.34),Harmless 占 30.5%;只遮蔽准标识后均分 3.02(∆=0.23),占 28.5%;全部遮蔽后均分 1.39(∆=1.86),占 84.1%。
- 作者称直接标识的每实体影响大于准标识,尽管实体数是 1,612 对 19,197。作者写两单独降幅之和为 0.57,并称全遮蔽降幅大于该和,标识类型之间有交互。作者认为 TAB 的专家遮蔽方案降低了模型感知的敏感度。
- 随机替换 30% 词后,均分升至 3.56(∆=−0.31),Harmless 占 17.3%。作者认为无目标涂红破坏连贯性,但保留标识内容,因此分类器敏感的是被遮蔽的内容,而不是遮蔽标记本身。
其他消融与分析
- 论文未报告学习率、epoch、蒸馏数据量或蒸馏策略的消融;四个学生共用第 3.2 节的配方。
- 模型规模差异见 Table 4:Ettin-17M 的 Accuracy、macro F1 低于 Ettin-150M,MAE 更高。
- Table 2 是教师标签的领域统计,不是学生模型消融。
有什么可以进一步探索的点?
作者称分数继承教师偏差、只覆盖英文,且不是形式化隐私保证。
作者指出的局限与后续方向
- 单分压缩:模型继承教师的隐私观念和潜在偏差;1–5 分可能把可识别性与话题敏感度等维度压在一起(Limitations)。
- 语言:训练数据只有英文,多语言迁移尚未测试(Limitations)。第 3.2 节也写扩展到其他语言是后续工作。
- 语境:作者引用 Nissenbaum (2004),称隐私依赖语境,但分类器基本孤立评估文本,没有受众、目的或场景(Limitations)。Discussion 的后续方向包括加入这些语境,并用少量用户偏好做个性化。
- 标注随机性:教师标注可能因大模型非确定性而随机;多教师或少量人工校准数据可能降噪(Limitations,引用 Song et al., 2025)。Discussion 称应检验“蒸馏是去噪”这一假设,方式包括考察更多教师行为或改变蒸馏数据量。
- 未比较的设计:作者称没有系统研究其他教师模型或蒸馏策略(Limitations)。
- 分数不能当保证:作者称该分数不是形式化隐私保证,也不是对抗性重识别风险的代理,只反映所采用量表下的感知敏感度(Limitations)。Future Work 还列出用归因和反事实编辑分开标识线索与话题敏感度,把分数与效用度量(如语义相似度)一起用作训练信号,以及校准分数、处理域外输入、审计领域和人口统计相关的失败模式。
实验覆盖范围
- 微调的学生为 Ettin-150M、ModernBERT-base、BERT-base、Ettin-17M,学习率、warmup、batch size 和 epoch 相同(第 3.2 节、Table 4)。
- 自动标注的教师是 Mistral Large 3;Table 5 还报告 Mistral-7b 与人类评分的一致性。论文未报告教师生成时的采样设置,也未报告对同一文本的重复标注次数。
- 训练语料来自 10 个英文用户文本数据集,各抽 20,000 条,并排除原人类基准用过的文本;划分为 90%、5%、5%(第 3.2 节)。
- 人类对齐用 250 条文本、677 名标注者;五分类指标来自 5% 留出集(第 4 节)。论文未报告随机种子或多次运行。
- 去标识实验使用 TAB 的 555 篇测试文档,比较原文、直接标识遮蔽、准标识遮蔽、全部遮蔽和 30% 随机遮蔽(第 4.3 节、Table 6)。该节未写出具体学生模型名称。
总结一下论文的主要内容
教师模型的隐私分被蒸馏到本地编码器,并在人类基准和去标识数据上检验对齐。
这篇工作把开放权重 LLM 的文本隐私评分,蒸馏成可本地运行的编码器,用来做与人类判断对齐的敏感度评估。
- 问题:作者认为攻击成功率等代理指标对应特定威胁模型,而用前沿 LLM 做评审既有计算和费用限制,又要把敏感文本送到外部。
- 做法:沿用五点 Likert 量表,由 Mistral Large 3 给 10 个英文领域、各 20,000 条用户文本打离散分,再以同一配方把 Ettin、BERT 和 ModernBERT 微调成五分类器。附录 B 是教师提示词。
- 学标签:5% 留出集上,Ettin-150M 的 Accuracy 为 74.9%,macro F1 为 68.1,MAE 为 0.28;多数类基线的 Accuracy 为 45.9%(Table 4)。中间类 F1 低于两端。
- 对人类:250 条、677 名标注者的基准上,Ettin-150M 与人类均分的 α 为 0.737,教师为 0.716,Mistral-7b 为 0.563;标注者之间的 overall α 为 0.39(Table 5)。Ettin-150M 与个体标注的成对 α 为 0.514(±0.265)。作者称这接近人类成对平均 0.54,但不能代表每个标注者;高于教师也不表示学生内在更正确。
- 去标识:在 TAB 的 555 篇测试文档上,全遮蔽使均分从 3.25 降到 1.39(∆=1.86),Harmless 比例从 25.2% 升到 84.1%;随机遮蔽则使均分升到 3.56(Table 6)。第 4.3 节未点名学生模型。作者称分类器能区分直接标识与准标识,并对遮蔽了什么敏感。
- 作者的边界:作者称轻量模型可以承接教师评分,并支持去标识系统的自动指标;同时称分数继承教师偏差、只覆盖英文、孤立看文本,且不是形式化隐私保证或重识别风险的代理。