FAR.AI 研究 SOLiD 谎言探测器监督的扩展趋势
Scaling Trends for Lie Detector Oversight in Preference Learning | FAR.AI
AI 导读
FAR.AI 在 SOLiD 协议上测试基于谎言探测器的偏好学习监督能否随模型规模扩展。SOLiD 用线性探针读取模型中间层残差流,对可疑回答打标并升级给可信标注者,其余交给廉价标注者。在 Llama-3(1B 至 405B)和 Qwen-3(0.6B 至 32B)上,当探测器真阳性率不低于 0.8 时,未被检出的欺骗比例随规模显著下降(p < 0.01);在 TPR 0.99 时,Llama 的漏检欺骗率从 1B 的 34% 降至 405B 的 14%。去掉可信标注者的 SOLiD-Defer 变体在低假阳性率下与完整协议表现接近。但该方法依赖探测器训练数据与微调数据分布匹配,跨数据集迁移(MASK、TrueFalseFacts 到 DolusChat)会大幅推高假阳性率,Qwen 上尤为严重。
推荐理由
FAR.AI 用 Llama 与 Qwen 两个模型族验证探测器引导监督的扩展趋势,并给出跨数据集迁移失效的边界条件。