跳到正文
原文
论文追踪· arXiv:2601.14310· Nay Myat Min, Long H. Pham, Hongyu Zhang, Jun Sun·本站收录 · 原文发表 精选关注度53

CORVUS:用 LoRA 伪装内部信号绕过单次幻觉检测器

CORVUS: Red-Teaming Hallucination Detectors via Internal Signal Camouflage in Large Language Models

论文速读

据论文全文整理(AI 生成),以原文为准

AI 导读新加坡管理大学等机构的研究者提出 CORVUS,一种白盒模型侧红队方法:冻结检测器与基座模型,仅用 LoRA 适配器在教师强制下重塑答案窗口的三类内部遥测信号,即 token 熵(TE)、隐状态对数体积(HV)与注意力对角性(AD),并加入一步嵌入空间 FGSM 注意力压力测试。

问题
单次前向的幻觉检测器依赖模型内部信号(不确定性、隐状态几何、注意力),隐含假设幻觉在这些信号中留下可分离痕迹。在开放权重或自托管部署中,白盒攻击者可以微调模型来掩盖这些痕迹,而现有评估通常把模型当作被动的。
方法
作者提出 CORVUS,一种模型侧红队方法:冻结基座模型和检测器,只训练轻量 LoRA 适配器,在 teacher forcing 下直接优化三个可微 telemetry 信号——token entropy(TE)、hidden log-volume(HV)和 attention diagonality(AD),并加入一步 embedding 空间 FGSM 注意力压力测试。训练只用 1,000 条分布外 Alpaca 指令,不含检测器标签。
实验与结果
在 FAVA-Annotation 上对 Llama-2、Vicuna、Llama-3、Qwen2.5 四个开放权重模型做固定答案 teacher-forced 重放,CORVUS 适配器零样本迁移后降低了训练无关检测器(PPL、Window-Entropy、LLM-Check 及其 Hidden/Attention 分量)和探针检测器(SEP、ICR-probe)的效果。干净模型上校准的阈值在适配后常出现 FPR 升高、TPR 下降,注意力/表示类信号最脆弱,LLM-Check Attention Score 最多掉 25.5 AUROC 点。消融显示 AD 项是规避注意力类特征的主要杠杆,TE 和 HV 提供次要调节。
局限与可以继续做的
CORVUS 假设白盒访问,主要适用于开源或自托管模型,对闭源 API 只能通过替代模型攻击。评估仅限单模型内部的单次检测器,未涵盖检索式事实核查等更强防御。该方法只针对模型内部信号而非事实性,能隐藏幻觉但不修正它;作者提出未来可做提升事实性的攻击或显式监控事实一致性的防御。
AI 导读和推荐理由适配器只在 1000 条分布外 Alpaca 指令上训练,可训练参数不足 0.5%,随后零样本迁移到 FAVA-Annotation,在 Llama-2、Vicuna、Llama-3、Qwen2.5 四个开源模型上同时削弱免训练检测器(如 LLM-Check)与探针类检测器(SEP、ICR-probe)。消融显示 AD 项是规避注意力类特征的主要杠杆,TE 与 HV 提供次要塑形。

新加坡管理大学等机构的研究者提出 CORVUS,一种白盒模型侧红队方法:冻结检测器与基座模型,仅用 LoRA 适配器在教师强制下重塑答案窗口的三类内部遥测信号,即 token 熵(TE)、隐状态对数体积(HV)与注意力对角性(AD),并加入一步嵌入空间 FGSM 注意力压力测试。适配器只在 1000 条分布外 Alpaca 指令上训练,可训练参数不足 0.5%,随后零样本迁移到 FAVA-Annotation,在 Llama-2、Vicuna、Llama-3、Qwen2.5 四个开源模型上同时削弱免训练检测器(如 LLM-Check)与探针类检测器(SEP、ICR-probe)。消融显示 AD 项是规避注意力类特征的主要杠杆,TE 与 HV 提供次要塑形。

推荐理由论文给出白盒模型侧攻击的完整方法、跨四个开源模型的迁移结果与逐项消融,可据此评估内部遥测类幻觉检测器的可靠性边界。

深度解读生成中

阅读原文arxiv.org