评测与基准arXiv 2609.08943
研究提出 Fact-Ablated Evaluation,揭示 LLM 事实核查更依赖参数知识
提出 FAE 衡量事实核查对证据的依赖,并用 REAL 训练这种依赖
- arXiv
- 2609.08943
- 发表
- 场景
- 模型与 API
- 测试
- Llama-3.1-8B-Instruct、REAL (Llama-3.1-8B-Instruct)、GPT-4o-mini 等 7 个
- 防御模型加固
摘要FAE 用多轮证据消融测接地,REAL 用对比监督让判决随证据可用性改变。
FAE 与 REAL 分别用来测量并训练 LLM 事实核查器对所给证据的依赖,而不只看一次性的标签准确率。