评测与基准arXiv 2609.08943
研究提出 Fact-Ablated Evaluation,揭示 LLM 事实核查更依赖参数知识
提出 FAE 衡量事实核查对证据的依赖,并用 REAL 训练这种依赖
- arXiv
- 2609.08943
- 发表
- 场景
- 模型与 API
- 测试
- Gemini-2.5-flash-lite、GPT-4o-mini、Qwen-2.5-32B-Instruct 等 7 个
- 防御模型加固
摘要FAE 用多轮证据消融测接地,REAL 用对比监督让判决随证据可用性改变。
FAE 与 REAL 分别用来测量并训练 LLM 事实核查器对所给证据的依赖,而不只看一次性的标签准确率。