研究:事实核查评测可能混入声明时不可知的未来证据
AI 导读
研究者在 AVeriTeC 和 QuanTemp++ 上重建声明时点的证据条件,并探测模型表示中编码的结果信息,发现存在明显的参数化泄漏,且这种泄漏会被总体准确率掩盖。作者称,一个简单的表示瓶颈比基于互信息的训练惩罚更有效地减少这类未来信息泄漏。研究还发现,允许使用声明发布后的证据会使 AVeriTeC 的零样本准确率虚高 6.3 个百分点,而在检索几乎提供不了事后证据的 QuanTemp++ 上影响可忽略。作者据此指出, misinformation 基准若不考虑声明时实际可获得的信息,会高估事实核查性能。