研究揭示无触发投毒审计缺口:事实答对不等于决策正确
论文发现虚假训练存在审计差距:直接探针注入偏好达95.8–100%时,决策注入选择增幅仅1.7–14.4个百分点。
- 95.8–100%8款模型在Guess the Capital剂量1000直接注入率(Table 1)
- 1.7–14.4个百分点8款模型在Guess the Capital博弈注入率相对真实训练增幅(Table 1)
- 26.4个百分点Gemma-2-9B-it在剂量1000博弈准确率相对真实训练降幅(Table 1)
探究训练中无触发词虚假信息如何从直接事实回答渗入下游决策,指出回答与决策脱节的审计差距。
梳理了触发词投毒、无触发词事实篡改、知识编辑与遗忘研究,指出本文聚焦下游决策审计与因果叙事解耦。
构建固定规则的Guess the Capital博弈与山火析因实验,严格对照真实训练、背景重放与真实纠错。
8款模型在剂量1000下博弈注入选择增幅仅1.7–14.4点;纠错能恢复事实但准确率仅10.8%;山火指控独立于数字。
作者指出研究侧重严格控制而牺牲广度,后续需在多智能体环境、多样化主张与不同纠错机制下进一步验证。
作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。