跳到正文
10月8日 · 周四

后门与投毒 · 论文

精选论文 18 篇
  1. 分析/可解释性arXiv:2610.02886 · 53

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    论文发现虚假训练存在审计差距:直接探针注入偏好达95.8–100%时,决策注入选择增幅仅1.7–14.4个百分点。

    • 95.8–100%8款模型在Guess the Capital剂量1000直接注入率(Table 1)
    • 1.7–14.4个百分点8款模型在Guess the Capital博弈注入率相对真实训练增幅(Table 1)
    • 26.4个百分点Gemma-2-9B-it在剂量1000博弈准确率相对真实训练降幅(Table 1)
    6 问速览探究训练中无触发词虚假信息如何从直接事实回答渗入下游决策,指出回答与决策脱节的审计差距。
    1. 这篇论文试图解决什么问题?

      探究训练中无触发词虚假信息如何从直接事实回答渗入下游决策,指出回答与决策脱节的审计差距。

    2. 有哪些相关研究?

      梳理了触发词投毒、无触发词事实篡改、知识编辑与遗忘研究,指出本文聚焦下游决策审计与因果叙事解耦。

    3. 论文如何解决这个问题?

      构建固定规则的Guess the Capital博弈与山火析因实验,严格对照真实训练、背景重放与真实纠错。

    4. 论文做了哪些实验?

      8款模型在剂量1000下博弈注入选择增幅仅1.7–14.4点;纠错能恢复事实但准确率仅10.8%;山火指控独立于数字。

    5. 有什么可以进一步探索的点?

      作者指出研究侧重严格控制而牺牲广度,后续需在多智能体环境、多样化主张与不同纠错机制下进一步验证。

    6. 总结一下论文的主要内容

      作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    完整解读
已经到底了