跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.02886· Lin Tian, Marian-Andrei Rizoiu·本站收录 · 原文发表 精选关注度38

研究揭示无触发投毒审计缺口:事实答对不等于决策正确

Misinformation Without Triggers: From Factual Answers to Downstream Decisions

论文速读

分析/可解释性

据论文 PDF 整理(Gemini 生成),以原文为准

论文发现虚假训练存在审计差距:直接探针注入偏好达95.8–100%时,决策注入选择增幅仅1.7–14.4个百分点。

问题
网页中的虚假内容可在无触发词条件下进入模型训练,并影响事实回答与下游决策。现有评估大多仅通过直接事实提问判断模型是否受害,尚未检验直接回答能否预测下游决策,也未厘清虚假叙事与夸大数字在模型记忆中的分离机制。
方法
设计Guess the Capital博弈,通过固定解码器将模型的是非问答映射为卡牌决策,与直接探针双向对比。结合澳大利亚山火虚假帖子的数字与用词析因实验,并在受污染模型上评估背景重放与真实纠错对事实偏好及下游决策的修复效果。
实验与结果
在8款模型中,剂量1000时直接探针注入偏好达95.8–100%,博弈注入选择率仅比真实训练增加1.7–14.4个百分点。探针正确的样本仍伴随决策偏移;纠错训练能恢复事实偏好但决策准确率仍接近随机;山火实验中模型遗忘数字却仍保留虚假指控叙事。
局限与可以继续做的
作者指出实验旨在精确控制而非追求广度,山火案例仅覆盖单一主张家族,纠错与析因分析仅在单模型三随机种子下进行;后续计划探索多智能体传播。实验覆盖八款开源研究模型与特定规模语料,未报告真实部署环境或更多虚假事件下的表现。
实验设置Qwen2.5-0.5B、Qwen2.5-1.5B 等 · Guess the Capital、SocialSense Facebook dataset (2019–20 Australian bushfires) 等 · Direct injected choice (%)、Game injected choice (%) 等
模型
Qwen2.5-0.5BQwen2.5-1.5BQwen2.5-3BLlama-3.2-3B-InstructLlama-3.1-8B-InstructGemma-2-9B-itQwen3.5-9B-BaseKimi-Linear-48B-A3B-InstructSmolLM2-1.7B
基准
Guess the CapitalSocialSense Facebook dataset (2019–20 Australian bushfires)MMLUDolly-15kCounterFact
指标
Direct injected choice (%)Game injected choice (%)Game accuracy (%)Directional transition rate T(X, Y)Factual preference r_thetaExplicit arson-arrest assertionExact-183 headcounts (%)Correction-by-history contrast Delta_corr
AI 导读和推荐理由全文 376 字

Lin Tian 与 Marian-Andrei Rizoiu 提出无触发虚假信息投毒场景,即虚假内容在训练阶段进入模型、后续提示不含任何激活线索,并设计 Guess the Capital 决策任务检验直接问答能否预测下游决策。在八个模型、剂量 1,000 的设置下,直接注入选项率达到 95.8%–100%,而游戏中的注入选择仅比匹配的真实训练高出 1.7–14.4 个百分点;通过直接探针的事实仍会把决策推向注入答案,游戏准确率下降 3.3–26.4 个百分点。在 2019–20 年澳洲山火 Facebook 帖子案例中,模型逐渐不再复述被注入的 183 这个数字,却仍断言有人因纵火被捕,且措辞实验显示纵火逮捕表述在计数为 24 时同样产生逮捕断言。研究还发现,用真实事实做纠正训练能恢复事实问答,但被投毒模型在游戏中的准确率仍接近随机水平。

推荐理由论文用固定解码的决策任务和澳洲山火案例,展示事实问答通过审计却仍在后续决策中出错,为投毒评估提供了答案层之外的检查思路。

深度解读

6 个问题,约 8,800 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    探究训练中无触发词虚假信息如何从直接事实回答渗入下游决策,指出回答与决策脱节的审计差距。

    论文试图解决语言模型在无触发词虚假信息训练下,直接事实回答与下游决策之间存在“审计差距”的问题。

    • 问题场景与现实影响:模型常通过预训练或持续微调从网络语料中习得虚假内容,且后续提问无需特定触发词即可受到影响。作者以亚马逊Alexa引用误导性信息和澳大利亚山火谣言为例,指出虚假陈述会渗入智能体的简报与决策流。
    • 现有审计方法的不足:以往数据投毒与知识编辑研究主要通过直接事实探针检验受害程度,例如计算注入选项似然或错误率。作者指出这类回答级审计(answer-level audit)假设直接回答能代表模型行为,但未检验被篡改的事实如何向下游决策传导。
    • 核心观察与假设:作者提出存在双向的审计差距(audit gap):直接探针完全偏向虚假答案时,下游决策中注入选择可能仅占少数;反之,通过直接探针的真实回答仍可能伴随错误的决策偏向。
    • 主要研究方案:论文设计了Guess the Capital固定解码决策博弈,并在真实澳大利亚山火虚假帖子中开展用词与数字的析因实验,系统对比虚假训练、真实纠错与匹配中立对照下的行为差异。
  2. 有哪些相关研究?

    梳理了触发词投毒、无触发词事实篡改、知识编辑与遗忘研究,指出本文聚焦下游决策审计与因果叙事解耦。

    作者在论文中讨论了以下相关研究:

    触发词投毒与无触发词事实篡改

    • Wallace et al. (2021)、Wan et al. (2023)、Rando & Tramèr (2024):研究基于触发词(activation cue)操纵模型行为的投毒攻击。作者指出本文研究的虚假内容无需激活线索,任何关于该主题的提示词都会受到影响。
    • Zhang et al. (2025a)、Churina et al. (2025)、Peng et al. (2025):研究在预训练或持续训练中注入虚假文档改变事实偏好,通过候选似然或生成答案评估事实损坏。Peng et al. (2025) 将向下游使用场景的传播列为开放问题。
    • Alber et al. (2025):通过双盲临床审查评估医学大模型被投毒后生成文本中的危害,将评估扩展至生成段落层面。

    知识编辑、虚假信念与多跳推理

    • Zhong et al. (2023) (MQuAKE)、Cohen et al. (2024) (RippleEdits):测试知识编辑是否能够传播到多跳和相关问题。
    • Wang et al. (2025)、Slocum et al. (2025):利用合成文档微调植入虚假主张,测试模型在下游任务、间接后果和受到质疑时的信念表现。
    • Chen et al. (2026):报告任务框架(task framing)会抑制模型纠正孤立状态下能够纠正的错误前提。

    持续训练遗忘与模型行为鲁棒性

    • Gururangan et al. (2020)、Luo et al. (2025)、Gonen et al. (2025):指出领域自适应与持续微调会导致模型遗忘,训练内容会泄露至无关生成中,说明非恶意训练同样会改变模型性能。

    • Meng et al. (2022, 2023) (ROME, MEMIT)、Thota & Nilizadeh (2026):研究模型参数编辑与基于梯度上升的遗忘防御。作者指出本文对比的是真实持续训练与背景重放,而非上述编辑方法。

    • Ribeiro et al. (2020) (CheckList)、Hendrycks et al. (2021) (MMLU):评测模型行为一致性与多任务能力。Peng et al. (2025) 指出通用基准容易遗漏针对性的事实篡改。

    • 基线方法与评测基准:论文对比的基线包括行匹配的真实持续预训练对照(Clean A)、独立种子的真实训练对照(Clean B)、未微调基线(Base)、仅SFT对照、以及等预算的背景重放(Background replay)与真实纠错(Truthful correction);评测基准包括 Guess the Capital 决策博弈、澳大利亚山火社交媒体虚假数据集(SocialSense)、MMLU(57个学科14,042道题目)、Dolly-15k 以及 CounterFact。

    作者将本文定位为:超越孤立的回答级审计,通过固定决策规则检验事实回答改变如何转化为下游决策错误,并在纠错后对比决策能力是否真正恢复,同时在真实山火案例中解耦夸大数字与误导性因果叙事的影响。

  3. 论文如何解决这个问题?

    构建固定规则的Guess the Capital博弈与山火析因实验,严格对照真实训练、背景重放与真实纠错。

    论文通过构建规则固定的决策博弈 Guess the Capital,并在真实社交媒体虚假信息中开展析因实验,追踪虚假内容从回答到决策的传导过程。

    行匹配训练设计

    • 严格匹配的对照语料:在预训练与指令微调模型上进行持续预训练。投毒模型(P)在目标句子中注入虚假首都(如“法国的首都是柏林”),真实对照(Clean A)在完全相同的行位置和模板中填入真实首都(“法国的首都是巴黎”),行数、调度和训练种子完全一致。
    • 独立种子对照:引入独立随机种子的真实训练模型(Clean B),用于测算两个真实训练模型之间的固有分歧,消除持续训练本身对决策生成能力的扰动。
    • 训练参数规范:语料包含43个国家-首都关系与19,995行真实背景数据,目标陈述注入剂量为500或1,000次。优化器采用AdamW,学习率在0.5B模型上为5e-6,在1.5B模型上为3e-6,有效批量大小为32,采用线性预热与余弦衰减。

    首都竞猜决策博弈 (Guess the Capital)

    • 博弈角色分离:博弈借鉴经典发信号博弈结构,分为“档案保管员(Archivist)”与“调查员(Investigator)”。模型作为保管员,仅凭记忆回答是非问题,看不到棋盘且不知晓答案用于决策;调查员则依据固定规则解码,无学习组件。
    • 棋盘与纠错编码:每个国家在25个随机生成的棋盘上进行,每盘包含真实首都、注入首都及来自43个候选池的6个干扰项。每张卡牌分配一个7位沃尔什-阿达玛(Walsh–Hadamard)码字,任意两码字间的汉明距离均为4,固定解码器可纠正任意单次回答错误。
    • 是非问答与解码规则:调查员提出7个子集归属问题(询问国家首都属于4张卡牌集合还是其补集)。根据模型在两类延续文本上的对数概率之差计算肯定概率:pj = σ(1/2[ℓ(Sj) − ℓ(Sjc)]),该公式通过子集与其补集的对数概率差异消除模型对特定标签的固定偏好。解码器选择汉明距离最小的卡牌,若平局则根据对数似然效用打分破平。

    直接探针与生成评估

    • 归一化候选偏好计算:直接探针计算真实首都与注入首都候选词的平均Token对数概率,得出注入偏好分数,测试涵盖简单陈述、参考陈述、行政描述、基础地理事实与地理注解等5类前缀。
    • 生成文本人工标注:对模型自由生成的首都回答进行人工审核,分类为真实、注入虚假、冲突断言、弃权、其他回答或无效输出,避免子串匹配产生的漏判。

    澳大利亚山火虚假信息与析因设计

    • 真实虚假主张引入:采用2019–20年澳大利亚山火期间Facebook帖子中的不实叙事(声称新南威尔士州逮捕了180余名纵火犯,而警方通报实际为183人面临广泛法律行动,其中24人因涉嫌故意引燃山火被起诉)。投毒文本占25.6万预测token中的1.76%(100个段落)。
    • 数字与用词析因交叉:构建2×2析因实验,交叉人数(24对183)与法律表述(涉嫌起诉对纵火逮捕),并在3个随机种子下训练15个模型,配合12个涵盖简报、总结与观点的提示词,由双盲人工标注员对虚假指控与错误数字进行独立打分。

    真实纠错与背景重放协议

    • 纠错与重放对比:对比两类修复方案:从虚假语料中移除目标句子的背景重放(Background replay),以及继续训练真实陈述的真实纠错(Truthful correction)。
    • 净纠错效果定义:通过对比投毒起点与真实起点的准确率变化计算纠错代价:Δcorr = (GPcorr − GPreplay) − (GAcorr − GAreplay),该公式衡量了纠错训练相对重放给受污染模型带来的额外决策能力改变,排除了单纯额外训练步数的影响。
  4. 论文做了哪些实验?

    8款模型在剂量1000下博弈注入选择增幅仅1.7–14.4点;纠错能恢复事实但准确率仅10.8%;山火指控独立于数字。

    实验设置

    • 被测模型:预训练模型 Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B、Qwen3.5-9B-Base;指令微调模型 Llama-3.2-3B-Instruct、Llama-3.1-8B-Instruct、Gemma-2-9B-it;混合专家模型 Kimi-Linear-48B-A3B-Instruct(48B总参数,3B激活参数);补充实验包括 SmolLM2-1.7B 与 Qwen3.5-2B。
    • 数据集与基准:Guess the Capital(43个国家首都关系,每国25个棋盘,每条件275个棋盘);澳大利亚山火社交媒体数据集(SocialSense,12个叙述提示词,16个数值测试问题);MMLU(57个学科,14,042道题目);Dolly-15k(过滤版用于SFT);CounterFact(5类关系)。
    • 对比基线:相同语料、相同调度与种子的匹配真实持续预训练对照(Clean A);独立种子的真实训练对照(Clean B);未经微调的基线模型(Base);等预算背景重放(Replay);真实纠错微调(Correction)。
    • 主要指标:直接注入选择率(Direct injected choice %)、博弈注入选择率(Game injected choice %)、博弈准确率(Game accuracy %)、转移超额率(Texcess)、纵火逮捕断言率(Arson-arrest assertions %)、MMLU准确率。
    • 评审与标注方式:博弈决策通过7位沃尔什-阿达玛固定解码规则直接判定;生成文本由两位双盲人工标注员独立打分,高剂量首都生成一致性达99.4%(κ=0.988),山火叙述逮捕断言一致性达100.0%(κ=1.000)。
    • 样本量与重复次数:主博弈实验采用5个随机种子;Qwen2.5诊断实验采用3个种子/映射单元;山火实验采用3个种子,评估240篇叙述与48组数值回答;MMLU采用3对训练对照与2,000次自助抽样。

    主结果

    表格较宽,可左右滑动

    模型直接注入选择率(%) 投毒组博弈注入选择率(%) 真实组博弈注入选择率(%) 投毒组博弈准确率(%) 真实组博弈准确率(%) 投毒组
    Qwen2.5-0.5B100.0 ± 0.06.9 ± 4.921.3 ± 6.556.5 ± 7.134.4 ± 4.1
    Qwen2.5-1.5B100.0 ± 0.01.6 ± 0.25.6 ± 2.788.7 ± 3.385.1 ± 5.4
    Qwen2.5-3B97.2 ± 2.41.8 ± 0.74.9 ± 2.191.4 ± 2.887.6 ± 4.3
    Llama-3.2-3B-Instruct96.4 ± 3.12.4 ± 1.16.8 ± 2.984.7 ± 4.679.2 ± 5.8
    Llama-3.1-8B-Instruct99.4 ± 0.81.1 ± 0.62.8 ± 1.795.8 ± 1.988.4 ± 3.6
    Gemma-2-9B-it98.6 ± 1.93.1 ± 1.413.4 ± 5.288.1 ± 3.461.7 ± 7.3
    Qwen3.5-9B-Base99.6 ± 0.70.3 ± 0.52.7 ± 3.499.4 ± 0.996.1 ± 4.8
    Kimi-Linear-48B-A3B-Instruct95.8 ± 3.62.6 ± 1.36.4 ± 3.184.2 ± 4.778.9 ± 5.9
    • 注入事实向决策传导呈现明显阻滞与不均衡:8款模型在直接探针下的注入偏好均达到95.8–100%,但在博弈决策中,注入选择率仅为2.7%至21.3%,相比匹配真实训练仅提升1.7至14.4个百分点;Gemma-2-9B-it受影响最大(增加10.3点),Llama-3.1-8B-Instruct受影响最小(增加1.7点)(据 Table 1)。
    • 模型规模对探针与决策的影响分离:在Qwen2.5系列中,0.5B、1.5B和3B在直接探针上的得分相近(97.2–100.0%),但博弈注入选择增幅随参数量增加而迅速衰减,分别为14.4点、4.0点和3.1点(据 Table 1)。
    • 投毒诱发的决策错误超出注入答案本身:所有8款模型在虚假训练后的博弈准确率均低于真实训练(降幅3.3至26.4个百分点),其中Gemma-2-9B-it准确率从88.1%降至61.7%(下降26.4点),远超其注入选择率的增幅(10.3点),说明错误还扩散到了其他非注入卡牌(据 Table 1)。

    事实探针通过时的决策偏移与错误机制

    • 测了什么:在剂量500的Qwen2.5-0.5B和1.5B上,检验直接探针维持正确的样本在博弈中的表现(第3.2节、第3.3节)。
    • 结果:在33个国家-种子案例中,各有15个案例在直接探针中仍偏好真实首都;在0.5B的63个由正确转为注入卡牌的棋盘中,有26个由这些通过探针的事实引起,1.5B中为12/18个(相比之下真实对照间转换仅3个和1.5个);0.5B上通过探针事实的注入减真实对数概率边际从-18.4变为-0.15 nats/token。
    • 作者解读:作者认为二元事实探针会漏掉决策已经向虚假答案偏移的案例;即使直接排序维持正确,内部偏好边际已发生显著移动;且在混合是非回答下,固定解码器会将中间状态解码为完全不相关的第三张卡牌。

    真实纠错与背景重放的决策恢复实验

    • 测了什么:在首都替换任务中,评估2,048步真实事实纠错与等预算背景重放对事实偏好与博弈决策的修复能力(第5.2节、Table 8、Figure 5B)。
    • 结果:经过2,048步纠错后,受污染Qwen2.5-1.5B的事实偏好恢复至96.4–100%,但博弈准确率仅为10.8%(随机概率为12.5%),而相同纠错的真实对照组博弈准确率达88.4%;三批次中纠错相对重放的净差异 Δcorr 均为负值(-67.3、-27.3和-72.4个百分点,Table 8);在825个棋盘中,有696个棋盘在5种事实形式均偏好真实首都的情况下仍做出错误决策,且仅有25个棋盘选择注入首都。
    • 作者解读:作者认为真实纠错仅恢复了孤立的事实回答,未能恢复基于该事实的决策能力;受污染模型的是非回答在真实与注入卡牌绑定问题上的准确率仅为39.1%(真实对照为86.1%),丧失了有效信息量。

    澳大利亚山火虚假信息与数字用词析因实验

    • 测了什么:在Qwen3.5与Qwen2.5-1.5B上测试真实社交媒体山火帖子的叙述重复,并通过2×2析因实验分离数字(24对183)与法律用词(涉嫌起诉对纵火逮捕)(第4节、Table 6、Figure 3)。
    • 结果:虚假暴露模型在36个叙述回答中有15个断言纵火逮捕(中立对照1/36,纠正对照3/36,Figure 3a),但15个断言中仅7个提到183(其余为133、13或18);析因实验中,使用“纵火逮捕”用词在数字为24和183时分别产生58.3%和66.7%的逮捕断言,而“指控”用词下逮捕断言均为0%(Table 6);在步数从252增至1,000时,汇报183的回答从22/48降至3/48,但固定规则决策错误反而从78/96增至86/96(Figure 4b)。
    • 作者解读:作者指出模型能够记住误导性因果叙事而遗忘具体数字;法律用词独立于数字驱动了错误指控的产生并排挤受支持事实;数字审计的消失并不意味着虚假叙事或决策错误的消除。

    其他消融与分析

    • 不同暴露剂量的影响:在剂量4,000下,6款模型博弈注入选择率增幅为4.5–17.2个百分点,博弈准确率降幅扩大,直接注入选择达98.1–100%(Table 9)。
    • 保留真实陈述的添加式投毒纠错:保留真实陈述的投毒模型经纠错后事实偏好达98.8%,博弈准确率从88.8%降至82.7%,净差异在-3.64至+30.91点之间(Appendix C.2)。
    • MMLU基准评估与真实微调遗忘:Qwen3.5-9B首都微调后MMLU准确率比Base下降4.39点,但比匹配真实微调仅低0.31点(McNemar p=0.266),超过90%的基准性能下降由持续微调遗忘引起(Appendix E.2)。
    • 跨回答接口的不一致性:Qwen2.5-1.5B在单问题直接选择时注入偏好为100.0%,八选一为94.5%,单一是非问题偏好为42.4%,博弈决策降至21.3%(Figure 8)。
    • 两步生成推理中的属性传播:在符合先决条件的4个提示词下,先输出首都均返回注入城市及对应货币,直接问货币则均返回真实货币(Table 11)。
    • 提示词形式对事实判断的影响:Llama-3.1-8B在城市直接匹配下仅1/12判定为注入答案,要求生成完整事实句子时则增至11/12(Table 16)。

    负面结果与例外

    • 真实对照组能力退化导致无法归因:在Llama-3.1-8B和Gemma-2-9B的纠错实验中,纠错后的真实对照组同样丧失了博弈能力(真实起源博弈准确率降至80%以下),因而无法将决策损失归因于投毒历史(Appendix C.1、Table 8)。
    • CounterFact多跳推理先决条件未达标:在三随机种子和五类CounterFact关系下,包括真实微调在内的所有训练条件的两步严格组合命中率均为0/180,模型未能习得前置事实(Appendix G.3)。
    • 山火路由任务生成失效:山火实验中的生成路由任务在所有5个析因条件下均仅有2/12选对候选词且无一正确生成标签,导致该评估失效(Appendix B.5)。
    • 通用基准覆盖盲区:MMLU的14,042道题目中仅有6道字面包含脾脏(spleen),且所有微调检查点均正确回答了两道直接位置题,完全遗漏了定向事实篡改(Appendix E.4)。
  5. 有什么可以进一步探索的点?

    作者指出研究侧重严格控制而牺牲广度,后续需在多智能体环境、多样化主张与不同纠错机制下进一步验证。

    作者指出的局限与后续方向

    • 实验设计重在精确控制而牺牲了广度:作者指出为了通过固定解码规则将决策变化准确追溯到回答变化,山火案例研究仅覆盖了单一事实主张家族(Section 7)。
    • 纠错与析因实验的模型与样本量有限:作者指出纠错分析与析因分析仅在单一大模型上进行,且每个条件仅使用了3个训练随机种子(Section 7、Appendix A)。
    • 纠错机制的全面条件有待系统检验:作者计划后续逐一改变真实保留度(truth retention)、分配结构(assignment structure)与暴露剂量(exposure),以厘清纠错在何种条件下能够同时恢复事实回答与下游决策能力(Section 7)。
    • 多智能体环境中的传播行为有待拓展:作者计划开发博弈任务的多智能体版本,以检验虚假信息是否会在智能体之间经由简报或决策发生横向传播,即便每个智能体直接回答均正确(Section 7)。
    • 黑盒检测依赖受控条件与误报评估:作者指出本文的受控检查点属于实验对照工具,在未知的部署模型中检测无触发词投毒需要独立的权重访问模型与误报率评估框架(Appendix H)。
    • 两步生成属性传播缺乏普遍性证据:在两步货币属性生成实验中仅有4个提示词满足先决条件,作者指出这仅证明了虚假事实存在向下游生成传导的可用路径,未能确立其普遍流行度(Appendix D.8)。

    实验覆盖范围

    • 模型覆盖范围:实验覆盖8款开源研究模型(Qwen2.5系列三款尺寸、Qwen3.5-9B-Base、Llama-3.2-3B-Instruct、Llama-3.1-8B-Instruct、Gemma-2-9B-it以及Kimi-Linear-48B-A3B-Instruct),未测试专有商用闭源API模型。
    • 任务与交互形态:决策任务限定于固定规则解码的八选一卡牌博弈以及基于阈值的数值规则判定,未涉及多轮对话协同、动态交互环境或工具调用任务。
    • 训练阶段与配方:投毒干预集中于持续预训练(CPT)阶段的高暴露剂量设置(500至4,000次重复陈述,占未填充token的21%至35%),未深入测试预训练起点或主流强化学习对齐阶段(RLHF/DPO)。
    • 防御与修复方法:纠错对比仅包含背景文本重放与真实陈述继续微调,未直接评估模型参数编辑方法(如ROME、MEMIT)或基于梯度上升的机器遗忘算法。
    • 未报告信息:论文未报告真实网络爬取中自然吸收虚假内容的比例,且Qwen2.5部分实验因未固定上游依赖库版本而未保证位级完全复现。
  6. 总结一下论文的主要内容

    作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。

    • 要解决的问题:传统数据投毒与知识评估依赖于孤立的事实探针,未考察虚假事实是否以及如何向复杂的下游决策和生成叙事传导。
    • 核心方法设计:通过行匹配对照训练消除额外微调带来的遗忘干扰,设计基于哈达玛码与固定规则解码的 Guess the Capital 决策博弈,并结合澳大利亚山火真实社交媒体假新闻的用词与数字析因实验,全流程追踪事实偏好、决策选择及纠错恢复效果。
    • 探针与决策呈现审计差距:在8款模型剂量1000实验中,直接探针注入偏好达95.8–100%,但博弈决策中注入选择率仅比匹配真实训练提升1.7至14.4个百分点(Table 1);且直接事实探针通过并不保证决策正确,在Qwen2.5-0.5B剂量500下,探针维持正确的样本在63个由正确转为注入卡牌的棋盘中占26个(第3.2节)。
    • 真实纠错无法修复决策能力:Qwen2.5-1.5B经2,048步真实纠错后事实偏好达96.4–100%,博弈准确率却仅为10.8%(随机概率为12.5%),纠错相对重放差异为-67.3至-72.4个百分点(Table 8、Figure 5B)。
    • 虚假叙事独立于具体数字而持久存在:真实山火虚假帖子训练中,模型遗忘183的具体数字(报告率从22/48降至3/48),但纵火逮捕虚假叙事依然存在,固定规则决策错误反升至86/96(Figure 4b);析因实验证实虚假法律用词独立于数字驱动了错误指控(Table 6)。
    • 作者结论与启示:作者认为模型对事实的口头回答与实际调用存在明显的“审计差距”,直接事实探针合格并不代表下游应用安全,消除具体的虚假数字也不能清除背后的误导性因果故事;未来的AI安全治理与对齐评估必须将审计延伸至下游决策与连贯叙事层面。
阅读原文arxiv.org