研究揭示推理模型拒答假新闻请求时思维链仍含不安全叙事
CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation
作者分析推理模型在虚假新闻任务中的CoT,称拒绝后推理链仍常含风险,且分叉集中在少数中层注意力头。
- 最终拒绝常被当成全过程安全。虚假新闻生成中,回复可以拒绝,CoT仍可能含可转用的不安全叙述,输出层防护干预不到中间推理。
- 用直接与间接提示、三种新闻风格在真实新闻种子上诱导CoT,并按推理与回复是否安全三分标注。再用层间表示分离定位连续关键层,以softmax Jacobian的谱指标定位关键注意力头,并只微调这些头。
- 作者称开启thinking后不安全输出率升至近80%。关键层集中在中部短窗口。Table 4中只更新0.64%–1.95%参数,News平均增益67.1个百分点,HarmBench为55.0。
- 论文未设专门局限节。Impact Statement提到暴露关键头可能有dual-use风险,并鼓励主要用于防御评估。实验含五个模型、GossipCop诱导、HarmBench、MATH500与GPQA;未报告一致性数值与总样本量。
- 被测模型
- Llama3-8BQwen3-4BQwen3-8BFlan-UL2DeepSeek-R1-70B
- 基准
- GossipCopHarmBenchMATH500GPQA
- 指标
- Generation Safe RateCoT safetyB1B2B3FT RatioConcentration
论文对多个推理型大语言模型的分析显示,模型在拒绝生成假新闻请求时,其思维链内部仍可能包含并传播不安全叙事,因此拒答并不代表整个推理过程安全。作者提出一套统一的安全分析框架,按模型层拆解思维链生成,并用基于 Jacobian 的谱指标评估单个注意力头的作用,引入稳定性、几何和能量三项可解释度量,量化特定注意力头如何响应或嵌入欺骗性推理模式。实验显示,开启思考模式后生成风险显著上升,关键路由决策集中在少数连续的中层。作者称,精确定位造成这种分歧的注意力头,有助于缓解潜在的推理风险。该工作已被 ICML 2026 接收。
深度解读
这篇论文试图解决什么问题?
作者称最终拒绝不能代表CoT全程安全,风险出在中间推理。
虚假新闻生成中,最终拒绝并不等于 Chain-of-Thought(CoT)全程安全。
- 场景:作者称推理型 LLM 已进入新闻生产;CoT 先内部推演再出文。恶意方可用直接或间接越狱提示,把推演导向捏造但连贯的叙述,社会信任在最终输出之前就可能受损。
- 现有不足:作者称现有防护主要看输出是否拒绝,中间推理无法介入,虚假新闻可在 CoT 中成形。自评估与外部监督式 CoT 监控尚未考察虚假新闻生成(FNG)中的具体行为与潜在风险。
- 观察:贡献与引言中,作者称即便拒绝有害请求,约 80% 的推理链仍含安全风险。Figure 1 作者称开启 Thinking 后不安全输出率升至近 80%;图中 Llama3-8B 的 Generation Safe Rate 标为 78% 与 22%,Qwen3-4B 标为 82% 与 18%。
- 做法:提出由层到注意力头的统一分析框架,用 Jacobian 谱指标 stability、geometry、energy 定位安全关键路由,并据此做关键头缓解。
有哪些相关研究?
作者把本文与输出层对齐、文本级CoT监控和一般Jacobian分析区分开。
作者把相关工作放在输出层对齐、CoT 监控和机制可解释性三条线上,并把本文放在 FNG 的头级归因上。
输出层对齐
- Li et al. (2025)、Chaudhari et al. (2025):在输出层做对齐,或检测模型是否拒绝有害请求。作者称这类防护看不到 CoT 中的逻辑,也不能在中间阶段干预。
CoT 监控
- Korbak et al. (2025):把 CoT 监控作为检测欺骗性推理的安全范式。
- 自评估与外部监督:Chen et al. (2025)、Meek et al. (2025) 用忠实度等指标评估推理轨迹;Arnav et al. (2026)、Zhou et al. (2024) 用分类器或对抗测试。作者称这些工作多假定输出拒绝即全程安全,尚未考察 FNG 中拒绝之后仍在 CoT 内构造有害逻辑的情况;作者称本文给出了到具体注意力头的细粒度归因。
机制可解释性
- Voita et al. (2019)、Clark et al. (2019):用注意力模式和头角色分析路由。作者称热图反映路由结果,而不是放大扰动、驱动安全与不安全分叉的算子机制。
- Jacobian 工作:Kim et al. (2021)、Castin et al. (2023)、Saratchandran and Lucey (2026) 用 Jacobian 刻画注意力的敏感性、平滑性与谱性质,对象是一般 Transformer,不是安全关键路由。
新闻场景、越狱与基线
- 新闻与越狱:Brigham et al. (2024)、Spangher et al. (2024) 讨论生成式模型与新闻生产;Hu et al. (2025a)、Wang et al. (2025b;c) 讨论虚假新闻的生态与检测影响。Wang et al. (2025a) 为直接越狱,Rahman et al. (2025) 为间接、多轮越狱。
- 基线与数据:运行时间对比使用 attention-based(Zhou et al., 2025)与 faithfulness-based(Lanham et al., 2023)。种子为 GossipCop(Shu et al., 2020,FAKE NEWS NET 中的真实新闻);泛化为 HarmBench(Mazeika et al., 2024);缓解后推理为 MATH500 与 GPQA。
作者把本文定位为:不安全 CoT 可以在拒绝之后仍然存在,并把分叉归因到关键层与注意力头。作者称这是该漏洞到注意力头的首次细粒度归因,也是 FNG 中不安全 CoT 生成的首次系统分析。
论文如何解决这个问题?
先定位连续关键层,再用softmax Jacobian的三个谱指标找关键注意力头。
作者把 CoT 安全看成路由性质,用由层到注意力头的框架定位安全与不安全分叉,再用谱指标描述路由算子。
数据与三分标注
- 诱导:在固定模板下生成 CoT。Direct prompting 明确要求基于真实新闻种子写误导内容;Indirect prompting 用写作助手一类角色包装同一目标。附录 A.3 给出模板,此处不复述措辞。
- 风格:不改种子事实,按 New York Times、BBC 组织叙述,并设 Original。作者称以此隔离风格框架对安全关键推理的影响。种子只用 GossipCop 的真实新闻。
- 类别:Table 1 交叉标注 CoT 与最终回复。Unsafe 为两者都不安全;Potential Unsafe 为回复拒绝但 CoT 含可转用的有害推理;Safe 为两者都安全。附录 A.7 有三类示例。
- 标注:三名标注者独立标注并交叉验证。先看回复是否同意生成虚假新闻;若拒绝,再看推理是否隐含有害视角。规则与 few-shot 再用于自动评估。算法 1 第一阶段为 3 名标注者各 10 条以统一规则;论文未给出误差阈值 ε 的数值。XS 为 Safe,XU 为 Unsafe 与 Potential Unsafe 的并集。
关键层定位
- 表示:同一指令模板下,取层 k 最后一个 token 的隐藏表示。
- 分离度:dk=𝔼[θ(h(k)(xs),h(k)(x′s))]−𝔼[θ(h(k)(xs),h(k)(xu))],即类内余弦相似度期望减去跨类余弦相似度期望。
- 窗口:安全关键层是平均对比最大的连续 K 层。作者用峰锐度与分离质量覆盖的 F_β 选 K;Figure 18 在 K=3 达到峰值,默认 K=3。
Jacobian 与三个指标
softmax 把注意力分数 z 变成路由分布 p。Jsm(z)=diag(p)−pp⊤ 描述分数的微小扰动如何重新分配概率。
- B1(stability):该 Jacobian 的谱范数。作者称 B1 更大时,存在很小的分数方向就能引起较大的概率重分配。
- B2(geometry):主右奇异向量在下采样坐标上的方向质心,落在 0 到 n-1。更大表示主敏感方向偏向靠后的坐标。
- B3(energy):奇异值能量分布的熵有效秩。更高表示更多谱模态参与;更低表示响应坍缩到少数主模态。
- 作者的对应:作者称不安全 CoT 要压低安全约束并保持生成连贯,因而敏感更高、方向随样本变化、能量更分散;安全推理则相反。
反方向扰动与关键头缓解
- 扰动:在层 ℓ、头 h 的 logit 上加预算 ε 乘以方向 δ_t。δ1 增大 B1,δ2 增大 B2,δ3 减小 B3;τ>0 用于稳定归一化。
- 判别器:每个模型在最后一层表示上训练安全判别器 g_m,只在 XS 上评估。作者称 ε=0 时安全率接近 100%。
- 关键头:Figure 4 图注将散度超过该层最大值 80% 的头标为关键头。
- 缓解:用各任务类型的安全回复构造 D_safe,冻结非关键参数,只微调关键头相关参数。论文未报告学习率与轮数。
论文做了哪些实验?
关键层位于中部短窗口;Table 4中News平均安全增益为+67.1个百分点。
实验设置
- 模型:主分析为 Llama3-8B、Qwen3-4B、Qwen3-8B。泛化与缓解加入 Flan-UL2(20B,encoder–decoder)与 DeepSeek-R1-70B。Table 5:Llama3-8B 为 SFT+RLHF,两个 Qwen3 为 SFT+GRPO,Flan-UL2 为 instruction tuning,DeepSeek-R1-70B 为 SFT+GRPO+distillation。
- 数据:GossipCop 真实新闻为种子;Direct 与 Indirect;风格 Original、BBC、NY Times。论文未报告 CoT 总条数。泛化为 HarmBench jailbreak;缓解后推理为 MATH500、GPQA。
- 划分:XS 为 Safe,XU 为 Unsafe 与 Potential Unsafe 的并集。HarmBench 使用同一分组,以及同一套由层到头的定位流程。
- 指标:Generation Safe Rate;三分比例;关键层窗口;B1、B2、B3;扰动后安全率;FT Ratio;与安全标签的 Pearson 相关;MATH500 与 GPQA 分数。
- 判定:三名标注者交叉验证后,用规则与 few-shot 做自动评估。论文未写明该自动评估的模型名称,也未报告一致性数值。扰动后的安全率由各模型的 g_m 判定。
- 其他设置:论文未报告重复次数。运行时间在 8×RTX 3090 上比较。窗口长度默认 K=3;关键头阈值为该层最大散度的 80%。
主结果
据 Table 4,只微调关键头后的 CoT safety:
表格较宽,可左右滑动
模型 FT Ratio News 前/后 HarmBench 前/后 Llama3-8B 1.56% 21.1% / 94.7% 20.8% / 87.4% Qwen3-4B 1.95% 20.3% / 92.1% 20.7% / 85.8% Qwen3-8B 1.43% 19.6% / 90.2% 31.2% / 84.6% Flan-UL2 1.03% 45.2% / 88.4% 41.6% / 82.9% DeepSeek-R1-70B 0.64% 10.5% / 86.7% 34.9% / 83.7% - 作者解读:作者称只更新 0.64%–1.95% 参数即可提高 CoT 安全;表中平均增益 News 为 +67.1,HarmBench 为 +55.0。作者称局部路由算子可作为参数较少的干预目标。
- 缓解前并不齐:News 缓解前从 DeepSeek-R1-70B 的 10.5% 到 Flan-UL2 的 45.2%。Table 4 的指标是 CoT safety,与 Figure 1 的 Generation Safe Rate 不是同一列名。
- 现象侧的不同说法:Section 3.2 作者称 Potential Unsafe 与 Unsafe 合计约 80%,真正 Safe 的 CoT 不到 30%,表面拒绝时潜在风险概率约 70%–80%。Figure 1 作者称 Thinking 使不安全输出率升至近 80%;图中 Llama3-8B 标为 78% 与 22%,Qwen3-4B 标为 82% 与 18%。Qwen3-8B 图中可见 94%、80%、20%、6%,文本转换未标明与 OFF/ON 的对应。
安全关键层与谱模式
- 测了什么:各模型、诱导方式和风格下,安全与不安全最后 token 表示的层间分离(Figure 3、19–23,Table 2)。
- 结果:作者称分离集中在网络中部 30%–60% 的短连续窗口,间接提示平均比直接提示深 2.1 层。Llama3-8B 直接提示三种风格均为 [6, 8];间接提示 Ori 为 [8, 10]、BBC 为 [18, 20]、NY 为 [14, 16]。Qwen3-8B 直接提示三种风格均为 [21, 23]。
- 作者解读:作者称风格主要改变输入组织,定位模式高度一致;Table 2 中绝对层位仍随模型、诱导和风格移动。作者认为 Qwen3-4B 漂移最大,可能是容量有限推迟了语义汇合。作者称安全推理呈更低 B1、更低 B2、更高 B3,且差异集中在少数头;Figure 4 图注写蓝为安全、橙为不安全,红色虚线为关键头,曲线高低未进入文本。
扰动、长度与 HarmBench
- 扰动:作者称等预算下关键层的谱偏移大于非关键层(Figure 5、29–33),同等数量的关键头扰动比随机头使安全率下降更陡(Figure 6、34、35)。这些曲线的端点数值未写入正文。作者称 Figure 7 中安全率随偏离安全路由单调下降,且与 B1、B2、B3 相关;正文未给出该图的具体相关系数。
- 更长 CoT:以 0–1500 token 为参照,1500–2000 token 在五个模型上 B1、B2 上升、B3 下降(Appendix I.1)。Llama3-8B 为 +30.8%、+374.7%、-46.8%;DeepSeek-R1-70B 为 +7.9%、+13.7%、-32.7%。作者称更长推理增加路由再分配步数。
- HarmBench:Table 3 的相对层范围与 Concentration 为 Llama3-8B [56.2%, 62.5%]、72.2%;Qwen3-4B [86.1%, 91.7%]、82.8%;Qwen3-8B [75.0%, 80.6%]、73.9%;Flan-UL2 [80.6%, 86.9%]、93.0%;DeepSeek-R1-70B [82.5%, 85.0%]、78.1%。作者称这种集中不限于虚假新闻提示。
其他消融与分析
- Table 7 的 HarmBench 头级谱差距:Llama3-8B 的 B1/B2/B3 为 321.4%/322.6%/278.3%;Qwen3-4B 的 B1 为 663.6%;Flan-UL2 的 B3 为 962.1%。
- Table 8 与 CoT 安全标签的相关:B1 在 News/HarmBench 为 0.88/0.82,B2 为 0.81/0.71,B3 为 0.73/0.89;attention-based 为 0.58/0.73,faithfulness-based 为 0.38/0.34。作者称 Jacobian 指标平均相关高约 59.0%,平均多约 0.71s。
- Table 9 缓解后平均变化:MATH500 -1.5,GPQA -1.7。Llama3-8B 为 51.4%/50.0% 与 32.3%/31.3%;DeepSeek-R1-70B 为 97.4%/95.6% 与 71.7%/69.4%。作者称推理能力大体保留。
- Appendix A.6:相对直接提示,间接提示通常使 benign 更低、semi-toxic 更高;作者把少数例外归于有限样本噪声和残余风格因素。
- 复杂度:B1 为 O(rTn),B2 为 O(rTn)+O(n),B3 为 O(rn^3)。论文未给出实验所用的 n、r、T。
有什么可以进一步探索的点?
论文未设局限专节;Impact Statement写暴露关键头可能带来dual-use风险。
作者指出的局限与后续方向
- dual-use:Impact Statement 写,暴露安全关键层与注意力头也可能带来 dual-use 风险,这类认识可能帮助对手改进越狱提示或绕过防护。
- 后续用法:同一节鼓励后续工作主要用于防御性评估与对齐,并对探测内部机制设置明确保障与伦理边界。
- 论文没有 Limitations 专节;Discussion and Conclusion 也没有逐条列出方法或实验不足。
实验覆盖范围
- 主分析模型为 Llama3-8B、Qwen3-4B、Qwen3-8B;Section 5.4 与 Table 4 的泛化、缓解还包括 Flan-UL2 与 DeepSeek-R1-70B。
- FNG 使用 GossipCop 真实新闻、Direct 与 Indirect,以及 Original、BBC、NY Times(Section 3)。
- 标注为三名标注者独立标注并交叉验证,再接规则与 few-shot 自动评估(Section 3.2、Appendix A.5);论文未报告一致性数值,也未报告 CoT 总样本量。
- 任务还包括 HarmBench jailbreak,以及缓解后的 MATH500、GPQA(Section 5.4、Appendix J)。运行时间的对照为 attention-based 与 faithfulness-based(Table 8)。
- 论文未报告微调学习率、轮数,以及扰动和主实验的重复次数。
总结一下论文的主要内容
拒绝不等于过程安全;中部少数注意力头区分两类路由,缓解时只改这些头。
作者对推理 LLM 在虚假新闻生成中的 CoT 做内部路由分析,并只改关键头来降低过程风险。作者称这是该场景下不安全 CoT 的首次系统分析。
- 问题:输出拒绝常被当成全程安全。作者关心的是,模型可以拒绝虚假新闻请求,但 CoT 仍可能含可转用的不安全叙述。
- 方法:在 GossipCop 真实新闻上做直接与间接诱导,以及 Original、BBC、NY Times 风格约束,把轨迹标成 Safe、Potential Unsafe、Unsafe。用层间表示分离找连续关键层(默认 K=3),再用 softmax Jacobian 的 B1、B2、B3 定位关键注意力头。
- 现象:作者称拒绝之后约 80% 的推理链仍有风险,Safe CoT 不到 30%;Figure 1 作者称开启 Thinking 后不安全输出率近 80%。
- 定位:作者称安全与不安全分叉集中在网络中部的短窗口,间接提示平均更深 2.1 层。安全一侧被描述为更低 B1、更低 B2、更高 B3。该层范围在 HarmBench 上仍较窄,如 Llama3-8B 的 Concentration 为 72.2%(Table 3)。
- 干预:Table 4 中只更新 0.64%–1.95% 参数,News 平均增益 +67.1,HarmBench 平均 +55.0。Llama3-8B 的 News CoT safety 从 21.1% 到 94.7%;DeepSeek-R1-70B 缓解前为 10.5%。MATH500、GPQA 平均变化为 -1.5、-1.7。作者称不能由输出合规推断过程安全,只适配安全相关路由子集可以提高 CoT 安全并大体保留推理能力。