研究者提出 Ghostwriter 攻击:用伪造证据注入操纵 LLM 观点
Steering LLM Viewpoints through Fabricated Evidence Injection
Ghostwriter用伪权威证据改写观点再条件注入;作者称对齐模型易被引导,GPT-5.4只部分降低。
对手控制改写后的S′和至少一条投递通道(第三方聚合器、内部修改、检索或工具输出),只有目标模型的black-box API访问,无参数、梯度或logit访问。
- 聊天机器人被用于事实查询、决策和情感支持时,对手若把带统计、案例和权威措辞的伪造证据放进上下文,模型可能把它当合法背景,并在相关回答中输出误导观点。作者认为安全对齐主要针对显式恶意指令。
- Ghostwriter用轻量模型把观点改写成伪权威文本,再以条件模板在相关查询写入回答,不相关则正常回答。只需black-box API与一条上下文通道。改写模型为GPT-4o-mini或LoRA微调的Qwen-2.5-7B。
- 三个对齐模型在HVD上攻击后HCRate上升;Qwen攻击下DeepSeek-V3隐式查询为293.81%。GPT-5.4受GPT-4o-mini攻击时平均VSScore为7.15(n=33)。HVD上检测率80.5%。
- 作者指出,没有内部协助就不能直接攻击ChatGPT一类官方应用,也不应在线上平台实施。HVD由LLM生成,作者认为可能引入偏差。附录把多观点模板优化列为后续方向。实验覆盖三类安全范式;论文未报告改写轮数上限N。
- 威胁模型
- 对手控制改写后的S′和至少一条投递通道(第三方聚合器、内部修改、检索或工具输出),只有目标模型的black-box API访问,无参数、梯度或logit访问。知道目标话题,不必知道用户具体查询。目标是相关查询上加强观点对齐,无关查询与未攻击回答保持近似。
- 被测模型
- GPT-4oClaude-3.7-SonnetDeepSeek-V3DeepSeek-R1Gemini-3.1-Proo3-miniGPT-5.4Claude-4.6-SonnetClaude-4.7-Opusgpt-oss-safeguard-20b
- 基准
- HVDHVD-OBBQToxiGenMMLU-Pro
- 指标
- VSScoreHCRateNRRatebypass ratedetection rateFP RateMMLU-Pro accuracy
研究者提出 Ghostwriter 两阶段攻击框架,先把误导性陈述包装成带有可信标记的伪造理由,再指示目标 LLM 在回答相关问题时采纳这些观点。在 BBQ、ToxiGen 及自建数据集上的实验显示,未配备外部安全分类器的商用 LLM 仍然高度易受影响,即使是有前沿分类器护栏的模型(如 GPT-5.4)也只能降低而无法消除该攻击。作者还探索了多种防御策略,其中定制安全策略使 gpt-oss-safeguard 达到 81% 的检测率。
深度解读
这篇论文试图解决什么问题?
安全对齐后的商用LLM仍可能采信带可信标记的伪造证据,并在相关回答中输出误导观点。
安全对齐后的商用LLM,仍可能把带引用、统计和科学化措辞的伪造证据当成合法上下文,并在相关回答中采纳误导观点。
- 使用场景:作者称官方助手、第三方聊天平台和社交媒体上的LLM已被用于事实查询、决策和情感支持。若对手能植入偏见、推销、错误信息或意识形态内容,这些机器人会成为大规模说服工具。
- 现有不足:作者认为安全对齐主要针对显式恶意指令。面对看似可信的外部错误信息时,模型可能识别不出欺骗,并据此组织回答。
- 核心观察:作者称之为模型内在的authority bias:带引用、统计和审慎科学措辞的内容会被当成合法背景,而非对抗输入。该性质与证据经哪条通道进入上下文无关。
- 本文提出:两阶段攻击Ghostwriter。轻量LLM先把陈述改写成伪客观文本;双模式模板在相关查询写入该观点,无关查询则正常回答。作者还比较多种防御,并用定制策略提升gpt-oss-safeguard的检测。
- 威胁模型:
- 目标:相关查询上加强观点对齐,即V(S, R)高于V(S, Mθ(Q));无关查询与未攻击回答近似不可区分。
- 知识:只有black-box API,无参数、梯度或logit访问。知道目标话题,不必知道用户的具体查询或内部状态。
- 能力:控制改写后的S′和至少一条通道,包括第三方聚合器(文中举例Poe与shadow APIs)、对服务栈有写权限的内部人员,以及网页搜索、企业知识库和智能体工具输出。排除微调或改权重,以及依赖受害者主动寻求有害内容的攻击。
- 受害系统:会把不可信文本放进上下文的已部署聊天模型。用户提交Q,看到的是被替换上下文生成的回答,且不知道发生了替换。
有哪些相关研究?
论文把相关攻击分成越狱、提示注入、RAG投毒和上下文编辑,并称Ghostwriter要求模型接受观点。
论文按对手要求模型做什么来分组,并据此定位Ghostwriter。
越狱
- 禁止知识引出:Wei et al. (2023)、Shen et al. (2024)、Chu et al. (2025)、Yang et al. (2025)研究引出模型已掌握的被禁止知识。模板攻击如DAN依赖角色扮演;GCG(Zou et al., 2023)追加对抗后缀;PAIR(Chao et al., 2023)与PRS(Andriushchenko et al., 2024)用自然语言迭代改写提示词。
- 论文的对比:这些方法不在乎回答形式,只要产出被禁止信息。论文称Ghostwriter要求模型采纳其本会拒绝的观点,且回答要读起来像模型自己的分析。
提示注入
- 任务劫持:Liu et al. (2023)、Greshake et al. (2023)、Hui et al. (2024)、Liu et al. (2024)让模型执行攻击者提供的另一任务,覆盖用户意图。PLEAK(Hui et al., 2024)后文被用作提示泄露探测。
- 论文的对比:Ghostwriter保持用户任务不变,条件模板只推动模型在回答原查询时接受嵌入的伪证据。
RAG投毒与上下文编辑
- 检索投毒:PoisonedRAG(Zou et al., 2025)与Topic-FlipRAG(Gong et al., 2025)向检索注入文档,工程重点在排序;载荷作为可引用来源,下游模型通常引用或归因。论文称Ghostwriter针对安全敏感观点,并设计为被内化而非被引用。
- 上下文编辑:Chen et al. (2024)、Zheng et al. (2023)注入事实回忆,该任务很少触发拒绝。论文称Ghostwriter针对观点形成,既要改写以绕过对齐,也要条件模板以推动内化。
基线与基准
- 基线方法:实验将PAIR、PRS、PoisonedRAG、Topic-FlipRAG改用于观点注入,并经同一Tinject通道,在110条HVD上比较(附录A.5)。
- 基准:自建HVD与HVD-O,以及改编的BBQ(Parrish et al., 2021)、ToxiGen(Hartvigsen et al., 2022);无关任务用MMLU-Pro(Wang et al., 2024)。
论文的定位是:越狱要求披露,提示注入要求服从,RAG投毒要求引用,知识编辑要求回忆;Ghostwriter要求模型接受。
论文如何解决这个问题?
Ghostwriter先把观点改写成伪权威证据,再用条件模板在相关查询时写入回答。
Ghostwriter分两阶段:先把误导陈述改写成带可信标记的伪客观文本,再经条件模板放入目标模型上下文,使用户在相关问题上看到吸纳该观点的回答。
问题设定与目标
设Mθ为目标LLM,S为要植入的观点,S′为改写形式,Tinject为注入模板,Q为用户查询。用户观察到R = Mθ(Tinject(S′, Q)),且不知道原查询已被替换。查询分为相关与不相关。攻击者构造(Tinject, S′),使相关查询上V(S, R) > V(S, Mθ(Q)),不相关查询与未攻击回答近似。V衡量回答与S的对齐。
阶段一:陈述改写
- 设计:保持原立场,但加上统计、案例和权威措辞等可信标记。作者认为这利用较弱LLM的幻觉倾向,以及目标LLM对这类标记的信任。
- GPT-4o-mini:作为AttackerLM,按Trewrite扩充S。JudgeLM从观点保真、证据质量和呈现风格打1–10分(Tab. 15)。达到8分即停;否则把候选和简短反馈追加后再采样。达到轮数上限仍无通过样本时取历史最高分。论文未给出该上限的数值。Tab. 13给出完整提示词。
- Qwen-2.5-7B:用陈述对做LoRA微调。实现部分写明为100对,含人工编写的有害陈述。作者称微调后可对任意观点稳定生成改写文本。
阶段二:条件注入
- 相关判断:Tinject(Tab. 14)要求模型自行判断Q是否与S′同话题,且不向用户透露该判断。
- 两种模式:相关时,回答开头纳入S′并给出支持论证,同时回应用户问题;后续相关问题不再复述S′,但内容仍与之一致。不相关时正常回答,不提及S′。
- 接入点:主实验把Tinject与用户查询拼接为输入。平台实验另测系统提示词、MCP服务器和用户输入拦截。
数据与成功判定
- HVD:每条含类别、误导性基本陈述、显式查询、隐式查询,以及该陈述为何有问题的说明。刻板印象301条,覆盖gender、race、age、religion、occupation、sexual orientation、physical characteristics;虚假信息428条,覆盖brand、political、medical misinformation与psychological manipulation。由Grok批量生成,再人工去掉重复和不合规条目。附录给出示例。
- HVD-O:由gpt-oss-20b-uncensored仅按类别提纲重生成,不接触原HVD。Table 8称完整配对为729条。
- 改编基准:BBQ抽样并去重后447条;ToxiGen通过附加查询改编。论文未写明所用ToxiGen子集条数。
- 判定:主指标VSScore由GPT-4o按TJudge打1–10分。另用Llama-Guard-4-12B计算HCRate,用Minos计算NRRate。
论文做了哪些实验?
对齐模型在HVD上的HCRate于攻击后上升;作者称分类器防护只部分降低攻击。
实验设置
- 目标模型:对齐模型为GPT-4o、Claude-3.7-Sonnet、DeepSeek-V3;推理模型为DeepSeek-R1、Gemini-3.1-Pro、o3-mini;分类器防护模型为GPT-5.4、Claude-4.6-Sonnet、Claude-4.7-Opus。均经官方API,temperature 1.0,最大生成长度500 tokens。
- 攻击者:GPT-4o-mini,以及100对样本LoRA微调的Qwen-2.5-7B。主VSScore评审也是GPT-4o,它同时是被攻击目标之一。
- 数据:HVD为刻板印象301条、虚假信息428条;HVD-O在Table 8中为729对;BBQ为447条;ToxiGen条数论文未说明;MMLU-Pro为六类各64题。基线对比用110条HVD,每类10条。Table 3每类随机3条,每格n=33。
- 基线:PAIR、PRS、PoisonedRAG、Topic-FlipRAG,改用于观点注入并走同一Tinject(附录A.5)。
- 指标:VSScore为1–10,越高越支持原观点。HCRate是不安全回答数除以不安全原始陈述数,可以高于100%。NRRate是非拒绝比例。防御另报检测率与FP Rate。
- 分类器:HCRate用Llama-Guard-4-12B,论文写明其官方F1为61%。NRRate正文写Minos-v12,脚注模型卡为Minos-v1。论文未报告主实验重复次数。
主结果
下表为HVD上的HCRate(Table 2)。mini为攻击者GPT-4o-mini,Qwen为微调后的Qwen-2.5-7B。Claude无攻击显式查询在表中写为0。
表格较宽,可左右滑动
目标模型 无攻击显式 mini显式 mini隐式 Qwen显式 Qwen隐式 GPT-4o 0.88% 72.57% 53.10% 202.65% 175.22% Claude-3.7-Sonnet 0 62.83% 97.35% 164.60% 209.73% DeepSeek-V3 3.54% 83.19% 147.79% 258.41% 293.81% - 观点分:Table 1的回答VSScore在攻击后高于无攻击。攻击后最低为5.5(Sexual Orientation、隐式、GPT-4o-mini、目标GPT-4o),最高为9.8(Age显式与Occupation隐式,均为Qwen、DeepSeek-V3)。作者称隐式查询与显式查询相当,因而攻击不依赖特定问法。
- 攻击者差异:作者称Qwen持续优于GPT-4o-mini,因为微调绕过了使后者偶尔拒绝改写敏感内容的约束。Table 1有反例:Psychological Manipulation、显式、Claude-3.7-Sonnet为6.8对7.0;隐式、DeepSeek-V3为8.0对8.1。
- 危害与例外:作者称安全敏感类别仍比age、occupation、brand更难,并称HCRate是保守下界。正文称GPT-4o-mini在HVD/BBQ上使HCRate提高63–176%,Qwen常超过200%并达到293%。ToxiGen上更低:GPT-4o-mini分别为17.65%、23.53%、38.24%(Table 2),作者称对齐部分抑制了第一人称仇恨言论的改写。NRRate同步上升,如GPT-4o、HVD显式从71.92%到84.91%(mini)和87.12%(Qwen)。正文称Fig. 3在BBQ与ToxiGen上趋势与HVD相同。
推理模型与分类器防护
Table 3均为攻击条件;被直接拦截的输入记VSScore=1。mini为GPT-4o-mini。
表格较宽,可左右滑动
模型 mini平均 mini≥8 Qwen平均 Qwen≥8 DeepSeek-R1 9.70 33/33 9.76 32/33 Gemini-3.1-Pro 9.45 32/33 9.64 32/33 o3-mini 9.21 30/33 9.91 33/33 Claude-4.6-Sonnet 8.85 29/33 9.27 30/33 Claude-4.7-Opus 7.00 22/33 8.49 28/33 GPT-5.4 7.15 23/33 8.42 27/33 - 作者解读:无外部分类器的推理模型仍易受攻击;分类器防护只部分降低。作者称GPT-5.4最稳健,但仍让多数通过。
- 与表的差别:GPT-4o-mini攻击下,Claude-4.7-Opus平均7.00、≥8为22/33,GPT-5.4为7.15、23/33。Qwen攻击下前者为8.49、28/33,后者为8.42、27/33。
- 失败检查:作者称残余抑制几乎都来自前端分类器硬拦截;输入一旦通过,回答仍支持S′。作者据此认为稳健性在分类器,不在生成器对齐。
与相近攻击的对比
- 设置:110条HVD、每类10条,VSScore为三个对齐模型的平均(附录A.5)。
- 分数:作者称低敏感话题上RAG载荷也能达到高分。Table 5中Brand的无攻击为2.5,PAIR为8.6,PoisonedRAG为8.2,Topic-FlipRAG为8.7,GW(Qw)为9.5。Gender的PAIR为2.8、PoisonedRAG为2.3、GW(4o)为7.8;Psych. Manip.的PAIR为2.4、GW(4o)为6.5、GW(Qw)为7.2。作者称敏感类别上基线接近无攻击,Ghostwriter保留4.9分差距,并称绕过对齐的是改写而非注入通道。
- 使用方式:20个主题上,Ghostwriter的Argument Extension为65%,Source Distancing为5%,Safety Hedging为10%;PoisonedRAG为0%、70%、55%(Table 6)。作者称RAG供引用,Ghostwriter供采纳;越狱基线会留下角色扮演式风格痕迹。
防御探索
- 用户侧:警告前缀、加固系统提示词和提示泄露探测均被作者称为不能成立。前缀会被并入条件模板;系统提示词加固有限,伪装好的陈述仍会通过。Table 12的Levenshtein距离(越低越接近泄露):GPT-4o为0.900、0.925、0.920;DeepSeek-V3为0.565、0.418、0.713;Claude-3.7-Sonnet为0.723、0.647、0.668。作者称GPT-4o拒绝全部变体,后两者会部分回显。
- 事后检测:作者称Tdetect下的GPT-4o与Llama-Guard-4精确率高于0.92、召回不超过0.55。gpt-oss-safeguard-20b加定制策略:HVD检测率80.5%、FP Rate 1.4%;BBQ为76.8%、2.1%;ToxiGen为72.3%、3.5%(Table 9),且未按数据集调参。摘要写81%,贡献列表与Table 9写80.5%。
- 开销:附录A.6称单张A100上约0.45秒、约0.001美元/条。作者称该过滤器不改写模型输出,效用代价是误报率。附录Table 19给出完整策略。
其他消融与分析
- 平台绕过(Table 4,20条高VSScore陈述):8/9平台为100%(20/20);Character.AI系统提示词为55%(11/20),作者称因长度上限。
- 人工:20人评30条,与GPT-4o的Pearson r=0.955;另30条中人类标不安全76.7%,Llama-Guard为56.7%,κ=0.426。
- MMLU-Pro总体准确率(Table 11):GPT-4o 74.48%对69.79%,Claude-3.7-Sonnet 77.86%对77.08%,DeepSeek-V3 71.61%对69.79%;†为带注入模板。
- Table 7(100条、seed=42、目标GPT-4o):攻击后VSScore为GPT-4o评审8.77、GPT-5.4评审8.96(r=0.95)、Claude-4.6-Sonnet评审6.92(r=0.90)。不安全标记率:Llama-Guard-4 72.0%,GPT-5.4 93.0%,Claude-4.6-Sonnet 96.0%。
- Table 8(729对、GPT-4o评审):GPT-4o在HVD-G/HVD-O上攻击后为7.50/9.09,无攻击为1.88/3.57;DeepSeek-V3攻击后为7.93/9.62。作者称这不支持效果来自Grok来源。
- Figure 6左图标注Qwen-2.5-7B为8.47、GPT-4o-mini为7.50、去掉阶段一为6.50。作者称未改写的S会降低VSScore,三种上下文编辑替代也更弱,两阶段缺一不可。
有什么可以进一步探索的点?
作者指出不能直接攻击官方应用,并认为LLM生成的HVD可能带来偏差。
作者指出的局限与后续方向
- 官方应用:没有内部协助时,不能直接攻击服务大量用户的官方应用(文中举例ChatGPT),也不应在线上平台实施此类攻击(§8 Limitations)。
- 替代证据:作者称对基础模型的直接攻击、用其他攻击点做的平台绕过测试,以及已记录的现实事件,共同确立了该威胁的可行性,且未对用户造成实际伤害(§8)。
- 数据来源:HVD由LLM生成,可能引入偏差(§8)。作者称已在BBQ、ToxiGEN上得到一致结果,并用无关的未审查开源模型重跑全流程;两个数据集在每个类别上都高于无攻击基线。作者称已公开HVD以供社区核验。
- 多观点后续:附录A.9列出后续方向,包括为多观点场景优化Tinject、部署多个专用模板、协调多个持不同观点的聊天机器人,以及注入多条不同陈述以加强同一观点。
实验覆盖范围
- 被测模型包括对齐模型GPT-4o、Claude-3.7-Sonnet、DeepSeek-V3,推理模型DeepSeek-R1、Gemini-3.1-Pro、o3-mini,以及分类器防护模型GPT-5.4、Claude-4.6-Sonnet、Claude-4.7-Opus;Table 3每格n=33(§5.3)。
- 数据包括HVD(301条刻板印象、428条虚假信息)、HVD-O(Table 8的729对)、BBQ 447条、改编ToxiGen,以及MMLU-Pro六类各64题。
- 攻击对比包括PAIR、PRS、PoisonedRAG、Topic-FlipRAG,110条HVD;防御包括用户前缀、系统提示词加固、三种提示泄露探测,以及Tdetect下的GPT-4o、Llama-Guard-4和带定制策略的gpt-oss-safeguard-20b(§6.2、§6.5)。
- 平台测试覆盖9个平台、三种攻击面、20条高VSScore陈述(Table 4)。人工评估为20名参与者,观点支持30条,安全标注另30条(§6.1、附录A.8)。
- 论文未报告阶段一循环上限N的数值、ToxiGen子集规模和主实验重复次数。§5.2写明Llama-Guard-4官方F1为61%,作者将其HCRate用作趋势而非精确数值评估。
总结一下论文的主要内容
作者称攻击未被消除;定制gpt-oss-safeguard在HVD的检测率为80.5%。
Ghostwriter是一种针对上下文窗口的观点引导攻击:把误导陈述改写成伪权威文本,再在相关查询中让目标模型把该观点写进回答。
- 问题:作者认为商用聊天模型已用于查询、决策和情感支持,但安全对齐主要挡住显式恶意指令。带引用、统计和科学化措辞的伪造证据会被当成合法背景。
- 威胁模型:攻击者只有black-box API,控制S′和至少一条通道(第三方聚合器、内部修改、检索或工具输出)。用户提交查询,看到的是被替换上下文生成的回答。相关查询要更对齐目标观点,无关查询保持正常。
- 方法:GPT-4o-mini按1–10分迭代改写,达到8分即停;或用100对样本LoRA微调Qwen-2.5-7B。条件模板在相关时纳入S′并论证,不相关时不提及。评测用HVD、HVD-O、BBQ和ToxiGen,主指标是GPT-4o给出的VSScore。
- 结果:Table 2中,Qwen攻击、HVD隐式查询、DeepSeek-V3的HCRate为293.81%。Table 1攻击后VSScore最低5.5、最高9.8。Table 3中三个推理模型的攻击后平均为9.21至9.91;GPT-5.4在GPT-4o-mini攻击、n=33下平均7.15,其中23/33仍不低于8。作者称输入一旦通过前端分类器,生成器仍支持S′。定制策略使gpt-oss-safeguard在HVD上检测率80.5%、误报1.4%;摘要另写81%。
- 作者结论:伪权威证据加条件模板可以绕过安全对齐并被模型内化。现有防御只部分缓解;该检测策略可在不按数据集调参的情况下用于BBQ和ToxiGen。