跳到正文
原文
论文追踪· arXiv:2602.02569· Haoran Ou, Kangjie Chen, Gelei Deng, Hangcheng Liu, Jie Zhang, Tianwei Zhang, Kwok-Yan Lam·本站收录 · 原文发表

DECEIVE-AFC:针对检索式 LLM 事实核查系统的对抗性主张攻击

DECEIVE-AFC: Adversarial Claim Attacks against Search-Enabled LLM-based Fact-Checking Systems

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

DECEIVE-AFC以black-box攻击搜索增强核查,DEFAME在MOCHEG上准确率由78.7%降到53.7%。

威胁模型攻击者只控制输入声明。在 black-box、input-only 设定下,只能访问目标 AFC 系统的输入和输出,不掌握内部或证据源;可查询 surrogate 系统生成对抗声明,再靠可迁移性攻击。

问题
搜索增强的LLM事实核查会动态检索开放网页证据。现有对抗声明攻击多面向静态语料或字符级扰动,在只能改输入声明时难以造成系统级核查失败。
方法
DECEIVE-AFC用智能体闭环改写声明,以检索误导、推理干扰和结构复杂化影响查询、检索与推理,并用相似度、NLI和理由相关性约束事实意图;在代理系统上迭代后再迁移。
实验与结果
在过滤后的MOCHEG上,DEFAME准确率从78.7%降到53.7%,ASR为31.4%;HiSS与LEMMA的ASR为19.5%和18.8%,高于同表字符级基线。代理模型自身ASR为36.6%。
局限与可以继续做的
论文未专门讨论局限。Discussion提出微调核查模型,以及在解释与检索阶段做对抗感知校验。实验覆盖HiSS、LEMMA、DEFAME和过滤后1642条;未报告人工确认样本量与各策略单独ASR。
实验设置HiSS、LEMMA 等 · MOCHEG · ASR、Accuracy 等
威胁模型
攻击者只控制输入声明。在 black-box、input-only 设定下,只能访问目标 AFC 系统的输入和输出,不掌握内部或证据源;可查询 surrogate 系统生成对抗声明,再靠可迁移性攻击。目标是诱导错误裁决,同时保持原事实意图,并使理由与对抗声明相关。
被测模型
HiSSLEMMADEFAMEGPT-4o-search-preview
基准
MOCHEG
指标
ASRAccuracyPrecisionRecallF1ROUGE-1ROUGE-2ROUGE-LMAUVESummaC
AI 导读研究者提出 DECEIVE-AFC,一个针对检索式 LLM 事实核查系统的智能体对抗攻击框架,在仅能修改输入主张的威胁模型下工作,不依赖对证据来源或模型内部的访问。该框架结合主张层面的攻击策略与对抗性主张有效性评估原则,系统搜索能够干扰搜索行为、证据检索和 LLM 推理的攻击轨迹。在基准数据集和真实系统上的评测显示,攻击使核查准确率从 78.7% 降至 53.7%,并显著优于已有的基于主张的攻击基线,且具有较强的跨系统迁移性。

研究者提出 DECEIVE-AFC,一个针对检索式 LLM 事实核查系统的智能体对抗攻击框架,在仅能修改输入主张的威胁模型下工作,不依赖对证据来源或模型内部的访问。该框架结合主张层面的攻击策略与对抗性主张有效性评估原则,系统搜索能够干扰搜索行为、证据检索和 LLM 推理的攻击轨迹。在基准数据集和真实系统上的评测显示,攻击使核查准确率从 78.7% 降至 53.7%,并显著优于已有的基于主张的攻击基线,且具有较强的跨系统迁移性。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    只改输入声明,能否让搜索增强的LLM事实核查给出错误裁决。

    只改写输入声明,能否让搜索增强的 LLM 事实核查系统给出错误裁决。

    • 场景:作者称错误信息会影响舆论并削弱对机构的信任,人工核查又难跟上数量。自动事实核查(AFC)检索证据并推理,输出裁决与理由。搜索增强系统由 LLM 解释声明、生成查询、从开放网页取证并汇总。
    • 现有不足:作者称既有对抗声明攻击多为传统 DNN 设计,证据来自静态库,或直接喂入黄金证据;字符级和词级改动难以打过更强的理解、动态检索与推理。证据攻击和声明–证据对攻击通常要改证据源或基准配对,作者认为在开放网页检索里往往不现实。
    • 观察:声明是启动整条流水线的唯一接口。作者认为,保持原事实意图、不写入显式虚假时,改动用词或结构仍可能扰乱查询、检索和后续推理。
    • 提出的方法:提出智能体框架 DECEIVE-AFC,在 black-box 下搜索攻击轨迹,并约束声明级攻击是否仍然有效。
    • 威胁模型:
      • 目标:把声明 c 改成 c′,使裁决错误,同时保住事实内容,并让理由与 c′ 相关,避免一读即被识破。
      • 约束写法:第 3 节写 Sim(c, c′)≤τ,Sim 被定义为语义距离(越低越相似);以及 Corr(c′, jc′)≤γ。τ 与 γ 的数值论文未给出。
      • 知识:只能看目标系统的输入和输出,不知内部,也不能控制证据源。摘要称为 input-only,正文称为 black-box,并称这符合商用系统的常见部署。
      • 能力:可任意查询 surrogate 系统来生成 c′,再借助可迁移性攻击目标。受害对象是含检索、裁决与理由生成的搜索增强 LLM 事实核查系统。
  2. 有哪些相关研究?

    相关工作分为DNN与搜索增强核查,以及声明、证据、声明–证据对三类攻击。

    按第 2 节,相关工作分成自动事实核查和对核查系统的对抗攻击;实验基线来自 FACTEVAL。

    自动事实核查

    • 标准流水线:给定声明后检索证据,再做裁决与理由生成(Akhtar et al., 2023; Guo et al., 2022; Thorne & Vlachos, 2018)。各阶段所用机制和模型差异很大。
    • DNN 系统:从预建文档库按词法匹配、嵌入相似度或学习到的检索模型取证(Pan et al., 2023a; Nakov et al., 2021a; Wu et al., 2024),再用神经模型联合建模声明与证据(Thorne et al., 2018; Kotonya & Toni, 2020; Nakov et al., 2021b)。作者称其依赖固定数据集上的监督训练,静态语料限制覆盖和时效,并引用 Guo et al. (2022)、Hu et al. (2022)。
    • LLM 与搜索增强:零样本、少样本和思维链被用于核查(Pan et al., 2023b; Hu et al., 2024; Caramancion, 2023; Tahmasebi et al., 2024)。作者称只靠预训练知识仍不够;后续工作接入外部搜索,由 LLM 解释声明、生成查询并汇总网页内容(Qi et al., 2024; Wang et al., 2024; 2025; Zhang & Gao, 2023; Xuan et al., 2024; Braun et al., 2024)。

    针对事实核查的对抗攻击

    • 对抗声明攻击:在保持事实意图下改写声明,例如释义、实体替换或时间与数值变化,以诱导错误裁决(Hidey et al., 2020; Kim & Allan, 2019; Thorne et al., 2019; Mamta & Cocarascu, 2025)。只动声明,不直接改证据源。
    • 对抗证据攻击:在检索阶段注入、修改或重排误导性证据(Boucher et al., 2022)。作者称这类攻击通常假设能篡改证据库、知识库或检索索引。
    • 声明–证据对攻击:同时操纵声明及其证据,常在既有基准里构造困难配对(Schuster et al., 2019)。作者称其依赖对证据源或基准构造的较强控制。Liu et al. (2025) 被引用为按输入声明和检索证据这两个攻击面作上述分类的综述。

    基线与基准

    • 基线方法:FACTEVAL(Mamta & Cocarascu, 2025)的 LEET、Homoglyph、Character Swap、Phonetic,覆盖视觉混淆、字符噪声和语音变体。作者以其在 LLM 事实验证上的攻击成功率为选用理由;这不是本文 Table 2 的结果。
    • 基准:MOCHEG(Yao et al., 2023)。实验在测试集上操纵已有声明,并去掉 Not Enough Information(NEI)。

    作者把本文放在声明级攻击上:证据类攻击的假设在开放网页检索中难满足;引言称既有声明攻击主要服务传统 DNN 或静态检索,难以造成搜索增强 LLM 核查系统的系统级失败。

  3. 论文如何解决这个问题?

    DECEIVE-AFC用三类声明策略和有效性约束,在代理系统上迭代出可迁移对抗声明。

    DECEIVE-AFC 把攻击写成闭环:按策略改写声明,在 surrogate 上读取裁决和理由,再由规划器决定停止、沿用或换策略。目标系统内部和证据源都不可见。

    问题设定与攻击界面

    • 目标系统写成 f(c, E(c)) = (yc, j):c 为声明,E(c) 为检索证据,yc 为裁决(0 表示声明为真,1 表示否则),j 为理由。
    • 攻击只替换 c。有效攻击要同时满足错误裁决、事实意图不变、理由与对抗声明相关。第 3 节的 τ、γ 没有实现数值。
    • 细化阶段用 surrogate 代替反复查询可能限流的目标系统。每次查询独立,不保留历史声明,以避免先前交互污染。

    三类声明级策略

    策略按流水线阶段分组,说明见附录 A。下面只保留类别和作用对象。

    • 检索误导(Search Engine Misguidance):改动用词和结构,影响查询生成与排序。子策略为低频同义词、非标准实体指称、冗余背景、关键词分散。作者称事实意图保留,但更可能检索到不相关或低质量证据。
    • 推理干扰(LLM Reasoning Disruption):针对把检索结果整理成证据,以及最终裁决与理由。子策略为插入事实正确但无关的陈述、提高句法复杂度、条件或推测语气、双重否定。作者称不改变声明本身的事实对错,但增加推理歧义。
    • 结构复杂化(Structural Complexity Escalation):把单跳事实改成多跳问题。子策略为把显式实体拆成间接指称,以及把原子事实改写成复合关系。作者称任一中间跳出错都可能打断核查链。

    有效性评估

    • 细化阶段:裁决必须错误;用语义相似度防止明显跑题(正文引用 Meng et al., 2013);用自然语言推理(NLI)检查没有把原事实改成矛盾(Wang & Jiang, 2016);再用 LLM 判断理由是否与对抗声明相关。
    • 最终评估:裁决翻转仍是必要条件。相似度阈值降低,NLI 从双向蕴含放宽到不存在显式矛盾。低于细化阶段严格阈值、但满足放宽条件的样本做人工确认,检查事实意图是否改变、文本是否仍可读。
    • 实现(附录 C):相似度用 Sentence-BERT(all-mpnet-base-v2),细化阈值 0.85,最终放宽到 0.7;NLI 用 DeBERTa-large-MNLI。第 3 节把 Sim 定义为语义距离并写成 ≤τ,附录实施的是上述相似度阈值。论文未报告人工确认的人数。

    智能体细化

    • Adversarial Claim Generator:GPT-4o。按所选策略或上一轮反馈生成或改写候选,同一对话内保留先前变体和反馈。
    • Victim Module:surrogate 为带网页检索的 GPT-4o-search-preview,返回裁决和理由。查询之间不共享历史。
    • Attack Evaluator:同样是 GPT-4o。比较良性与对抗声明上裁决是否翻转、理由偏移程度等。每次评估独立,看不到既往评估。
    • Semantic Guard 与 Attack Planner:守卫按第 4.2 节检查语义漂移。规划器根据评估和守卫决定终止,或在当前策略内继续、换同族变体、或转到另一高层策略,再把指引交回生成器。
    • 预算:每条最多 10 轮。策略空间是第 4.1 节各类策略的组合。只有满足语义保持标准的对抗声明才会替换原声明进入评测集。
  4. 论文做了哪些实验?

    三套目标上DECEIVE-AFC的ASR高于字符级基线,DEFAME准确率从78.7%降到53.7%。

    实验设置

    • 模型:目标为 HiSS(分层逐步提示,把声明拆成子声明)、LEMMA(生成多条查询并把外部知识送入推理)、DEFAME(零样本,可动态选择工具和搜索深度)。细化用的 surrogate 是 GPT-4o-search-preview。生成器与评估器都是 GPT-4o。
    • 数据:MOCHEG 测试集去掉 NEI 后 1642 条,positive 817、negative 825。做法是操纵已有声明,不是从零生成。
    • 基线与设定:FACTEVAL 的 LEET、Homoglyph、Character Swap、Phonetic。统一 black-box。攻击在 surrogate 上细化后迁移到三个目标。
    • 指标:ASR 是在第 4.2 节有效性约束下造成错误裁决的比例。另报 Acc、Prec、Rec、F1。理由对比用 ROUGE-1/2/L、MAUVE、SummaC;作者称 SummaC 越高表示语义一致越强,负值表示一致更弱。
    • 有效性门槛:细化时相似度阈值 0.85 且 NLI 双向蕴含;最终评估阈值 0.7,NLI 放宽为无显式矛盾。只满足放宽条件者做人工确认。相似度模型为 Sentence-BERT(all-mpnet-base-v2),NLI 模型为 DeBERTa-large-MNLI。
    • 预算:每条最多 10 轮。轮数消融的成本按每档 100 条计。论文未报告 ASR 的重复次数,也未报告人工确认的样本量与一致性。

    主结果

    据 Table 2。基线列是该系统已报告 ASR 中的最大值及对应方法,不是论文单独给出的汇总统计。

    表格较宽,可左右滑动

    目标良性 AccDECEIVE AccDECEIVE ASR已报告基线 ASR 的最大值
    HiSS77.5%61.9%19.5%8.5%(Homoglyph)
    LEMMA66.1%51.1%18.8%12.1%(LEET)
    DEFAME78.7%53.7%31.4%8.9%(LEET)
    • 作者称 DECEIVE-AFC 在三套系统上 ASR 都最高,对抗声明可跨系统迁移。摘要里的 78.7% 到 53.7% 与 DEFAME 一行相同。Table 1 中,目标就是代理模型 GPT-4o-search-preview 时,准确率从 90.5% 降到 57.4%,ASR 为 36.6%。
    • LEMMA 上准确率从 66.1% 降到 51.1%,召回从 64.9% 升至 79.6%,F1 从良性 62.3% 到对抗 61.9%(Table 2 该格未印出百分号)。论文未单独解释这一行。
    • LEET 在 HiSS 上未报告。作者称大量拼写扭曲导致拒绝预测,人类也难读。Table 2 已报告的基线 ASR 为 4.3% 到 12.1%。作者称这些传统扰动带来的性能下降有限。

    理由相似度

    • 测了什么:把成功、失败对抗声明的理由与其良性理由相比(Table 3)。论文未说明这张表对应哪一个目标系统。
    • 结果:成功为 ROUGE-1 0.470、ROUGE-2 0.257、ROUGE-L 0.324、MAUVE 0.385、SummaC -0.389;失败为 0.617、0.423、0.465、0.945、-0.193。
    • 作者的解读:失败案例的理由更接近良性理由;成功攻击则带来证据使用和推理结构上的偏移。第 6 节称,错误裁决会配上看似相关且连贯的理由,从而更难靠理由识破。

    细化过程的结果类型

    • 测了什么:Figure 3 分成功(左)与失败(右)统计优化结果类型。图例含 Shift justification、Degraded justification、Resistant、Resistant but degraded、Consistent justification、Flip but invalid、Others。
    • 结果:成功侧可见 6.4%、29.8%、63.8%,失败侧可见 7.2%、0.5%、29.5%、62.7%。纯文本未标明各百分比对应哪一类。
    • 作者的解读:成功主要来自理由偏移或退化;失败主要来自模型抵抗,或推理退化但裁决未翻转;一小部分因语义约束被判无效。

    语义守卫

    • 测了什么:Table 4 比较完整框架与去掉语义守卫。表题未写模型。完整框架 ASR 36.6% 与 Table 1 的 DECEIVE-AFC 行相同。最终评估仍施加语义约束。
    • 结果:完整框架的标签翻转率 42.1%、ASR 36.6%;去掉守卫后为 43.3%、23.1%。
    • 作者的解读:去掉守卫后翻转略增,但不少翻转在最终评估过不了语义约束,故 ASR 下降。作者称守卫是在引导优化,而不只是事后过滤。

    其他消融与分析

    • 细化轮数 1 到 10(Figure 4):横轴 Refinement Rounds,左图纵轴 Attack Success Rate,右图纵轴 API Cost (USD)。作者称 ASR 随轮数上升,超过一定轮数后收益变小,成本上升,过多细化可能过优化。正文未给出逐轮读数。成本按每档 100 条。
    • 作者称 GPT-4o-search-preview 在良性输入上准确率高,是因为常能检索到直接含原声明和裁决的权威核查文章,因而不把它当独立核查系统;因其易部署、推理快、成本适中,用作大规模 black-box 评估的 surrogate。
    • Table 1(目标即该代理模型):良性 Acc 90.5%、Prec 95.1%、Rec 85.4%、F1 90.0%;DECEIVE-AFC 下 Acc 57.4%、Prec 61.1%、Rec 40.1%、F1 48.4%、ASR 36.6%。
  5. 有什么可以进一步探索的点?

    论文未专门讨论局限;Discussion提出两条缓解思路。

    作者指出的局限与后续方向

    论文没有 Limitations 或 Future Work 专节,也未把实验范围写成方法局限。

    • 微调核查模型(第 6 节):作者称多数系统使用通用基础 LLM,缺少应对对抗声明的安全对齐;提出用成对的良性声明与对抗变体微调,以学习常见扰动模式并解释其语义。
    • 解释与检索校验(第 6 节):作者提出在解释声明、生成查询和依据证据核查的中间阶段加入对抗感知的校正或校验,以识别错误查询和低可信证据。
    • 结论中的复述(第 7 节):作者称讨论这些缓解,是为了改进现有做法并便于设计更稳健的核查框架,未另列局限。

    实验覆盖范围

    • 被测目标系统为 HiSS、LEMMA、DEFAME,共 3 个;Table 1 与细化阶段使用的 surrogate 为 GPT-4o-search-preview。
    • 数据为 MOCHEG 测试集去掉 NEI 后的 1642 条(positive 817,negative 825),设定为操纵已有声明。
    • 对照为 FACTEVAL 的 LEET、Homoglyph、Character Swap、Phonetic;设定为统一 black-box,生成与评估智能体为 GPT-4o,每条最多 10 轮。
    • 有效性计算使用 Sentence-BERT(all-mpnet-base-v2)与 DeBERTa-large-MNLI;只满足放宽阈值的样本另做人工确认。
    • 消融包括语义守卫(Table 4)和细化轮数 1–10(Figure 4,成本按每档 100 条)。论文未报告人工确认的样本量与一致性、各子策略单独的 ASR、ASR 的重复次数,以及 Figure 4 的逐轮读数。Table 3 与 Table 4 未写明目标系统。
  6. 总结一下论文的主要内容

    DECEIVE-AFC在黑盒下生成可迁移对抗声明,三个目标上的ASR高于字符级基线。

    DECEIVE-AFC 研究搜索增强 LLM 事实核查在 black-box、只改声明条件下会不会给出错误裁决。

    • 问题:开放网页检索使篡改证据源的攻击难落地。作者认为,面向静态库或字符噪声的声明攻击,打不动这类系统的查询生成、证据检索和 LLM 推理。
    • 方法:三类策略分别对准检索、推理和多跳结构。相似度、NLI 与理由相关性用来保住事实意图。GPT-4o 负责生成和评估,GPT-4o-search-preview 充当 surrogate,规划器在最多 10 轮内决定是否换策略。
    • 迁移结果:在去掉 NEI 的 MOCHEG 测试集(1642 条)上,DEFAME 准确率从 78.7% 降到 53.7%,ASR 为 31.4%(Table 2)。HiSS、LEMMA 的 ASR 为 19.5% 和 18.8%,高于同表已报告的字符级基线。LEET 在 HiSS 上未报告。
    • 代理模型与例外:目标就是 GPT-4o-search-preview 时,准确率从 90.5% 降到 57.4%,ASR 为 36.6%(Table 1)。LEMMA 上 F1 从 62.3% 到 61.9%,召回从 64.9% 升至 79.6%,论文未单独解释。
    • 作者结论:作者称这些失败来自检索和下游推理被扰乱,而不是表面扰动;去掉语义守卫后 ASR 从 36.6% 降到 23.1%(Table 4)。第 6 节提出微调核查模型,以及在查询和检索阶段做对抗感知校验。论文未专门讨论方法局限。
阅读原文arxiv.org