跳到正文
原文
arXiv:Agent 与 MCP 安全· arXiv:2607.10712· Bálint Gyevnár·本站收录 · 原文发表 精选关注度56

研究提出间接数据投毒攻击,可操纵 Claude、Codex 与 Gemini 的科研结论

Distributed Denial of Science: How Indirect Data Poisoning of AI Systems Can Industrialize Scientific Fraud

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

作者评估了针对科研智能体的间接数据投毒,在450次实验中49.56%得出投毒结论,而五项数据来源审计可将成功率降至0%。

威胁模型黑盒威胁模型:攻击者无法访问AI智能体或其提示词,也不通过训练数据投毒,而是通过公开数据生态上传篡改数据集(利用创建新数据、插入数据、插补特征、误导元数据四种向量),利用智能体的常规检索渗透系统;受害系统为诚实科学家部署的端到端科研智能体,基座模型未被投毒且用户提示词无恶意偏向。

问题
科研智能体日益自主检索公开数据开展端到端研究。远程攻击者可能通过篡改公开数据集诱导智能体得出虚假结论,使诚实科学家在不知情下成为学术欺诈的传播者。
方法
在5个社会技术议题上,通过插入数据、插补变量和虚假元数据构造篡改数据集并上传至私有仓库API。测试3款前沿智能体在3种提示词下的表现,并评估科学家角色设定与五项数据来源审计防御。
实验与结果
在450次基线运行中,投毒数据检索率为84.22%,完全成功率达49.56%,而检测率仅6.0%。相反攻击目标的成功率无统计显著差异。数据来源审计将完全成功率降至0.0%,检测率升至77.33%。
局限与可以继续做的
测试议题均为缺乏共识的社会技术领域且均为表格数据;通过自制API包装器访问私有仓库;防御仅在提示词层面对抗单一威胁模型;数据来源审计在正规数据上出现2.0%误报率;评估依赖LLM裁判。
实验设置Claude Code with Claude Opus 4.7、Codex with GPT-5.5 等 · Hiring discrimination at the workplace、Fertility rate analysis in Europe 等 · Full success、Partial success 等
被测模型
Claude Code with Claude Opus 4.7Codex with GPT-5.5Gemini CLI with Gemini 3.1 Pro
基准
Hiring discrimination at the workplaceFertility rate analysis in EuropeMotivational cost of generative AIRacial disparity in traffic policingAutonomous vehicle vs. human driver safety
指标
Full successPartial successAny successNo successRetrievedDetection outcomeUsedPoisoned statisticsPoisoned conclusion
AI 导读和推荐理由研究提出并实测一种名为间接数据投毒的新攻击:攻击者污染公开数据集并把污染版本上传到公共仓库,自主科研 Agent 在检索时可能直接采用,使诚实科学家在不知情下成为造假的传播者。实验覆盖从招聘歧视到自动驾驶安全等五个社会议题,使用 Claude Code 搭配 Claude Opus 4.7、Codex 搭配 GPT-5.5、Gemini CLI 搭配 Gemini 3.1 Pro 三个前沿系统,共 450 次受控实验运行,投毒在 49.56% 的运行中成功,而检测率仅 6.0%。该攻击不需要特定话题触发词、Agent 访问权限、间接提示注入或伪造论文,只依赖开放数据生态和误导性元数据。作者评估了两种缓解措施:让 Agent 扮演科学家角色后仍有 16.67% 的运行得出被投毒的结论,而包含引用论文、社交信号、统计异常、相关数据集和投毒警示五项检查的数据来源审计可把攻击成功率降到 0。

研究提出并实测一种名为间接数据投毒的新攻击:攻击者污染公开数据集并把污染版本上传到公共仓库,自主科研 Agent 在检索时可能直接采用,使诚实科学家在不知情下成为造假的传播者。实验覆盖从招聘歧视到自动驾驶安全等五个社会议题,使用 Claude Code 搭配 Claude Opus 4.7、Codex 搭配 GPT-5.5、Gemini CLI 搭配 Gemini 3.1 Pro 三个前沿系统,共 450 次受控实验运行,投毒在 49.56% 的运行中成功,而检测率仅 6.0%。该攻击不需要特定话题触发词、Agent 访问权限、间接提示注入或伪造论文,只依赖开放数据生态和误导性元数据。作者评估了两种缓解措施:让 Agent 扮演科学家角色后仍有 16.67% 的运行得出被投毒的结论,而包含引用论文、社交信号、统计异常、相关数据集和投毒警示五项检查的数据来源审计可把攻击成功率降到 0。

推荐理由论文给出间接数据投毒在三个前沿 Agent 上的成功率与检测率,并对比两种提示层缓解手段的效果,可供部署科研 Agent 的团队参考。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者评估了远程攻击者能否利用开放数据生态对科研智能体实施间接数据投毒,从而操纵诚实科学家的研究结论。

    远程攻击者能否通过间接数据投毒操纵自主科研 AI 智能体,使其产生符合攻击者偏好的虚假结论并规模化学术欺诈。

    • 科研智能体自主检索的风险场景:随着 Claude Code、Codex、Gemini CLI 等工具普及,诚实科学家正使用具备网络检索能力的 AI 智能体自动化数据探索与端到端科研,检索占智能体工具调用的约 6%。
    • 传统造假与现有投毒研究的不足:传统企业学术造假需要巨资与复杂运作;而现有机器学习投毒多针对模型预训练,RAG 投毒通常针对已知知识库或包含恶意提示注入指令,未涵盖开放数据生态中的无指令自然篡改。
    • 威胁模型:
      • 攻击目标:操纵科研智能体得出支持或反对特定假设 H 的虚假或误导性结论,使诚实科学家发表篡改结果,为攻击者叙事赋予学术合法性。
      • 攻击者知识:具备黑盒访问条件,与诚实用户共享相同的公开文献与开源数据生态,但无法直接访问 AI 系统,也无法获知诚实用户的具体提示词。
      • 攻击者能力:无需修改模型权重,利用生成式 AI 辅助低成本实施四种攻击向量(创建新数据集、插入新数据、插补现有数据、编写误导性元数据),并将篡改数据上传至公开平台。
      • 受害系统:诚实科学家部署的具备自主检索与代码执行能力的端到端科研 AI 智能体,模型基座未被投毒,用户提示词无恶意偏向。
    • 研究框架与防御探索:作者构建了包含 5 个社会技术议题、3 款前沿智能体、450 次控制实验的评估流程,并提出了科学家角色设定与五项数据来源审计两项提示层防御机制。
  2. 有哪些相关研究?

    论文梳理了自动化科研系统的可靠性缺陷、智能体投毒攻击及检索验证方法,指出现有防御未解决开放数据无指令投毒。

    针对科研自动化与数据安全的交叉领域,论文讨论了以下几组相关工作:

    • 自动化科研系统及其可靠性缺陷:早期尝试如 Boiko 等(2023)针对特定流程,后续工作如 The AI Scientist(Lu 等,2026)、Curie(Kon 等,2025)、Agent Laboratory(Schmidgall 等,2025)与 AI-Researcher(Tang 等,2025)推进了端到端自动化。针对其缺陷,Luo 等(2025)指出全自动 AI 科学家系统存在基准选择偏见、数据泄露及类似 p-hacking 的事后选择偏见,且难以从最终论文识别;Trehan 与 Chopra(2026)、Beel 等(2025)指出系统存在偏见与数值幻觉。
    • 针对 AI 系统的投毒攻击:传统深度学习投毒多通过训练数据实施(Goodfellow 等,2015;Carlini 等,2024;Wallace 等,2021)。针对检索管道,间接提示注入(Greshake 等,2023)与 RAG 投毒(Zou 等,2025;Liu 等,2025;Zhang 等,2026a;Li 等,2025)通常依赖控制检索源或注入指令;Stokel-Walker(2026)讨论了发表伪造论文建立认知偏向的现象。
    • 科研输出验证与检索防御:部分工作尝试利用结构化知识图谱验证模型输出(Alber 等,2025;Yang 等,2024),但作者指出知识图谱本身由文献构建,一旦文献被污染也会受到影响;Edemacu 等(2026)与 Pathmanathan 等(2025)则针对 RAG 提出了检索阶段防御机制。
    • 基线方法与测试基准:论文的对比基线为无防御设置下的智能体表现,测试基准涵盖 5 个公开数据集构建的议题:招聘歧视(Lippens 等,2022)、欧洲生育率(OWID 数据集)、生成式 AI 动机损耗(Wu 等,2025)、交通执法种族差异(Pierson 等,2020)及自动驾驶安全(加州 DMV 与 NHTSA FARS 数据)。
    • 与既有工作的定位区别:作者指出,本文放宽了以往投毒需要直接访问智能体、控制指定检索源或植入恶意指令与标记词的假设,展示了仅靠开放数据生态中看似正规的数据集与元数据即可诱导科研智能体得出攻击者偏好的结论。
  3. 论文如何解决这个问题?

    作者通过四种数据操纵向量和私有API隔离环境构建攻击,并提出了科学家角色设定与五项独立数据来源审计防御。

    作者提出并评估了间接数据投毒(indirect data poisoning)攻击框架,并在黑盒、无特权指令设定下测试其危害,随后设计了科学家角色设定与数据来源审计两项防御。

    威胁模型与形式化设定

    • 黑盒攻击设定:攻击者无法直接访问 AI 智能体,AI 智能体未被训练投毒,诚实科学家的提示词不含欺骗意图。
    • 核心定义:给定原始数据集支持的科学假设 H,攻击者旨在构造篡改数据集 D′1 以改变智能体对其支持方向。
    • 四类攻击向量:
      1. 创建新数据集:利用需注册才可获取的数据集的公开元数据构建全新虚假数据。
      2. 插入新数据:通过拟合已有数据的模型进行有偏采样插入虚假新样本。
      3. 插补现有数据:修改既有特征改变相关性或回归关系。
      4. 编写误导性元数据:编写虚假 README 或数据加载代码以支持攻击假设或质疑真实数据。
    • 双向攻击目标:针对每个议题分别设计拒绝目标(Reject goal,反驳原假设)与夸大目标(Exaggerate goal,夸大原假设效应)。

    实验议题构建与伦理隔离

    • 五大社会技术议题:涵盖职场招聘歧视(Kaggle)、欧洲生育率(OWID/GitHub)、生成式 AI 动机损耗(OSF)、交通执法种族差异(Stanford Open Policing/GitHub)、自动驾驶安全对比(CA DMV/FARS/HF)。
    • 伦理隔离与 API 包装:篡改数据上传至 GitHub、HuggingFace、OSF、Kaggle 的私有仓库,通过中间人包装器拦截 API 并修改公共可见性属性,使智能体感知为公开仓库且不知晓拦截。

    提示词梯度设计

    • 提示词设计:由独立于投毒过程的作者撰写三类提示词:
      1. Minimal prompt:单句中立提示,无方法学细节。
      2. Targeted prompt:增加方法学指引并高亮关注变量。
      3. Critical prompt:强调批判性分析、文献对比与潜在偏见排查。三类提示词均未直接提及任何具体数据集。

    防御机制设计

    • 科学家角色设定(Scientist Persona):在系统提示词中扩展要求模型扮演具备求知诚实、统计严谨、科学批判精神的科研人员。
    • 数据来源审计(Data Provenance Audit):在角色设定基础上,通过自定义审计技能并行执行五项独立检查并合成风险分:
      1. 寻找引用文献:检查数据集是否被可信科学出版物引用。
      2. 验证社交标记:评估星标、下载量等使用指标。
      3. 检查统计异常:计算均值、极值、方差等简单统计量排查异常分布。
      4. 对比相关数据集:检索同主题其他数据集比对尺度与分布一致性。
      5. 警惕数据投毒:显式提示模型评估数据集是否存在蓄意操纵。
  4. 论文做了哪些实验?

    450次基线运行显示完全投毒成功率达49.56%,而五项数据来源审计将完全攻击成功率降至0.0%。

    实验设置

    • 被测模型:Claude Code with Claude Opus 4.7、Codex with GPT-5.5、Gemini CLI with Gemini 3.1 Pro,均采用高推理级别与默认系统提示词。
    • 数据集与规模:职场招聘歧视(594 数据点,29 特征)、欧洲生育率(931 数据点,46 特征)、生成式 AI 动机损耗(3562 数据点,373 特征)、交通执法种族差异(4310165 数据点,22 特征)、自动驾驶安全(33862 数据点,187 特征)。
    • 基线与实验条件:90 个实验条件(3 智能体 × 5 议题 × 2 攻击目标 × 3 提示词),每条件独立重复 5 次,基线共 450 次运行;防御评测设 3 条件(Baseline、Scientist Persona、Provenance Audit)共 450 次运行。
    • 主要指标:No success、Partial success、Full success、Any success;管道阶段包括 Found、Retrieved、Used、Statistics、Conclusion;检测结果分为 Not detected、Partial、Detected、N/A。
    • 评审方式:使用 Claude Sonnet 4.6 运行在 Claude Code 下作为 LLM 裁判对结果打分;在 10% 随机样本(45 次运行)上与人工评估一致性达 Cohen's κ = 0.802(防御实验为 0.758)。
    • 统计方法:报告 95% Wilson 分数区间;比例差采用 Newcombe 置信区间;频数对比采用带 Yates 连续性校正的卡方检验。

    主结果

    表格较宽,可左右滑动

    被测智能体 (Target)检索率 (Retrieved)完全成功率 (Full success)任意成功率 (Any success)投毒检测率 (Detection)样本量 (n)
    Gemini CLI with Gemini 3.1 Pro未报告62.0% [54.02, 69.38]未报告2.0% [0.68, 5.71]150
    Claude Code with Claude Opus 4.7未报告55.33% [47.34, 63.06]未报告4.67% [2.28, 9.32]150
    Codex with GPT-5.5未报告31.33% [24.45, 39.14]未报告11.33% [7.20, 17.40]150
    全模型汇总 (Pooled)84.22% [80.57, 87.30]49.56% [44.96, 54.16]59.33% [54.73, 63.77]6.0% [4.16, 8.59]450
    • 攻击成功率高且与目标方向无关:作者称,全运行中投毒数据检索率为 84.22%,完全成功率达 49.56%;且 Exaggerate 目标(58.22% Any success)与 Reject 目标(60.44% Any success)在统计上无显著差异(p = 0.70),表明攻击者可诱导任意预设结论(Section 4.1)。
    • 模型与议题脆弱性存在差异:作者称,Gemini 展现出最高完全成功率(62.0%),其次为 Claude(55.33%)和 Codex(31.33%);议题间完全成功率差距达 33.33%,在缺乏强先验的 GenAI Motivation 上最高(68.89%),而在强调方法学怀疑的 AV Safety 上最低(35.56%)(Section 4.2)。
    • 自发检测极其罕见且多归因于方法失误:作者称,基线提示词下整体检测率仅 6.0%,且 85.19% 属于部分检测(归因为方法或报告错误而非蓄意投毒);更严苛的 Critical 提示词虽降低了结论污染率,但主要是因检索未发生而非识别出了投毒(Section 4.3)。

    管道传播与非检索效应分析

    • 测了什么:追踪投毒数据在科研管道 5 个阶段(Found → Retrieved → Used → Statistics → Conclusion)的流失与留存(Figure 4,Section 4.1)。
    • 实验结果:检索率随提示词批判性增加从 Minimal 的 90.67% 降至 Critical 的 76.67%;生成投毒结论比例从 Minimal 的 61.33% 降至 Critical 的 26.67%。
    • 作者解读:作者称,提示词带来的抗性主要源于未能检索到数据(搜索词过简被海量结果掩盖,或过繁限制了搜索空间),而非主动识别投毒;一旦数据被检索,往往会一路贯穿至最终结论。

    防御策略评测:角色设定与数据来源审计

    • 测了什么:在 450 次实验中对比 Baseline、Scientist Persona、Provenance Audit 三种防御条件下的攻击成功率与检测率(Figure 6, 7, 8,Section 5.3, 5.4)。
    • 实验结果:Scientist Persona 下 Full success 降至 16.67%(Any success 55.33%),检测率升至 30.67%;Provenance Audit 下 Full success 降至 0.0%(Any success 8.67%),检测率升至 77.33%,投毒数据使用率降至 40.0%。
    • 作者解读:作者称,科学家角色设定仅抑制了结论输出但仍使用污染数据分析,而数据来源审计能在检索后阻止数据被使用,将完全攻击成功率消除至零;多智能体集成检测在 Baseline、Persona 和 Audit 下可分别提升 12.0%、41.33% 和 18.67% 的检测率。

    来源审计子任务预测能力分析

    • 测了什么:通过混合效应逻辑回归分析数据来源审计中 5 个子任务对高风险判定的预测能力(Section 5.5)。
    • 实验结果:跨数据集一致性(OR ≈ 648, p ≈ 0)和统计异常检查(OR ≈ 145, p ≈ 0)预测信号最强,其次为论文引用验证(OR ≈ 33, p ≈ 0)与社交信誉标记(OR ≈ 30, p = 10^-3),投毒警示未成为高风险的主要预测因子。
    • 作者解读:作者称,投毒警示主要起到了引导智能体将操纵作为潜在风险源的启动作用,而跨数据集比对与统计异常是识别投毒的最有效依据。

    其他消融与分析

    • 控制检索到的替代未投毒数据集比例后,议题对攻击成功率的影响保持统计显著(LR = 47.81, df = 4, p ≪ 0.05, Section 4.2)。
    • 基于检索成功子集的投毒检测率与全集基本一致,为 7.12%(全集为 6.0%, Section 4.3)。
    • 提示词类型的检测率分别为 Minimal 3.33%、Targeted 8.67%、Critical 6.0%(χ²_2 = 3.78, p = 0.15, Section 4.3)。
    • 防御实验中模型对投毒主题存在交互效应,Claude 在 GenAI Motivation 表现最优(Full detection 63.33%),Codex 在 Hiring 最优(56.67%)(Section 5.3)。
    • 跨智能体检测一致性在 Baseline 为 Fleiss κ = +0.09,Scientist Persona 下为 κ = -0.13,Provenance Audit 下为 κ = +0.16(Section 5.4)。
    • 数据来源审计在正规数据集上产生 3 例误拒,误报率为 2.0%(Section 6.1)。
  5. 有什么可以进一步探索的点?

    作者指出了议题局限在社会技术领域、仅测试表格数据、依赖私有API包装器及审计存在误报等局限。

    作者指出的局限与后续方向

    • 测试议题局限于社会技术领域:作者指出所有五个测试议题均属社会技术领域,缺乏广泛的社会或科学共识,可能更易于被操纵;而自然科学或医学领域具有更强的真理先验,但由于需要高度专业知识,针对其设计的投毒可能同样难以被检测(Section 6.1)。
    • 数据形式均为表格数据:作者指出实验中的数据集均为表格形式,未涉及现代深度学习常依赖的非结构化数据集(如文本语料库或图像数据库),操纵非结构化数据可能更难但也更隐蔽(Section 6.1)。
    • 依赖私有仓库与自制 API 包装器:为避免在公开网络扩散虚假数据,作者将数据集托管在私有仓库并使用自制 API 包装器,这可能对智能体检索成功率引入潜在混淆因素,尽管 trace logs 显示智能体在每次运行中均搜索了所有四个平台(Section 6.1)。
    • 防御仅在提示词层面对抗单一威胁模型:作者提出的防御仅作用于提示词层面且针对特定威胁模型,未探索更激进威胁模型(如多路并行攻击)下的模型内部机制调整或系统级防护套件(Section 6.1)。
    • 数据来源审计存在 2.0% 误报率:数据来源审计在 3 个案例中建议不要使用真实存在的数据集(误报率 2.0%),源于正规数据中存在的真实统计异常以及智能体聚合五项检查时的决策逻辑,作者指出需要更好的评分聚合机制(Section 6.1)。
    • 评估依赖 LLM 裁判:实验结果采用 Claude Sonnet 4.6 进行 LLM-as-a-judge 评估,尽管 10% 样本上的人工复核显示出强一致性(κ ≥ 0.758),但仍可能引入标注偏差(Section 6.1)。

    实验覆盖范围

    • 被测智能体包含 Claude Code(Claude Opus 4.7)、Codex(GPT-5.5)、Gemini CLI(Gemini 3.1 Pro)共 3 款前沿系统,均在隔离容器环境中赋予免授权编程与网络访问权限。
    • 攻击覆盖 5 个社会技术议题,每个议题分别测试反向拒绝与正向夸大 2 种攻击目标,提示词设 Minimal、Targeted、Critical 共 3 种梯度,每种条件独立重复 5 次(基线共 450 次运行)。
    • 投毒数据托管平台涵盖 GitHub、HuggingFace、OSF、Kaggle 共 4 个公开数据平台,通过统一 API 包装器进行检索。
    • 防御评估覆盖 Baseline、Scientist Persona、Provenance Audit 共 3 种提示层防御条件,同样在 5 个议题与 3 款智能体上完成 450 次独立运行。
    • 论文未报告智能体在完全真实公开互联网环境中未经 API 包装器拦截时的实际端到端投毒成功率。
  6. 总结一下论文的主要内容

    论文展示了间接数据投毒可诱导科研智能体得出预设结论,而五项数据来源审计能将完全攻击成功率消除至零。
    • 论文定位:论文针对自主科研 AI 智能体提出并评估了一种黑盒攻击范式——间接数据投毒(indirect data poisoning)。
    • 核心问题:探讨远程攻击者能否利用开放数据生态及科研智能体的检索能力,在不接触模型内部与用户提示词的情况下,篡改公开数据集以操纵诚实科学家的端到端研究结论。
    • 方法要点:基于 5 个社会技术议题,通过插入虚假样本、插补数值与编写误导性元数据等手段篡改数据并部署至私有平台 API;评估了 3 款前沿科研智能体在不同提示词下的表现,并提出科学家角色设定与包含五项检查的数据来源审计防御。
    • 主要实验发现:
      1. 在 450 次基线运行中,智能体检索被投毒数据的比例达 84.22%,在无任何察觉或警告的情况下得出篡改结论(Full success)的比例达 49.56%,而检测率仅为 6.0%(Section 4.1, 4.3)。
      2. 拒绝假设与夸大假设两种相反攻击目标的成功率在统计上无显著差异(58.22% 对 60.44%, p = 0.70),表明攻击者可任意操纵结论方向(Section 4.1)。
      3. 各智能体脆弱性不同,Gemini 的完全成功率最高(62.0%),其次为 Claude(55.33%)和 Codex(31.33%);且批判性提示词主要通过降低数据检索率而非增强识别来降低成功率(Section 4.1, 4.2)。
      4. 五项数据来源审计将完全攻击成功率降至 0.0%,检测率提升至 77.33%,其中跨数据集一致性(OR ≈ 648)和统计异常(OR ≈ 145)是最强预测指标(Section 5.4, 5.5)。
    • 作者结论与启示:作者认为间接数据投毒可能使学术造假规模化,诚实科学家面临沦为虚假研究无偿传播者的风险;作者呼吁科研界建立针对 AI 的原生信任基础设施,包括可验证的数据集来源凭证、严格的平台元数据与统计追踪,以及智能体检索阶段的自动化审计。
阅读原文arxiv.org