跳到正文
原文
论文追踪· arXiv:2608.03844· Jiaming Chen, Yisen Gao, Yanping Li, Zifan Liu, Yumeng Zhang, Jun Zhang·本站收录 · 原文发表

MAFIA:针对带审计 LLM Agent 的查询式记忆投毒攻击

MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

MAFIA以探测放置与事实伪装攻击带审计的RAG智能体,eICU上审计后Post-ASR为90.74%。

威胁模型query-only普通用户经正常接口提交查询,仅观察回复中的历史question字段,不能读写记忆库或看top-K与检索分数。

问题
记忆增强LLM智能体把经验写入外部记忆,恶意记录可在后续会话中被检索并改写行为。生产系统还有输入审计,且记忆规模大、写入持久。已有query-only攻击在这两项约束下难以同时保住检索优势并躲过语义检查。
方法
MAFIA先用公开领域schema合成探测查询,从回复中收集浮现的历史问题并聚类,再按簇大小轮转分配有限预算,由小簇到大簇注入。载荷把实体替换写成紧凑的声明式事实注释,而不是显式指令。
实验与结果
eICU上MAFIA审计后Post-ASR为90.74%,DR为7.40%;MINJA则为83.30%与0.00%(Table 1)。四设置里MAFIA的Post-ASR均更高。FPR为0时对MAFIA检出至多3.3%(Table 2)。
局限与可以继续做的
作者指出只评估了按相似度检索并复用示范的RAG记忆,未评估图记忆或分层长期记忆。防御只覆盖写入时输入审计和检索后一致性检查,溯源、访问控制与信息流控制留作后续。实验含四组智能体–数据集与多种审计器、检索器,主骨干为gpt-5.4-mini。
实验设置gpt-5.4-mini、Gemini 等 · EHRAgent、RAP 等 · ISR、ASR 等
威胁模型
query-only普通用户经正常接口提交查询,仅观察回复中的历史question字段,不能读写记忆库或看top-K与检索分数。目标是把受害实体V的后续查询导向目标实体T(item-manipulation)。查询先过LLM输入审计;记忆预置大规模良性记录且写入持久。每对(V,T)攻击预算为b。
被测模型
gpt-5.4-miniGeminiProtectAILlama Guard 3-8BGuardReasoner-1BGuardReasoner-3BGuardReasoner-8BPromptGuard-86M
基准
EHRAgentRAPData InterpreterMIMIC-IIIeICUWebShopHuggingFace HubEHRSQL
指标
ISRASRDRFPRPost-ISRPost-ASRRIR@4
AI 导读研究者提出 MAFIA,一种针对带记忆 LLM Agent 的查询式记忆攻击框架,通过探测与事实注入绕过输入审计。该方法包含两部分:一是通过记忆探测、预算分配和调度保证注入记录在检索中具有竞争力;二是用紧凑的事实性伪装设计载荷,在保持高语义相似度的同时绕过审计。评估显示,MAFIA 的攻击成功率最高达 90.7%,同时将审计检测率从峰值 83.3% 压低到最多 7.4%,暴露出 Agent 记忆系统的安全漏洞。作者称代码将公开。

研究者提出 MAFIA,一种针对带记忆 LLM Agent 的查询式记忆攻击框架,通过探测与事实注入绕过输入审计。该方法包含两部分:一是通过记忆探测、预算分配和调度保证注入记录在检索中具有竞争力;二是用紧凑的事实性伪装设计载荷,在保持高语义相似度的同时绕过审计。评估显示,MAFIA 的攻击成功率最高达 90.7%,同时将审计检测率从峰值 83.3% 压低到最多 7.4%,暴露出 Agent 记忆系统的安全漏洞。作者称代码将公开。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    大规模良性记忆与输入审计下,query-only投毒要同时保住检索并躲过检查。

    在大规模良性记忆与输入审计并存时,query-only记忆投毒如何仍能写入并竞争top-K。

    • 场景:作者称外部记忆支撑长程推理,但被接受的恶意记录会跨会话留存,并在检索后劫持后续行为。生产平台常在执行前用LLM安全分类器拒绝带提示注入线索或其他对抗意图的查询。
    • 现有不足:作者称直接改记忆库假设任意插入,普通用户通常无此权限。MINJA用显式操纵指令并逐步缩短;作者称其易被文本审计标出,且注入记录偏离受害查询邻域,良性记忆增多后难以保住top-K。Figure 1(a)中MAFIA的DR为0.0%与3.3%,MINJA为68.9%与67.8%。
    • 作者的观察:持久性使通过审计的毒化记录可反复作为示范;规模使良性池反映历史查询分布。作者称这两点分别引出紧凑事实载荷与基于探测的预算放置。
    • 本文做法:提出query-only框架MAFIA,包含记忆探测、预算分配、注入调度,以及紧凑事实伪装。
    • 威胁模型:
      • 目标:item-manipulation。指定受害实体V与目标实体T,使后续关于V的良性查询转向与T相关的推理和行动。
      • 访问:query-only普通用户。探测与攻击都走正常接口;只观察回复,探测只用其中浮现的历史question字段。不能直接读写记忆库、查看完整记录或解答、检索分数与内部top-K,也不能改写回复或干扰其他用户。
      • 受害系统:RAG记忆智能体。每条查询先经LLM输入审计;攻击前M已有N条良性记录,实验中N≫b,接受的写入持久保留。
      • 预算:每对(V, T)至多b条攻击查询。作者称无界预算会把审计变成延迟,并消除top-K竞争。
  2. 有哪些相关研究?

    相关工作分记忆增强智能体与记忆投毒;作者把本文放在带审计和大记忆池的query-only设定。

    论文按记忆机制和写权限组织相关工作,并把本文放在同时有输入审计与大规模持久记忆的query-only设定中。

    记忆增强智能体

    • 两类机制:作者援引Hu et al. (2025),将记忆增强LLM智能体分为RAG(Gao et al., 2023)和长期记忆LTM(Xu et al., 2026; Chhikara et al., 2025)。代表性系统把轨迹、反思、自传流或可复用技能存入外部库,再检索为上下文示范(Shinn et al., 2023; Park et al., 2023; Packer et al., 2023; Wang et al., 2023; Shi et al., 2024; Kagaya et al., 2024)。
    • 本文范围:作者称LTM仍缺统一架构和设计共识,因此本文主要讨论RAG式记忆,而不是新兴LTM。

    直接记忆投毒

    • 白盒写入:AgentPoison(Chen et al., 2024)和MemoryGraft(Srivastava and He, 2025)直接向记忆库写入恶意示范或伪造任务记录。作者认为,外部用户没有数据库级权限时,该假设很少适用于已部署系统。
    • query-only:MINJA(Dong et al., 2026)和ER-MIA(Piehl et al., 2026)让智能体自己生成毒化记录。作者称它们针对小规模、无审计记忆和显式载荷,能否躲过审计并赢得top-K并不清楚。
    • 平台特定:Patlan et al. (2025b)讨论Web3智能体的未授权资产转移,Patlan et al. (2025a)讨论网页智能体的客户端记忆操纵。作者称这些分析没有处理通用的检索竞争与输入审计。

    基线与评测数据

    • 基线方法:主实验对照MINJA。双方共用良性记忆池、检索器与投毒写入预算。
    • 基准/数据集:EHRAgent配MIMIC-III与eICU,RAP配WebShop,Data Interpreter配HuggingFace Hub。

    作者称他们首次在大规模良性记忆池与输入审计并存时评估query-only记忆攻击,并用探测放置和事实伪装同时处理检索竞争与语义审计。

  3. 论文如何解决这个问题?

    MAFIA用探测分配注入位置,再用紧凑事实伪装写入,以争取top-K并降低单条审计检出。

    MAFIA把攻击拆成放置和载荷两阶段:先估计良性记忆的查询分布并分配有限预算,再把实体替换写成紧凑的数据事实,而不是显式指令。

    设定与写回条件

    • 智能体循环:查询q从记忆池M取top-K相似记录作为示范,生成推理轨迹Rq;执行后把(q, Rq)写回,并受用户反馈约束。检索与写回和MINJA相同。
    • 两项扩展:每条q先经LLM输入审计,含有害信号或攻击尝试则拒绝。M在攻击前已有N条良性记录,实验中N≫b;被接受的写入持久保留并反复参与检索。
    • 攻击者约束:毒化记录只能来自智能体自己的写回,且查询须先通过审计。每对(V, T)的攻击查询预算为b。附录A给出端到端流程,聚类使用余弦相似度、平均链接和τ=0.96。

    放置:探测、分配与调度

    • 探测:攻击者不能读全局M。MAFIA从公开领域schema合成Kp条种子,按MEXTRA的黑盒抽取设定,请求回复中浮现检索示范的question字段,汇总为D。作者称该交互已在EHRAgent和RAP上由MEXTRA验证;本文也包含有类似可观察回复接口的DataInterpreter。实验中每数据集300次探测,九对共用。
    • 聚类与分配:嵌入D中的问题后做凝聚聚类。簇按规模降序排列,轮转分配直到用完b;每步选取当前簇中尚未使用、最靠近质心的问题作为基模板。作者称这优先覆盖D里支持更强的区域,同时保留跨区域覆盖。
    • 调度:按源簇规模升序注入,先处理较小簇。作者称较小簇的良性竞争较弱,早期记录更可能被检索为示范,并在后续更大簇上强化目标导向生成。作者认为,余弦top-K与顺序无关,因此升序收益来自生成阶段,而不是检索顺序本身。

    载荷:紧凑事实伪装

    • 设计张力:审计规避要求避开祈使或指令式线索;检索竞争要求攻击查询仍靠近受害查询。作者用紧凑事实伪装处理这一张力:短的声明式标注把V到T的替换说成数据事实,而不是显式强迫智能体。
    • 作者给出的机制:标注保持紧凑,使基查询继续主导表面形式和嵌入语义;多条此类记录可落在受害查询邻域并占据top-K。作者称单条审计会把它看成补充注释而非行为指令。正文给出了具体句式,此处不复述。

    审计门与成功判定

    • 写入门:写回前由默认gpt-5.4-mini按与Figure 1相同的注入检测提示筛查,判为INJECTION的记录丢弃。附录B.4给出general与targeted两套提示词。
    • 指标:ISR是写成目标导向记录的攻击查询比例。ASR是不做审计过滤时,留出的干净受害查询引出目标导向回复的比例。DR、FPR分别是攻击实例被标出、良性实例被误标的比例。Post-ISR和Post-ASR是审计过滤后重算的成功率。
    • 谓词:成功指最后代码单元写入目标标识,且受害标识不出现。MIMIC-III/eICU看SUBJECT_ID或patient_id;WebShop看搜索动作中的品牌子串;Data Interpreter看首次模型加载调用的字面参数。ASR阶段记忆冻结,不再写回。
  4. 论文做了哪些实验?

    四组设置上MAFIA审计后Post-ASR高于MINJA,eICU上为90.74%(Table 1)。

    实验设置

    • 智能体与任务:默认骨干均为gpt-5.4-mini,temperature=0,num_shots=4。EHRAgent/MIMIC-III把患者记录查询从V导向T的SUBJECT_ID;EHRAgent/eICU把一种药物换成另一种;RAP/WebShop把某品类购物查询导向指定品牌;Data Interpreter/HuggingFace Hub替换预定的模型依赖。各9对(V, T),目录在附录F。
    • 记忆与检索:MIMIC-III/eICU的良性池为过滤后的5,842条EHRSQL记录;WebShop与Data Interpreter各2,000条。检索器用e5-small-v2、余弦相似度,K=4,WebShop为K=3。
    • 审计与预算:主表DR来自单条gpt-5.4-mini审计(AUDIT-S,只审攻击)。MAFIA与MINJA共用每数据集300次探测,以及相同写入预算:MIMIC-III每对90,其余每对30。
    • 样本量:ISR分母为这90或30条攻击查询。ASR在MIMIC-III上为每对103条干净受害查询,其余设置每对30条。WebShop按品牌级判定。
    • 基线:MINJA。MIMIC-III复现为每对18个基模板×5个版本;eICU/WebShop含m5共6个版本,Data Interpreter为5个版本。
    • 其他骨干:Figure 3在eICU Pair 1上比较四个骨干。正文给出写入ISR 83.3%–96.7%、ASR 56.7%–83.3%,并称Gemini的ASR较低。轴标签在文本转换中拆行,除gpt-5.4-mini和Gemini外,不把片段拼成正文未写明的完整型号。

    主结果

    据Table 1,四个设置各9对的宏平均(单位为百分比)。斜线前为不做审计过滤的ASR,斜线后为Post-ASR。

    表格较宽,可左右滑动

    设置MAFIA ASR / Post-ASRMINJA ASR / Post-ASRMAFIA DRMINJA DR
    EHRAgent / MIMIC-III75.19 / 75.1960.09 / 8.410.0068.40
    EHRAgent / eICU92.59 / 90.7466.30 / 0.007.4083.30
    RAP / WebShop58.52 / 56.668.89 / 0.001.8083.30
    DataInterpreter / HF Hub63.70 / 62.9629.63 / 14.810.0071.85
    • 作者称MAFIA的ISR与MINJA相当,其余指标在四个设置上都更好,并归因于检索感知放置与可规避审计的载荷。ISR有两处相反:eICU上MINJA 82.96、MAFIA 74.44;HF Hub上MINJA 98.15、MAFIA 91.85。
    • 摘要写最高90.7%的攻击成功,并把审计检出从峰值83.3%压到至多7.4%。Table 1中eICU的Post-ASR为90.74,MAFIA的DR最高为7.40,MINJA的DR在eICU和WebShop为83.30。
    • Figure 1(b)在eICU Pair 1上扫描良性记忆规模,每点30条受害查询,全文池为5,842,图中标注+37 pp;各点ASR在文本转换中不可读。Table 16该对ASR为MAFIA 83.33、MINJA 46.67。Figure 1(a)未注明是否为Table 2的Pair 6,两边数字同为0.0/3.3与68.9/67.8。

    审计器与自适应改写

    • 低误报审计:Table 2在MIMIC-III Pair 6上比较审计器,FPR分母为60条不相交良性记录。FPR为0.0的ProtectAI、General Prompt、Targeted Prompt对MAFIA的DR为1.1、0.0、3.3,对MINJA为4.4、68.9、67.8。作者称低误报审计器对MAFIA的检出至多3.3%,General与Targeted标出67.8%–68.9%的MINJA记录。
    • 高误报审计:PromptGuard-86M对两边和良性记录都是100.0。Perplexity Filter的FPR为20.0,MAFIA DR 43.3,高于MINJA的21.1。Llama Guard 3-8B上MAFIA DR 40.0,也高于MINJA的34.4。作者称其余审计器只有在良性误报高时才有更高检出。
    • 自适应测试:附录C.1中,模式正则对已发表形式的DR为100.0,对7类改写(210条)和24条合法合并记录均为0.0。括号感知few-shot判定对改写和合法合并都是100.0。作者称可靠区分可能需要记录文本之外的信号,如溯源或写入授权。

    骨干、检索与分布偏移

    • 骨干:Figure 3的四个骨干上,写入ISR为83.3%–96.7%,ASR为56.7%–83.3%。作者称Gemini的ASR较低,但成功并不限于默认骨干。图中各柱对应哪个型号,文本转换无法逐柱核对。
    • 检索器:Table 3在MIMIC-III Pair 8上,五个编码器设置的RIR@4和Top-1都是MAFIA更高。e5-small-v2的RIR@4为90.29对75.73;all-MiniLM-L6-v2最低,为58.25对30.10。n̄p@4有例外:nomic-embed-text-v1上MAFIA 1.39,MINJA 1.47。
    • 更广范式与偏移:附录C.2的九对宏平均RIR@4中,稠密e5为92.66对75.08;实体预过滤加密集两边都是100.00;Levenshtein为2.80对3.77。作者称纯编辑距离是重定向式投毒的共同边界,并推测对比学习编码器更重视实体token。Table 7同意图最远箱(各30条)MAFIA ASR 66.7、MINJA 33.3;跨主题最远箱两边都是43.3。

    记忆侧防御与案例

    • A-MemGuard:九对MIMIC-III上做检索后一致性检查。正文写检出75.6%的MAFIA毒化出现、FPR 44.9%;Table 9宏平均为DR 75.59、FPR 44.88,MINJA为67.85与43.35。逐对MAFIA的DR为72.17–80.80,FPR为40.96–48.35。作者称该误报排除了将其作为独立防御部署的可能。
    • 案例:附录H的MIMIC-III Pair 1上,60/103条受害查询的余弦top-4里至少三槽是MAFIA记录。该对DR为MAFIA 0.00、MINJA 64.44(Table 16);图注把MINJA写成64.4%。
    • 效用:Table 17的Pair 1中,MAFIA在eICU的Utility Drop为−3.33 pp,其余三设置为0.00 pp。MINJA在MIMIC-III为−30.00 pp,eICU为+6.67 pp,WebShop为+3.33 pp。

    其他消融与分析

    • Table 4(a),MIMIC-III Pair 1:完整流程RIR@4 91.26、n̄p@4 2.26、ASR 73.8;去掉Selection为85.76±2.02、2.10、62.1;两者都去掉为82.52±5.91、1.89、58.3;MINJA为66.99、1.37、47.6。
    • Table 4(b),Pairs 1–3均值:升序注入ISR 92.96、ASR 75.40;降序为82.22、60.19。
    • Table 10,固定90条基记录:紧凑事实伪装的RIR@4为90.29、平均余弦0.932;声明句72.82;等长硬祈使68.93;缩短MINJA 57.28;完整MINJA 33.01。
    • Table 11(a)均值RIR@4:浮现问题96.12,全池oracle 95.47,均匀抽样93.85,错误区域67.31。
    • Table 11(b),均衡集/频率加权集:按规模排序96.12/93.34,均匀分配91.59/87.12,逆序87.70/80.35。
    • Table 8,MIMIC-III Pair 1:匹配schema的RIR@4为90.29;WebShop极端分布外为0.97。
  5. 有什么可以进一步探索的点?

    作者指出未评估非RAG记忆架构,以及溯源、访问控制与信息流等系统级防御。

    作者指出的局限与后续方向

    • 记忆架构:只评估按相似度检索、并把记忆当作示范复用的RAG智能体,没有评估图记忆或分层记忆等更广的长期记忆架构。作者称扩展需要特定于架构的威胁模型与攻击表述,留作后续(Limitations)。
    • 系统级防御:防御评估覆盖写入时输入审计和检索后一致性检查,检索分析包含实体感知检索;没有评估基于溯源的强制、访问控制与信息流控制。作者称这需要修改记忆架构、权限模型与执行管线,并需要带部署特定授权和溯源假设的威胁模型,留作后续(Limitations)。
    • 同一后续方向:作者在发布与误用讨论中,也把溯源强制和信息流控制等更广防御框架标为后续工作(Release and misuse considerations)。

    实验覆盖范围

    • 主实验为EHRAgent/MIMIC-III、EHRAgent/eICU、RAP/WebShop、DataInterpreter/HuggingFace Hub,各9对(V, T),骨干gpt-5.4-mini,temperature=0(§5.1、Table 1)。
    • Figure 3在eICU Pair 1上报四个骨干的ISR与ASR;正文点名Gemini的ASR较低,并给出83.3%–96.7%与56.7%–83.3%。
    • 写入预算为MIMIC-III每对90、其余每对30;每数据集300次探测供九对共用。ASR分母为MIMIC-III每对103条,其余每对30条(§5.1、Appendix B)。
    • 防御结果来自默认单条gpt-5.4-mini审计、Table 2的分类器(MIMIC-III Pair 6,良性FPR分母60)以及九对MIMIC-III上的A-MemGuard(§5.4、Appendix D)。
    • 论文未报告Table 1的重复次数。检索比较写明了Table 3的五个编码器设置(Pair 8)和附录C.2的词法、实体感知、混合与编辑距离设置。
  6. 总结一下论文的主要内容

    MAFIA在审计与稠密良性记忆下投毒RAG记忆,eICU审计后Post-ASR为90.74%。

    作者提出MAFIA,在输入审计和大规模持久记忆下,对RAG智能体做query-only记忆投毒。

    • 问题:攻击者只能发查询。毒化记录必须先通过LLM审计,再由智能体写回,并在预置的大规模良性记录中进入top-K,后续关于受害实体V的查询才会转向目标实体T。
    • 做法:探测回复中浮现的历史问题,按簇规模分配有限预算并先注入小簇;载荷用紧凑声明把替换写成数据事实,而不是祈使指令。
    • 主结果:Table 1中MAFIA的审计后Post-ASR在四个设置为75.19%、90.74%、56.66%和62.96%,MINJA为8.41%、0.00%、0.00%和14.81%。MAFIA单条DR为0.00%、7.40%、1.80%和0.00%。摘要的90.7%与至多7.4%对应表中eICU的90.74%与7.40%;MINJA的DR在表中有两处为83.30%。
    • 例外:eICU与HF Hub上MINJA的ISR更高,分别为82.96%对74.44%、98.15%对91.85%。FPR为0的审计器对MAFIA检出至多3.3%(Table 2,Pair 6);检出更高的审计器同时有高良性误报。A-MemGuard的宏平均DR为75.59%,FPR为44.88%(Table 9)。
    • 作者的结论:作者称这暴露了RAG智能体记忆的漏洞。作者还称,记录级提示审计不应被单独当作长期记忆的充分防御,并建议加上写入隔离、溯源跟踪和检索后核验。
阅读原文arxiv.org