研究测量 LLM Agent 记忆投毒防御的良性场景开销
The Price of Safety: Benign-Case Utility and Token Overhead of Memory-Poisoning Defenses in LLM Agents
AI 导读
研究者搭建统一测量装置,在记忆后端、检索流程和评判模型保持一致的前提下,只改变防御本身,评估 LLM Agent 记忆投毒防御在完全良性流量下的效用损失与 token 开销。测试覆盖三种写入时防御(输入清洗、来源检查、基于 LLM 的异常检测)和一种读取时防御(重排序),每种条件在五段对话上重复三次,以区分真实效应与流水线噪声。写入时防御未显示出可分辨的效用损失,95% 置信区间约为正负 4.5 个百分点并包含零。重排序器则使核心准确率下降 4.4 个百分点(95% CI [-9.0,-0.05],bootstrap;McNemar p=0.064),该结果可复现但处于测量分辨率边缘;在无攻击对话中,它隔离了 33.6% 的合法记忆条目,单段对话最多出现 106 次误隔离,token 开销为 2.7%。研究认为,决定防御良性场景代价的是它拦截流水线的位置,而非是否使用 LLM。