MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露
MemLeak
作者评估多租户智能体共享向量记忆,在同团队池化检索下MiniLM跨用户泄漏率达70%,硬门控可阻断。
在多租户智能体共享向量存储中,攻击者分为被动无意图用户与主动利用攻击者Mallory。
- 多租户个人AI智能体通常共享后端向量存储且仅依赖软元数据过滤。共享嵌入空间导致不同用户的记忆仅凭语义相近就被检索并注入上下文,破坏多租户数据隔离。
- 将跨用户语义泄漏形式化为可采纳性失效,构建四级组织距离合成基准,评估被动泄漏与仅凭角色常识的主动桥接攻击,并测试元数据过滤、嵌入修改及检索后门控三项防御。
- MiniLM同团队池化检索泄漏率达70%(Table 3);主动构造记忆达到90–100%命中率(Table 2);检索生成使下游污染达5.00/5(Table 5);硬所有权门控以1.4 ms延迟消除污染(Table 14)。
- 实验基于4对人工合成用户和每条件10次查询的小样本,未覆盖生产日志;下游评估存在自评审偏差;信道实验显示多位顺序传输失败;未实证测试LLM记忆筛选机制。
- 威胁模型
- 在多租户智能体共享向量存储中,攻击者分为被动无意图用户与主动利用攻击者Mallory。Mallory仅知晓受害者业务角色与领域,通过正常对话存入构造记忆,诱导相似度检索将其注入受害者top-k上下文以影响决策;受害系统为采用池化存储或扩大协作范围的多租户个人智能体。
- 模型
- Gemini 2.5 FlashClaude Sonnet 4.5all-MiniLM-L6-v2bge-large-en-v1.5text-embed-3-small
- 基准
- Synthetic cross-user memory fixtures (T0-T3)Salary negotiationSecurity policyHR / PIP decisionsBudget authority
- 指标
- LRMCRScore GapTop-k PlacementScore LiftContam. ScoreHelpfulnessXLRResonance IndexBER
Workday AI Research 的 MemLeak 研究指出,企业多租户个人 Agent 若共享同一向量记忆库,普通余弦相似度检索即可把其他用户的记忆拉入当前会话,无需任何漏洞利用。在池化同团队检索下,非对抗性泄露率达 70–100%;精心构造的记忆在 top-k 中占比 90–100%,生产级稠密检索下得分提升 +0.416 至 +0.511;端到端响应污染最高达 5.00/5,且被污染的回答常被评为同样或更有帮助。研究测试了三种缓解方案,只有检索后硬性归属门控能在两个生成模型上把污染恢复到 1.00/5 的干净基线,每次查询延迟开销约 1.4 ms。作者强调这是受控概念验证,样本为每条件 10 条查询,不代表真实企业泄露率。
推荐理由论文量化了多租户 Agent 共享向量记忆库的跨用户泄露,并给出硬性归属门控这一低成本缓解方案,部署记忆系统的团队可据此评估自身风险。
深度解读
这篇论文试图解决什么问题?
论文研究多租户智能体共享向量存储时,嵌入空间语义相近导致跨用户私密记忆被意外检索并注入上下文的泄漏问题。
多租户 AI 智能体共享向量记忆库时,单纯依赖嵌入空间余弦相似度检索会导致跨用户敏感记忆泄漏。
- 场景与重要性:企业级个人 AI 智能体通常依赖共享后端向量存储实现跨会话长期记忆(如 Mem0、A-Mem、MemOS)。在缺乏物理隔离或基于元数据的软过滤下,或者在团队共享协作空间中,用户记忆存在交叉检索风险。
- 现有研究的不足:作者指出,以往针对智能体记忆可信性的研究(如 Tan 等人、Wu 等人)均将记忆限制在单用户信任边界内,仅关注单用户上下文下的跨领域泄漏、阿谀奉承或提示词越狱,未检验多用户间的跨租户泄漏。
- 核心观察:作者提出用户间语义共振(inter-user semantic resonance)现象,即仅凭嵌入向量空间的距离接近,即可将其他用户的私密记忆拉入当前用户的会话,无需提示注入、恶意代码或修改模型权重。
- 论文的提出:论文将该现象形式化为跨用户可采纳性失效(cross-user admissibility failure),定义了泄漏指标并系统评估了被动泄漏、主动利用及三项架构防御措施。
- 威胁模型:
- 攻击者目标:在被动场景下无对抗意图;在主动利用场景下,攻击者(Mallory)旨在通过构造记忆使其进入目标受害者(Bob)的检索前 k 项,从而影响 Bob 智能体的推荐、决策或工具调用。
- 攻击者知识:Mallory 仅了解受害者的通用业务领域和角色(例如 Bob 负责预算审批),不知晓 Bob 的具体查询语句、输入流,也不了解嵌入模型的内部参数。
- 攻击者能力:Mallory 仅能通过正常对话交互向共享存储中写入自身记忆,不能修改模型权重、提示词模板或系统代码。
- 受害系统:采用共享向量存储且仅依赖元数据软过滤、具有团队协作检索范围或企业特定工作流(如 HR、财务)的多租户个人智能体系统。
有哪些相关研究?
梳理了智能体记忆架构、单用户记忆安全、RAG攻击与嵌入隐私研究,指出现有工作未覆盖多租户下非攻击性语义泄漏。
论文在相关工作中梳理了以下几类研究:
智能体记忆架构与企业级实现
- 层次化记忆管理:MemGPT(Packer 等人,2023)与 Generative Agents(Park 等人,2023)提出了基于分层记忆管理的持久化召回机制,使智能体具备多轮交互长期记忆能力。
- 多会话多租户存储系统:Mem0(Chhikara 等人,2025)、A-Mem(Xu 等人,2025)和 MemOS(Li 等人,2025)将记忆扩展到多会话与多租户部署,通常依赖共享向量库并通过余弦相似度检索候选记忆。
智能体记忆可信性与单用户边界
- 单用户信任边界评估:Tan 等人(2025,MemBench)、Wu 等人(2025,LongMemEval)、Pulipaka 等人(2026,PersistBench)和 Guo 等人(2026)探讨了记忆增强智能体的安全性,包括记忆遗忘、工具调用漂移、阿谀奉承及个性化风险。作者指出,这些工作均将记忆视作单用户信任边界,未检验 Alice 的记忆流入 Bob 会话的多用户场景。
RAG 攻击与向量隐私泄露
- 知识污染与注入攻击:PoisonedRAG(Zou 等人,2025)、Phantom(Chaudhari 等人,2024)和 Shafran 等人(2025)针对检索语料库实施投毒,间接提示注入(Greshake 等人,2023;Perez 和 Ribeiro,2022)在检索内容中嵌入恶意指令。作者指出,语义共振不需要恶意指令,检索到的私密记忆仅因其出现在受害者上下文中即可构成隐私侵犯。
- 嵌入表示的隐私泄漏:Morris 等人(2023)报告文本嵌入向量能还原出接近原始文本的内容;Feyisetan 等人(2020)提出在嵌入中添加校准噪声以保护隐私,这启发了本文评估的 M2 防御方案。
- 隐蔽通道理论:Lampson(1973)、Denning(1976)以及 Myers 和 Liskov(1997)形式化了共享资源中的隐蔽通道概念,本文将其用于界定主动利用的信道容量评估。
基线方法与基准设置
- 对比基线:论文将严格用户分区(strict user partitioning / ACL baseline)作为访问控制基线(检索隔离为 0% 跨用户泄漏);在检索配置上对比了基于 TF-IDF 和截断 SVD 的稀疏检索基线(Config A)与基于 all-MiniLM-L6-v2 的密集检索(Config B);在主动攻击中对比了有机无知识基线(organic baseline)、领域关键词词袋(domain keyword bag)、逐查询关键词(per-query keywords)及逐字复制上限(verbatim copy oracle)。
- 评测基准:论文构建了包含薪酬谈判、安全策略、绩效考评(HR/PIP)、预算审批 4 个垂直场景的合成基准套件,设置 T0 至 T3 共 4 级组织距离用户对。
作者定位本文与既有工作的区别在于:指出并系统形式化了多租户智能体共享嵌入空间下的跨用户语义共振威胁,指出即使无提示注入或系统入侵,相似度检索机制本身也会导致跨用户隐私泄漏。
论文如何解决这个问题?
形式化跨用户可采纳性失效,构建四层级组织距离数据集,对比被动与主动桥接攻击,并设计存储、嵌入与检索后三层防御。
作者提出了 MemLeak 分析框架,系统形式化了跨用户记忆泄漏问题,构建了跨组织距离的基准测试集,并设计了三项架构缓解措施。
问题形式化与泄漏定义
系统包含 N 个用户 {U1, …, UN},每位用户 Ui 维护记忆库 Mi = {m1, …, mk},向量映射为 vm ∈ ℝd。用户 Ui 发起查询 xq 并嵌入为 q。
- 跨用户可采纳性失效:定义指示函数 A(m, xq, Ui) ∈ {0, 1},当且仅当记忆 m 属于 Ui 且在语境上适合查询 xq 时 A = 1;若所有者为 Uj ≠ Ui,则无论语义相似度多高,定义 A(m, xq, Ui) = 0。跨用户泄漏事件定义为:
rank(S(q, vm)) ≤ k ∧ owner(m) ≠ Ui 该式表示在余弦相似度 S(q, vm) 排序的前 k 项中存在不属于当前用户的记忆。
- 泄漏概率:定义用户对 (Ui, Uj) 的泄漏概率为:
L(Ui, Uj) = 𝔼[1{cross-user retrieval} ∣ q ∼ Ui] 该式表示当前用户发出查询时发生跨用户检索的期望概率。
数据构建与测试场景
评测集包含 4 个组织距离层级的合成用户对,每个用户持有 10 条私密专业记忆,目标用户持有 10 条领域查询,跨 4 个业务类别保持一致以剥离内容变化影响:
- 组织距离层级:同团队 T0(Alice 工程师与 Bob 工程主管)、同部门 T1(Carol 与 Dave)、跨部门 T2(Eve 与 Grace)、跨公司对照组 T3(Heidi 与 Ivan)。
- 业务场景划分:薪酬谈判(涉及薪资基准与股权细节)、安全策略(涉及漏洞细节)、绩效/HR 改进计划(涉及重组问题)、预算审批(涉及采购与审批额度)。所有记忆与查询均为人工编写的固定自然语言夹具。
攻击变体与主动构建机制
论文区分了被动泄漏与主动利用:
- 被动泄漏:用户正常交互,由于词汇重叠和组织角色接近而自然发生跨用户记忆检索。
- 主动利用(Crafted Bridging):攻击者 Mallory 仅掌握受害者的通用职责与领域(如负责预算审批),通过构造围绕目标主题/语境展开但未抄袭具体查询文本的记忆,促使其进入受害者的 top-k 检索池。
- 基线知识梯度:设置有机基线(无查询知识)、领域关键词词袋、逐查询关键词、主动桥接(本文方法)以及直接逐字抄袭查询的理想上限(oracle)。
缓解方案设计
作者在系统不同拦截点设计并评估了三项缓解方案(Figure 1):
- M1:元数据过滤(Metadata Filtering):在向量库层面依据 user_id 元数据实施过滤或严格分区。
- M2:所有权感知嵌入(Ownership-Aware Embeddings):测试两种代理方案——前缀注入(在记忆和查询嵌入前添加用户标识 token)与命名空间偏移(为每个用户的嵌入向量添加固定偏移量,并在检索时减去查询用户的偏移)。
- M3:后检索所有权门控(Post-Retrieval Ownership Gating):在向量库返回检索结果后,执行确定性所有权门控(剔除所有权不等于当前用户的记忆)或可疑度门控(剔除相似度超过设定阈值的跨用户命中项)。
论文做了哪些实验?
在 4 级组织距离和 3 个场景下评测表明,池化检索引发 70–100% 泄漏与污染,硬门控可无损复原但增加 1.4 ms 延迟。
实验设置
- 被测模型:生成与评审模型采用 Gemini 2.5 Flash 和 Claude Sonnet 4.5(temperature = 0)。嵌入模型评估了 all-MiniLM-L6-v2(Config B,384 维)与 TF-IDF 截断 SVD(Config A,128 维),扩展点检评估了 bge-large-en-v1.5(1024 维)与 text-embed-3-small(1536 维)。
- 数据集与规模:构建了 4 对合成用户(T0 同团队、T1 同部门、T2 跨部门、T3 跨公司对照),每位用户包含 10 条私密记忆与 10 条专业查询;下游生成评估使用薪酬谈判、安全策略与 HR 改进计划 3 个场景。
- 基线方法:包含分区检索 ACL 基线、有机未修改基线、领域关键词词袋基线、逐查询关键词基线与逐字复制上限。
- 指标定义:跨用户泄漏率 LR(top-k 中包含≥1 条跨用户记忆的查询比例)、平均跨用户排名 MCR、分数差距 Gap、质心相似度 Centroid Sim、攻击命中率 Pl.%、分数增益 Lift、回答污染度(1–5 分)与有用性(1–5 分)。
- 评审方式:采用生成模型自身作为评审(LLM-as-judge),依据 1–5 分锚定准则评估回答污染度与有用性;并在 9 个样本上进行人工一致性检验。
- 样本量与重复次数:各层级检索实验样本量均为 n = 10 次查询,计算 95% Wilson 置信区间;延迟评测在 10,000 条记忆的 pgvector 索引上运行 1,000 次循环。
主结果
表格较宽,可左右滑动
层级 MiniLM 泄漏率 (LR_B) MiniLM 质心相似度 (Sim_B) TF-IDF 泄漏率 (LRA) TF-IDF 质心相似度 (Sim_A) T0: 同团队 (A/B) 70% [40%, 89%] 0.570 100% [72%, 100%] 0.075 T1: 同部门 (C/D) 90% [60%, 98%] 0.379 90% [60%, 98%] 0.044 T2: 跨部门 (E/G) 90% [60%, 98%] 0.488 100% [72%, 100%] 0.068 T3: 跨公司 (H/I) 10% [2%, 40%] 0.284 50% [24%, 76%] 0.035 (据 Table 3)
- 跨公司对照差异:作者指出,跨公司对照组 T3 在 Config B 下泄漏率降至 10%,与池化检索的 T0–T2(70–90%)形成对比,表明跨公司上下文能降低偶然泄漏。
- 质心相似度非可靠指标:作者指出,T0 质心相似度最高(0.570),但名义泄漏率(70%)低于 T1 和 T2(90%);在 n = 10 样本量下置信区间重叠,质心相似度无法作为细粒度泄漏风险的预测指标。
- 稀疏检索解耦现象:在 Config A 稀疏检索下,质心相似度普遍较低(0.035–0.075),但泄漏率仍达到 50–100%,作者指出这说明全局质心距离与查询级词汇重叠存在解耦。
主动利用与攻击者知识消融(E3 与 E3b)
- 测了什么:在薪酬、安全、预算 3 个场景下测试主动构造记忆的 top-k 命中率及分数增益,并在薪酬场景下对比 5 级攻击者知识梯度。
- 结果:构造记忆在 Config A 和 Config B 下均达到 90–100% 的 top-k 命中率,在 Config B 下相较有机基线的平均分数增益为 +0.416 至 +0.511(Table 2)。在 Config B 薪酬场景下,命中率随攻击者知识递增:有机基线 10% [2%, 40%] → 领域关键词词袋 40% [17%, 69%](增益 +0.182)→ 逐查询关键词 80% [49%, 94%](增益 +0.345)→ 本文主动桥接 90% [60%, 98%](增益 +0.416)→ 逐字复制上限 100% [72%, 100%](增益 +0.488)(Table 10)。
- 作者的解读:作者指出,攻击者仅需掌握领域与角色常识进行主题构陷,即可逼近逐字抄袭上限,无需查询级或模型内部参数知识。
下游生成污染与人工评测校验(E4 与 E0)
- 测了什么:在静态注入与检索生成两条路径下评估生成回答的污染度与有用性,并在 9 个合成样本上开展两名作者的人工打分校验。
- 结果:干净基线污染度均为 1.00,泄露记忆使污染度升至 2.67–5.00;Gemini 2.5 Flash 在检索路径下污染度达到 5.00/5(增幅 +4.00),有用性亦为 5.00/5;Claude Sonnet 4.5 在两条路径下污染度均为 4.67/5(Table 5)。人工与模型评审在干净对照上完全一致(kappa=1.00,MAE=0.00),整体 MAE 为 0.79,在安全场景下评审模型将未修补漏洞细节误判为通用建议,导致单次分歧(人类打分 5.0,评审模型打分 1.0,MAE=1.33)(Table 11)。
- 作者的解读:作者指出,泄露记忆往往包含具体业务细节,使得受污染回答常被评为同等或更有用;评审模型漏判属于保守低估,所报告的污染度应视为真实泄漏程度的保守下界。
防御方案与检索延迟权衡(M1、M2 与 M3)
- 测了什么:评估元数据过滤(M1)、所有权感知嵌入(M2)及检索后所有权门控(M3)的防御表现,并测量在 pgvector HNSW 索引上的延迟。
- 结果:当攻击者属于被授权团队作用域(scoped_cross)时,M1 元数据过滤失效,攻击者命中率达 90–100%(Table 6);M2 前缀注入使 T0 泄漏率从 70% 降至 50%,但命名空间偏移使 T0–T2 泄漏率反弹至 100%(Table 13);M3 硬所有权门控(HO)在两款模型与两条路径下均将攻击者命中率降至 0%、污染度恢复至干净基线 1.00/5(Table 7、Table 8);M3 带来的平均延迟开销约为 +1.4 ms(Table 14)。
- 作者的解读:作者指出,元数据过滤在攻击者属于合法共享范围时失效,而后检索硬所有权门控是以微小工程延迟恢复基线隔离的有效手段。
其他消融与分析
- 隐蔽信道容量测试(E6):8 位有效载荷传输中,第 1–2 位误码率为 0%,第 3–4 位上升至 50%,第 5–8 位达 100%,显示多位顺序传输失败(Table 12)。
- 嵌入模型维度扩展(附录 K):在 T0 组上,384 维 MiniLM 泄漏率为 70%,1024 维 bge-large-en-v1.5 为 80%,1536 维 text-embed-3-small 为 70%,泄漏率未随维度增加而降低(Table 15)。
- 隐私-效用边界(E5):T2 跨部门共振指数为 0.549,同自身记忆的分数差距为 +0.302;T3 跨公司共振指数处于低位(0.162),自身效用最高(0.507)(Table 4)。
- 可疑度软门控对比(M3):基于相似度阈值的可疑度门控仍允许 30–40% 的攻击者记忆进入 top-k,平均命中率为 33%,无法完全阻断主动攻击(Table 7)。
- 预算权限场景有机命中异常:在 Config A 下预算场景未构造时有机命中率即达 70%,作者指出这是由于采购审批词汇在跨角色间高频共用所致(Section 4.4,Table 10)。
有什么可以进一步探索的点?
作者指出了小样本合成数据、自评审偏差及信道编码不足等局限;实验主要覆盖两款生成模型及四对合成用户。
作者指出的局限与后续方向
- 样本规模与统计精度:所有泄漏率、命中率和污染率均基于小样本计算(每个用户对与层级 n = 10 次查询,下游生成仅 3 个场景),95% Wilson 置信区间较宽,细粒度排序存在重叠,不能作为真实企业部署的总体普及率估计(Section 5,附录 A)。
- 合成数据代表性:记忆与查询均为人工编写的固定自然语言夹具,而非来自生产日志或真实用户数据,未验证其与真实企业记忆分布及词汇重叠模式的一致性(Section 5,附录 A)。
- 评估偏差与自评审:E4 和 M3 中的下游污染度与有用性由生成模型自身进行评分(self-judging),存在评估偏差;人工一致性检验仅覆盖 9 个样本,不足以全面验证评审模型,且未评估跨模型互评(Section 5,附录 A)。
- 模型与基础设施范围:生成与评审仅测试了 Gemini 2.5 Flash 和 Claude Sonnet 4.5 两款模型;嵌入模型维度扩展仅在单层级点检了 3 款模型;检索主要基于内存余弦搜索,仅延迟基准测试在单个过取因子(K=15)下使用了 pgvector/HNSW(Section 5,附录 A)。
- 信道编码与替代机制:E6 顺序多位传输误码率达 100%,构建受控吞吐量的隐蔽信道需要纠错编码方案;且仅测试了嵌入相似度检索,未实证评估基于 LLM 的记忆筛选机制(附录 A)。
实验覆盖范围
- 被测模型范围:生成与评审模型仅覆盖 Gemini 2.5 Flash 和 Claude Sonnet 4.5 共 2 款模型;嵌入模型主实验使用 all-MiniLM-L6-v2,点检覆盖 bge-large-en-v1.5 和 text-embed-3-small。
- 数据集覆盖:仅包含 4 对合成用户角色(T0 至 T3),每位用户包含 10 条固定记忆与 10 条查询,下游生成污染实验仅覆盖薪酬、安全、HR 重组 3 个场景。
- 检索与防御配置:检索候选池固定为 top-k = 3;防御仅评估了元数据过滤、前缀注入、命名空间偏移与后检索门控的原型实现,延迟基准测试仅在 10,000 条记忆的 pgvector 索引上按 K=15 采样 1,000 次查询。
- 论文未报告的信息:论文未测试真实生产环境的多轮对话日志,未报告更大规模独立人类标注员的裁决一致性,未实证评估基于 LLM 筛选记忆的泄漏与提示注入风险。
总结一下论文的主要内容
论文揭示共享向量库导致的跨用户语义泄漏,指出常识构造攻击可达90–100%命中,而硬所有权门控能以低延迟恢复隔离。
- 论文定位:论文研究企业多租户 AI 智能体共享向量记忆库时,由于嵌入空间语义接近而导致的跨用户记忆非对抗性泄漏与主动利用风险。
- 要解决的问题:现有智能体记忆系统通常将用户数据混存在同一向量库中并通过软元数据过滤,作者指出这打破了多租户物理隔离,使得普通余弦相似度检索便可将他人的隐私记忆注入当前用户会话。
- 方法核心:形式化跨用户可采纳性失效,构建覆盖 4 级组织距离(T0–T3)与 4 种敏感业务场景的基准集,对比被动泄漏与基于常识角色构造的主动桥接攻击,并评估多层缓解机制。
- 核心实验结果:
- 在 MiniLM-L6-v2 池化检索下,同团队 T0 被动泄漏率为 70% [40%, 89%],同部门 T1 和跨部门 T2 达 90% [60%, 98%],而跨公司 T3 降至 10% [2%, 40%](Table 3)。
- 主动构造记忆在 MiniLM 下实现 90–100% 的 top-k 命中率,平均检索分数比有机基线提高 +0.416 至 +0.511(Table 2);在薪酬场景下仅需领域常识即达 90% 命中率,逼近逐字抄袭上限的 100%(Table 10)。
- 端到端检索生成导致 Gemini 2.5 Flash 回答污染度升至 5.00/5(满分 5 分,干净基准为 1.00),Claude Sonnet 4.5 达 4.67/5,且受污染回答被判定为同等或更有用(Table 5)。
- 后检索硬所有权门控(M3)将攻击命中率降至 0% 并将两款模型的回答污染度完全恢复至 1.00/5(Table 7、Table 8),平均检索延迟开销仅增加约 1.4 ms(Table 14)。
- 作者结论与启示:作者认为在共享向量库中仅凭语义相似度无法界定数据访问权限,当共享范围扩大至恶意成员时元数据过滤亦会失效;系统设计者必须在向量存储、嵌入及检索后实施分层防御,并联合评估检索架构与下游模型。