FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露
Confuse the Model, Control the Flow: Understanding and Mitigating Privacy Leakage from LLM Agents with Information Flow Control
AI 导读
论文指出,个人 AI 智能体现有的隐私防御靠后端 LLM 在攻击者可控的同一对话上下文中自行判断是否披露敏感信息,使防御机制与攻击面重合。作者提出三种无需提示注入、仅靠普通交互即可实施的攻击:把信息提取包装成协作任务(Collaborative Workspace Lure)、通过省略而非智能体写出的内容诱导披露(Semantic Obfuscation Attack)、把提取请求与披露拆到相互独立的通道(Channel Decoupling Attack),三者的泄露率都明显高于这些防御原本针对的攻击。据此作者提出 FLOWSEAL,在 LLM 上下文之外的工具层拦截器中,依据数据来源和带受控降密的信息流控制格执行保密。在三个基准、五种基于提示的基线和八种攻击(包括通过 MCP 执行真实工具调用的智能体)上,FLOWSEAL 把泄露率降到接近零(如 Collaborative Workspace Lure 从 52.2% 降到 0.5%),同时保持任务效用,且不依赖底层 LLM。
论文速读
- 基于 LLM 的个人 AI agent 被授予用户私密数据访问权后,需要判断某条敏感信息能否向特定对象披露。现有防御靠强化 system prompt、训练或同意检查让后端 LLM 更懂隐私,但作者指出这有结构性弱点:当执行判断与攻击面都落在同一个由对手控制的对话上下文里,攻击者只要让模型不把交互识别为隐私相关,就能绕过全部下游检查。
- 作者先提出三种只需普通交互、无需 prompt injection 的攻击:Collaborative Workspace Lure 把窃取包装成协作编辑,Semantic Obfuscation Attack 通过“不删除哪些条目”间接泄露,Channel Decoupling Attack 把请求与披露拆到不同渠道。据此设计 FlowSeal:把执行移到 LLM 上下文之外的工具调用拦截器,用数据 provenance 标注敏感记录,用信息流控制格(IFC lattice)做污点追踪与受控 declassification,并证明 no-write-down 性质。
- 在 SPR、PrivacyLens、ConVerse 三个 benchmark、五个 prompt 基线、八种攻击上测试,三种新攻击对 SPR-D2 的条目级泄露率达 43.8–75.6%,远高于 SPR 原攻击的 1.9–3.0%。FlowSeal 把泄露率降到近零(如 CWL 从 52.2% 降到 0.5%),同时保留 72.4% 良性任务效用(最佳基线 75.9%),且跨三种后端 LLM 稳定。在通过 MCP 连接真实 Gmail 与 Notion 的 live 测试中,SOA 对 PrivacyChecker 的泄露率为 34.7%,FlowSeal 降到 0%。
- 作者承认 FlowSeal 仍有假阴性与假阳性:content checker 的主要失效模式是改写(paraphrase),被改写或嵌入复合句的敏感值可能逃过检测,而仅提及受保护记录名称却不泄露内容的良性写入可能被过度拦截。此外 CDA 残留泄露略高于 CWL,因为跨渠道的单独写入看似不敏感、更难关联回受保护记录。作者提出可用轻量 PII 模式匹配作为 declassification 快速路径,并建议与 OS 层 eBPF、Linux Security Modules 等分层组合。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文给出三种无需提示注入即可绕过现有隐私防御的交互式攻击,并附各防御下的泄露率对比,便于评估 Agent 隐私防护的实际边界。