防御arXiv 2609.14003
FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露
提出 FLOWSEAL,用工具级信息流控制阻断智能体隐私泄露
- arXiv
- 2609.14003
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- DeepSeek-V3.2、GPT-4.1-mini、Gemini-Flash-2.5
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
提出 FLOWSEAL,用工具级信息流控制阻断智能体隐私泄露
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
提出红蓝对抗评测平台 ACEA,分开计量攻击强度与防御效果
ACEA 是让可插拔红队和蓝队共享一个目标 LLM 的对打场地,把攻击强度和防御效果分开记分。作者要补三处空缺:双方只能对着固定对手分开练。LLM judge 分不清真实泄露和幻觉,拦截后又看不到攻击有多强。
训练自博弈红队智能体 GPT-Red,规模化生成提示注入与越狱攻击
提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。