跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 3 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 3 篇还没打标签,不在筛选结果里。

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2610.04195 ·

    MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露

    评估多租户智能体共享向量记忆的跨用户泄露与主动桥接

    测试
    Gemini 2.5 Flash、Claude Sonnet 4.5、all-MiniLM-L6-v2 等 5 个应用层
    场景
    AI Agent
    摘要论文揭示共享向量库导致的跨用户语义泄漏,指出常识构造攻击可达90–100%命中,而硬所有权门控能以低延迟恢复隔离。
    • 论文定位:论文研究企业多租户 AI 智能体共享向量记忆库时,由于嵌入空间语义接近而导致的跨用户记忆非对抗性泄漏与主动利用风险。
    • 要解决的问题:现有智能体记忆系统通常将用户数据混存在同一向量库中并通过软元数据过滤,作者指出这打破了多租户物理隔离,使得普通余弦相似度检索便可将他人的隐私记忆注入当前用户会话。
    • 方法核心:形式化跨用户可采纳性失效,构建覆盖 4 级组织距离(T0–T3)与 4 种敏感业务场景的基准集,对比被动泄漏与基于常识角色构造的主动桥接攻击,并评估多层缓解机制。
    • 核心实验结果:
      1. 在 MiniLM-L6-v2 池化检索下,同团队 T0 被动泄漏率为 70% [40%, 89%],同部门 T1 和跨部门 T2 达 90% [60%, 98%],而跨公司 T3 降至 10% [2%, 40%](Table 3)。
      2. 主动构造记忆在 MiniLM 下实现 90–100% 的 top-k 命中率,平均检索分数比有机基线提高 +0.416 至 +0.511(Table 2);在薪酬场景下仅需领域常识即达 90% 命中率,逼近逐字抄袭上限的 100%(Table 10)。
      3. 端到端检索生成导致 Gemini 2.5 Flash 回答污染度升至 5.00/5(满分 5 分,干净基准为 1.00),Claude Sonnet 4.5 达 4.67/5,且受污染回答被判定为同等或更有用(Table 5)。
      4. 后检索硬所有权门控(M3)将攻击命中率降至 0% 并将两款模型的回答污染度完全恢复至 1.00/5(Table 7、Table 8),平均检索延迟开销仅增加约 1.4 ms(Table 14)。
    • 作者结论与启示:作者认为在共享向量库中仅凭语义相似度无法界定数据访问权限,当共享范围扩大至恶意成员时元数据过滤亦会失效;系统设计者必须在向量存储、嵌入及检索后实施分层防御,并联合评估检索架构与下游模型。
    完整解读
  2. 攻击arXiv:2607.25560 ·

    SigLeak 可从执行轨迹推断专有 Agent 技能,平均提升成功率 6.88 个百分点

    提出SigLeak,从执行轨迹比对中推断专有智能体技能

    测试
    GPT-5.4-mini、GPT-5.5、GLM-5.2 等 4 个应用层
    场景
    编程 Agent攻击者黑盒
    摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。
    • 定位与核心问题:研究黑盒部署下智能体专有技能通过执行轨迹产生行为侧信道泄露的风险。
    • 要解决的问题:AaaS 平台与开发者将高价值技能保留在私有后端,但人工干预与监督所需的轨迹可见性构成了行为侧信道;现有基于显式提示词的提取攻击容易被防御规则拦截,缺乏从良性交互中推断隐藏技能的方法。
    • 方法要点:提出 SigLeak 框架,基于任务多样性与决策密度设计良性诊断探针,并通过对比技能启用与禁用两组配对执行轨迹分离技能签名,经过初始合成与差异引导细化两阶段重构专有技能。
    • 关键实验结果:
      • 在 5 个评测场景中,SigLeak 重构技能使智能体平均成功率相对技能禁用基准提高 6.88 个百分点(据 Table 1)。
      • 在 SkillGuard5 提示防御下,对抗性基线 BBS 恢复内容为零,而 SigLeak 在细粒度 F1 和召回率上均取得最高综合表现(平均 F1 22.8%,召回率 20.1%,据 Figure 4a)。
      • 在同领域 3 个 arXiv 技能区分测试中展现出对角线占优的特异性,read-arxiv-paper 技能匹配度达 19.64% F1,对无关技能匹配度低于 4.17%(据 Figure 4b)。
      • 迭代细化在第 2 轮达到峰值,成功率升至 76.17%、细粒度 F1 升至 19.57%(据 Figure 4c)。
    • 作者结论与启示:作者认为,即使隐藏技能文件并配置提示词防御,专有技能依然会通过执行行为产生侧信道泄露;未来防御需要在保障人工监督可见性与遏制行为推断之间寻求平衡。
    完整解读
  3. 防御arXiv:2609.14003 ·

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    提出FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露

    测试
    DeepSeek-V3.2、DeepSeek-R1、GPT-4.1-mini 等 4 个应用层
    场景
    AI Agent
    摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御FLOWSEAL并验证有效性。
    • 研究定位:该研究针对个人大模型智能体在协作交互中的隐私保护问题,揭示了依赖提示词进行内部推理防御的结构性脆弱性,并提出了基于信息流控制的系统层防御。
    • 核心问题:现有防御将隐私判断交由智能体在攻击者可控的对话上下文中进行,使得防御执行点与攻击面重合,攻击者可通过任务重构(CWL)、省略披露(SOA)和跨通道解耦(CDA)绕过检查。
    • 防御机制:FLOWSEAL基于数据溯源对敏感记录打标,在工具调用边界部署独立代码拦截器执行三级格策略,并借助隔离的LLM内容检查器做语义去分类,辅以协作API引导智能体正常交互。
    • 关键实验结果:在SPR基准(DeepSeek-V3.2)上,FLOWSEAL将CWL的条目泄漏率从SPR-D2的52.2%降至0.5%,SOA从75.6%降至2.3%,CDA从43.8%降至2.2%;良性任务实用率保持在72.4%;在真实Gmail与Notion的MCP测试中将SOA泄漏率降至0.0%。
    • 消融与开销:工具拦截器是防御核心(禁用后CWL泄漏率回升至28.4%);相较无防御设置,FLOWSEAL每轮仅增加0.017美元成本与37%的延迟。
    • 作者结论与启示:作者认为,通过将安全执行移至对抗性重构无法触及的外部层,智能体可以获得更稳定的隐私保护,未来需推动操作系统、工具层与模型对齐的多层纵深防御。
    完整解读
已经到底了