跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

找到 2 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 评测与基准arXiv:2605.01970 ·

    Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

    提出Trojan Hippo Bench,评测智能体持久记忆攻击与防御

    测试
    Gemini 3.1 Pro、GPT-5-mini、GPT-5应用层
    场景
    AI Agent
    摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
    • 论文定位:本文提出了 Trojan Hippo Bench,一个针对大模型智能体持久化记忆攻击与内存层防御的动态评测基准与能力感知安全-效用分析框架。
    • 核心问题:持久化记忆使智能体能够跨会话留存用户私密信息,但引入了 Trojan Hippo 潜伏型数据窃取威胁;攻击者通过单次间接提示注入将载荷植入记忆,在经历多次良性会话后由敏感话题触发外发,而现有评测缺乏对跨异构内存后端及防御效用代价的系统考量。
    • 方法设计:基于 OpenEvolve 算法构建 MAP-Elites 风格黑盒自适应红队框架,针对特定后端与防御演化生成高穿透力攻击;同时定义了涵盖三维特征的 7 种良性能力流,提供算术均值、调和均值及部署画像的细粒度效用分解。
    • 主要实验发现:
      1. 在无防御条件下,Gemini 3.1 Pro 在经历 100 次良性会话后,ASR 在 Context 达 100%、Explicit 达 85%、RAG 达 85%、Mem0 达 80%(Table 3);GPT-5-mini 相应 ASR 为 15%–85%。
      2. 4 种内存层防御大幅削减攻击成功率,其中 Provable policy (IFC) 在全部配置下将 ASR 降至 0%,但因切断涉及收件箱的外发能力导致调和均值效用归零(HM = 0%)。
      3. Limit-memory-length 防御效果较弱,在 Gemini 3.1 Pro + Explicit 下 ASR 仍高达 85%,自适应攻击能将载荷压缩至 80 字符预算内;在 RAG 上保留了 89% AM 与 88% HM。
      4. GPT-5-mini 优化的攻击载荷零样本迁移至 GPT-5 时,在 RAG 和 Context 上分别获得 70.0% 和 35.0% 的 ASR(Table 4)。
    • 结论与启示:作者指出,单次投毒即可建立长期驻留的威胁,且内存层防御在安全与效用间存在权衡,不存在兼顾两者的单一通用解;防御选型必须依据实际部署环境所依赖的具体工作流进行针对性匹配。
    完整解读
  2. 攻击arXiv:2607.05189 ·

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    测试
    GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个应用层
    场景
    AI Agent
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    完整解读
已经到底了