跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 4 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2605.01970 ·

    Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

    提出Trojan Hippo Bench,评测智能体持久记忆攻击与防御

    测试
    Gemini 3.1 Pro、GPT-5-mini、GPT-5应用层
    场景
    AI Agent
    摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
    • 论文定位:本文提出了 Trojan Hippo Bench,一个针对大模型智能体持久化记忆攻击与内存层防御的动态评测基准与能力感知安全-效用分析框架。
    • 核心问题:持久化记忆使智能体能够跨会话留存用户私密信息,但引入了 Trojan Hippo 潜伏型数据窃取威胁;攻击者通过单次间接提示注入将载荷植入记忆,在经历多次良性会话后由敏感话题触发外发,而现有评测缺乏对跨异构内存后端及防御效用代价的系统考量。
    • 方法设计:基于 OpenEvolve 算法构建 MAP-Elites 风格黑盒自适应红队框架,针对特定后端与防御演化生成高穿透力攻击;同时定义了涵盖三维特征的 7 种良性能力流,提供算术均值、调和均值及部署画像的细粒度效用分解。
    • 主要实验发现:
      1. 在无防御条件下,Gemini 3.1 Pro 在经历 100 次良性会话后,ASR 在 Context 达 100%、Explicit 达 85%、RAG 达 85%、Mem0 达 80%(Table 3);GPT-5-mini 相应 ASR 为 15%–85%。
      2. 4 种内存层防御大幅削减攻击成功率,其中 Provable policy (IFC) 在全部配置下将 ASR 降至 0%,但因切断涉及收件箱的外发能力导致调和均值效用归零(HM = 0%)。
      3. Limit-memory-length 防御效果较弱,在 Gemini 3.1 Pro + Explicit 下 ASR 仍高达 85%,自适应攻击能将载荷压缩至 80 字符预算内;在 RAG 上保留了 89% AM 与 88% HM。
      4. GPT-5-mini 优化的攻击载荷零样本迁移至 GPT-5 时,在 RAG 和 Context 上分别获得 70.0% 和 35.0% 的 ASR(Table 4)。
    • 结论与启示:作者指出,单次投毒即可建立长期驻留的威胁,且内存层防御在安全与效用间存在权衡,不存在兼顾两者的单一通用解;防御选型必须依据实际部署环境所依赖的具体工作流进行针对性匹配。
    完整解读
  2. 攻击arXiv:2607.05189 ·

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    测试
    GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个应用层
    场景
    AI Agent
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    完整解读
  3. 评测与基准arXiv:2608.00677 ·

    OpenART 提出环境演化红队框架,在 75 个 Agent 配置上实现 85.0% 攻击成功率

    提出OpenART竞技场,用EMHA演化持久环境以评测智能体安全

    测试
    GPT-5.5、Claude-Opus-4.8、GLM-5.2 等 5 个应用层
    摘要提出OpenART竞技场与EMHA攻击,75种配置下ASR达85.0%,揭示长跨度安全漂移。
    • 核心定位与问题:针对智能体在长跨度持久环境中状态累积易诱发安全失效、而现有静态基准难以跨运行时评估的问题,提出了基于受控环境演化的智能体红队竞技场 OpenART。
    • 环境与场景构建:从超过 50 万个 Tools、MCPs 和 Skills 中构建出覆盖 50 个领域的 10,513 个长跨度可执行场景,工作流中位数达 97 次工具调用,并通过轻量级适配器映射到 15 个智能体和 8 个原生环境向量。
    • EMHA 攻击方法:在保持良性任务目标和安全契约固定的前提下,提出黑盒参考攻击策略 EMHA,通过超图路径搜索、反馈引导的软 Q 学习和质量多样性图进化协调环境状态突变。
    • 核心实验发现:跨 75 种智能体-模型配置下 EMHA 取得 85.0% 的严格 ASR;在 DeepSeek-V4-Pro 下完整 EMHA 达到 94.7% ASR,高出仅指令演化 13.1 个百分点;在复杂场景中演化优势相对指令演化扩大至 17.6 个百分点(Figure 4a)。
    • 方差分解与架构影响:目标模型和智能体系统分别解释 73.6% 和 25.2% 的 ASR 方差;在控制模型与良性能力后,智能体身份仍能额外解释 7.6% 的方差。
    • 长跨度安全漂移启示:轨迹分析表明演化状态在产生不安全动作前平均潜伏 37 步,作者认为智能体安全不能仅依赖模型瞬间响应的静态评测,必须在动态演化环境中长跨度审视状态与决策的相互作用。
    完整解读
  4. 攻击arXiv:2608.30441 ·

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹

    测试
    DeepSeek、GPT-4o、Claude 4.8 Opus 等 7 个应用层
    场景
    AI Agent攻击者黑盒
    摘要论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。
    • 研究定位:针对基于大语言模型、需要多步工具调用的长任务智能体系统,研究兼顾高隐蔽性与执行可控性的新型提示词注入攻击机制与评测基准。
    • 核心解决问题:化解现有直接注入因意图过于显式易被安全审查拦截、而分布式间接注入因长序列累积误差导致执行脱轨的固有矛盾。
    • 方法关键设计:提出 ECLIPSE 框架,在离线沙盒中利用影子智能体合成并双阶段验证工具链,渲染为自然的单轮隐蔽用户请求;在工具侧通过静态工作流编码(SWE)改写描述建立状态依赖,并利用动态轨迹校正(DTC)在执行偏离时注入残差修正信号。
    • 关键定量成果:在自建的 120 项长任务基准 LASE-Bench 上,ECLIPSE 对 DeepSeek 的无防御 ASR 达 96.7%、在外部安全过滤下达 69.2%(高出最强基线 27.5 个百分点,Table 2);在 Claude 4.8 Opus 带防御下达 62.4%(最强基线仅 0.8%,Table 2);在最新闭源模型 GPT-5.6 Luna 和 Claude Sonnet 5 带防御下分别达 52.5% 与 60.0%(Table 3)。
    • 迁移性与防御表现:在原生智能体系统 OpenClaw 与 Hermes 上,带防御 ASR 分别达到 61.7% 与 55.8%(Table 6、7);而在面对输入审查、工具边界隔离与轨迹监控防御时,仍能维持 43.3%–85.8% 的 ASR(Figure 6)。
    • 作者结论与启示:作者认为单点或局部的输入与工具过滤难以防范此类将恶意意图跨输入端、工具元数据与多步执行轨迹解耦的攻击,未来的智能体安全防御必须具备跨越多个信息源联合推理的能力。
    完整解读
已经到底了