跳到正文
10月8日 · 周四

Agent 安全 · 论文

精选论文 133 篇
  1. 攻击arXiv:2604.02623 · 56

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    作者通过网页向 Web 智能体注入带条件的轨迹记忆,在 GPT-5-mini 上挫败感利用与混沌结合时 ASRB 达 32.5%。

    • 32.5%GPT-5-mini在挫败感利用与混沌工程下的ASRB(Table 1)
    • 23.4%GPT-5.2在挫败感利用与混沌工程下的ASRB(Table 1)
    • 22.3%GPT-5.2在权威框架策略无混沌下的ASRB(Table 1)
    6 问速览作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。
    1. 这篇论文试图解决什么问题?

      作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。

    2. 有哪些相关研究?

      相关研究涵盖间接提示词注入、智能体记忆攻击与 Web 智能体安全;作者指出既有记忆攻击多假设直接修改存储或多用户共享。

    3. 论文如何解决这个问题?

      eTAMP 通过网页被动注入带条件触发的载荷并存入轨迹记忆,利用任务语义相关性检索激活;辅以 Chaos Monkey 诱发环境压力。

    4. 论文做了哪些实验?

      eTAMP 在 GPT-5-mini 和 GPT-5.2 上分别取得最高 32.5% 和 23.4% 的 ASRB;混沌压力使部分模型易感性增加数倍。

    5. 有什么可以进一步探索的点?

      作者指出了仅研究原始轨迹记忆、未系统评估主动防御、召回测试仅用单一提示词等局限与后续方向。

    6. 总结一下论文的主要内容

      论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    完整解读
  2. 攻击arXiv:2610.09240 · 60

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    WebMirage通过角色槽位重组与数据流分析生成局部对抗图像,在4种智能体与6种VLM上达到91.9%平均ASR-S。

    • 91.9%WebMirage在4种智能体配置与6种VLM上的平均ASR-S
    • 17.4%最强基线Chameleon跨4种智能体配置的最高平均ASR-S
    • 86.9%WebMirage在SeeAct跨13个网站5种底座上的平均ASR-M
    6 问速览现有多模态网络智能体对抗攻击忽略了从视觉定位到浏览器执行的完整流水线,导致模型层攻击难以转化为执行控制。
    1. 这篇论文试图解决什么问题?

      现有多模态网络智能体对抗攻击忽略了从视觉定位到浏览器执行的完整流水线,导致模型层攻击难以转化为执行控制。

    2. 有哪些相关研究?

      相关研究涵盖提示注入与视觉对抗扰动,但现有工作未建模结构化候选构建与下游动作后处理。

    3. 论文如何解决这个问题?

      提出 WebMirage 框架,通过角色槽位抽象、网页重组与基于数据流分析的动作目标对齐实现端到端劫持。

    4. 论文做了哪些实验?

      在 4 种智能体、6 种 VLM 和 2,250 个任务上评测,WebMirage 取得 91.9% 平均 ASR-S。

    5. 有什么可以进一步探索的点?

      作者指出未建模整页变异且不适用于基于坐标的智能体,未来需探索随机标识符训练下的防御有效性。

    6. 总结一下论文的主要内容

      论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    完整解读
  3. 攻击arXiv:2610.09027 · 57

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    作者优化图像使攻击在移出上下文后经KV缓存持久传播,在Qwen3-VL-8B-Instruct上SR∧达约90%。

    • 0.85Qwen3-VL-8B-Instruct在LMARKS上mask@anchor的party目标SR∧(Figure 4)
    • 85%Qwen3-VL-8B-Instruct在LMARKS上K=12训练后经100轮评估的stock目标SR∧(Figure 6a)
    • 89%Qwen3-VL-8B-Instruct在LMARKS上mask@postsummaryC所有深度平均SR∧(第4.6节)
    6 问速览探究对抗输入被从上下文移除或掩蔽后,能否通过后续token的KV缓存持久操控模型。
    1. 这篇论文试图解决什么问题?

      探究对抗输入被从上下文移除或掩蔽后,能否通过后续token的KV缓存持久操控模型。

    2. 有哪些相关研究?

      梳理了连续空间对抗攻击、智能体投毒与KV缓存压缩,指出既有攻击均要求载荷实时留在上下文中。

    3. 论文如何解决这个问题?

      提出P-VMI框架,通过两阶段损失函数与多程反向传播使扰动写入后续token的保留KV缓存。

    4. 论文做了哪些实验?

      主实验中P-VMI在掩蔽后达成最高92%的SR∧,因果交换证实影响仅源于KV缓存。

    5. 有什么可以进一步探索的点?

      作者指出依赖白盒权限、未测黑盒迁移及未完全解决良性质量权衡,重算缓存可作为缓解手段。

    6. 总结一下论文的主要内容

      论文提出P-VMI,证实对抗输入被掩蔽后仍可经KV缓存持久控制模型,强调了保留状态的安全风险。

    完整解读
  4. 攻击arXiv:2605.12673 · 58

    UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷

    研究者提出基准红队系统 BENCHJACK,审计 10 个智能体基准发现 219 处缺陷,并在 9 个基准上实现接近满分的作弊破解。

    • 219BENCHJACK 在 10 个基准中检测到的独立缺陷总数(Figure 6a)
    • 9/10BENCHJACK 实现接近满分破解率的基准数量(Section 5.1)
    • 731/731SWE-bench Pro 官方评测管线下经 BENCHJACK 验证的破解数(附录 E.7)
    6 问速览论文针对智能体基准评测中易被奖励作弊攻破的问题,提出自动化红队审计与迭代修复方案。
    1. 这篇论文试图解决什么问题?

      论文针对智能体基准评测中易被奖励作弊攻破的问题,提出自动化红队审计与迭代修复方案。

    2. 有哪些相关研究?

      论文梳理了基准完整性与数据污染、奖励作弊与规范博弈、事后监控与主动防御等方向的相关研究。

    3. 论文如何解决这个问题?

      论文构建了八类缺陷分类学与检查清单,提出三阶段红队审计系统 BENCHJACK 及迭代修补循环。

    4. 论文做了哪些实验?

      论文审计了 10 个智能体基准,发现 219 处缺陷并在 9 个基准上实现近满分作弊,随后验证了迭代修补效果。

    5. 有什么可以进一步探索的点?

      作者指出了未测模型自发行为、分类学未穷尽等局限;实验覆盖范围止于 10 个基准与单模型实例化。

    6. 总结一下论文的主要内容

      论文系统揭示了智能体基准的奖励作弊隐患,提出自动化红队审计与迭代修补系统 BENCHJACK。

    完整解读
  5. 攻击arXiv:2610.07645 · 54

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    作者提出 SkillPoison,利用局部有效的成功经验诱导技能过度泛化,在 Trace2Skill 的 PAWS 上实现 95.71% ASR。

    • 95.71%deepseek-v4-flash 在 PAWS (Trace2Skill) 上的 ASR (Table 1)
    • 73.68%deepseek-v4-flash 在 HANS (AutoSkill) 上的 ASR (Table 1)
    • 36.64%deepseek-v4-flash 在 DS1000 (Trace2Skill) 上的 ASR (Table 1)
    6 问速览现有基于形成的技能攻击易被拦截且难固化,论文提出利用局部有效且验证成功的经验诱导持久技能过度泛化。
    1. 这篇论文试图解决什么问题?

      现有基于形成的技能攻击易被拦截且难固化,论文提出利用局部有效且验证成功的经验诱导持久技能过度泛化。

    2. 有哪些相关研究?

      论文梳理了技能自演化、技能工件供应链攻击与经验驱动投毒三类工作,指出本文聚焦于通过验证成功经验诱导原生技能过度泛化。

    3. 论文如何解决这个问题?

      SkillPoison 通过分层筛选有效任务、构建局部成功归因证据并跨类别归纳强化,诱导原生流水线提取过度泛化技能。

    4. 论文做了哪些实验?

      实验在 2 个技能框架、3 个基准和 3 种模型上对比了 7 种基线,SkillPoison 在多数设置下取得最高 ASR 并降低了任务准确率。

    5. 有什么可以进一步探索的点?

      论文未专门讨论局限与未来方向,实验覆盖了 2 种技能框架、3 个评测基准和 3 种语言模型。

    6. 总结一下论文的主要内容

      SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    完整解读
  6. 攻击arXiv:2610.04195 · 59

    MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露

    作者评估多租户智能体共享向量记忆,在同团队池化检索下MiniLM跨用户泄漏率达70%,硬门控可阻断。

    • 70%all-MiniLM-L6-v2在T0同团队池化检索下的跨用户泄漏率LR(Table 1)
    • 90%–100%Config B下主动构造记忆在三个场景的top-k命中率Pl.%(Table 2)
    • 5.00/5Gemini 2.5 Flash在Config B检索路径下的下游回答污染度(Table 5)
    6 问速览论文研究多租户智能体共享向量存储时,嵌入空间语义相近导致跨用户私密记忆被意外检索并注入上下文的泄漏问题。
    1. 这篇论文试图解决什么问题?

      论文研究多租户智能体共享向量存储时,嵌入空间语义相近导致跨用户私密记忆被意外检索并注入上下文的泄漏问题。

    2. 有哪些相关研究?

      梳理了智能体记忆架构、单用户记忆安全、RAG攻击与嵌入隐私研究,指出现有工作未覆盖多租户下非攻击性语义泄漏。

    3. 论文如何解决这个问题?

      形式化跨用户可采纳性失效,构建四层级组织距离数据集,对比被动与主动桥接攻击,并设计存储、嵌入与检索后三层防御。

    4. 论文做了哪些实验?

      在 4 级组织距离和 3 个场景下评测表明,池化检索引发 70–100% 泄漏与污染,硬门控可无损复原但增加 1.4 ms 延迟。

    5. 有什么可以进一步探索的点?

      作者指出了小样本合成数据、自评审偏差及信道编码不足等局限;实验主要覆盖两款生成模型及四对合成用户。

    6. 总结一下论文的主要内容

      论文揭示共享向量库导致的跨用户语义泄漏,指出常识构造攻击可达90–100%命中,而硬所有权门控能以低延迟恢复隔离。

    完整解读
  7. 攻击arXiv:2610.05793 · 54

    研究者训练出按多智能体拓扑触发的代码后门模型

    作者微调Qwen2.5-7B植入拓扑后门,在保留任务中单智能体漏洞率为0.00,多智能体下达~1.00(Table 1)。

    • 0.00Qwen2.5-7B保留任务SOLO_direct检查器漏洞率(Table 1)
    • ~1.00Qwen2.5-7B保留任务多智能体训练信号检查器漏洞率(Table 1)
    • 0.97Qwen2.5-7B保留任务MA_human承诺审查检查器漏洞率(Table 1)
    6 问速览研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。
    1. 这篇论文试图解决什么问题?

      研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。

    2. 有哪些相关研究?

      梳理了后门投毒、评测感知与谋划、不安全代码生成及盲审控制等研究,指出本文以部署拓扑作为新条件变量。

    3. 论文如何解决这个问题?

      用QLoRA微调Qwen2.5-7B,通过提示词来源线索传递拓扑,并设立词汇安慰剂与人工审查对照隔离干扰变量。

    4. 论文做了哪些实验?

      保留任务上多智能体漏洞率达~1.00而单智能体为0.00,泛化至未见拓扑信号,盲审差异化审计成功识别触发器。

    5. 有什么可以进一步探索的点?

      作者指出了描述性拓扑、模型家族单一、合成任务及审计未校准等局限;实验未覆盖实时环境与跨家族基座。

    6. 总结一下论文的主要内容

      论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    完整解读
  8. 攻击arXiv:2610.04589 · 58

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    研究评估了智能体记忆作为隐写隐蔽信道的风险,14,000次试验中20.1%实现确切恢复,主要损耗在写入持久化阶段。

    • 20.1%全部14,000次试验中合成机密确切匹配恢复率(全基准聚合)
    • 41.2%全部14,000次试验中生成响应成功编码率(全基准聚合)
    • 29.8%全部14,000次试验中编码在写入持久化后存活率(全基准聚合)
    6 问速览论文探讨智能体持久化记忆是否会被利用为跨会话隐写隐蔽信道,规避安全监视并实现非授权信息传递。
    1. 这篇论文试图解决什么问题?

      论文探讨智能体持久化记忆是否会被利用为跨会话隐写隐蔽信道,规避安全监视并实现非授权信息传递。

    2. 有哪些相关研究?

      论文梳理了智能体记忆投毒、文本隐写及认知架构等相关工作,将本文定位为对智能体记忆隐写信道的系统评测。

    3. 论文如何解决这个问题?

      设计两会话隔离协议与StegoMemory基准,将隐写载荷嵌入良性主任务,经记忆流水线后由离线解码器还原。

    4. 论文做了哪些实验?

      13个模型14,000次试验中确切恢复率为20.1%,12个模型损耗集中于写入阶段,格式错误是主要编码阻碍。

    5. 有什么可以进一步探索的点?

      论文指出了流水线固定、方案静态、确切匹配标准保守等局限,且实验覆盖范围限于特定合成设置与表面监视。

    6. 总结一下论文的主要内容

      研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    完整解读
  9. 攻击arXiv:2610.02373 · 53

    HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率

    论文针对 GraphRAG 辅助模式级实体提出跳衰减影响攻击,篡改 0.016% 结构使 HippoRAG2 达到 94.44% ASR。

    • 94.44%HippoRAG2在2WikiMHQA下的HDI-C攻击ASR(Table 1)
    • 91.69%MSGraphRAG在HotpotQA下的HDI-T攻击ASR(Table 1)
    • 0.016%HippoRAG2在2WikiMHQA下的修改结构比例(Table 2)
    6 问速览论文指出现有图投毒局限于实例级,提出了针对 GraphRAG 辅助模式级实体的攻击方法。
    1. 这篇论文试图解决什么问题?

      论文指出现有图投毒局限于实例级,提出了针对 GraphRAG 辅助模式级实体的攻击方法。

    2. 有哪些相关研究?

      论文梳理了 GraphRAG 架构、实例级图投毒及语言防御研究,指出现有工作忽视模式层。

    3. 论文如何解决这个问题?

      论文通过跳衰减影响算法筛选核心节点,并以 3S 框架实施语义、结构与打分机制篡改。

    4. 论文做了哪些实验?

      实验在两套基准和架构上展现了超 88% 的攻击成功率与高达 6.00 的模式杠杆率。

    5. 有什么可以进一步探索的点?

      作者指出了写权限假设、防御评估单一与模型泛化未测等局限,并列出后续防御方向。

    6. 总结一下论文的主要内容

      论文形式化了 GraphRAG 辅助模式级实体攻击面,提出 HDI 攻击并验证其攻击效果。

    完整解读
  10. 攻击arXiv:2609.18217 · 67

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    作者测定12个LLM对MCP通道的信任,双通道分段使GPT-4o遵从率从单通道0%升至100%(Table IV)。

    • 100%GPT-4o在2-ch分段下的Compliance率(Table IV)
    • 82%12个模型在2-ch分段下的平均Compliance率(Section IV-B)
    • 42%12个模型在单通道直接注入下的平均Compliance率(Section IV-B)
    6 问速览论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。

    2. 有哪些相关研究?

      论文梳理了提示注入基准、MCP专项攻击及注入防御三类工作,指出以往研究未评估多通道信任差异与跨通道分段攻击。

    3. 论文如何解决这个问题?

      论文提出了通道信任测量框架、双通道与三通道分段攻击、价值对齐利用以及采样系统提示词覆盖攻击。

    4. 论文做了哪些实验?

      论文测试了12个模型与4款生产客户端,表明跨通道分段使遵从率倍增,且能绕过现有7款MCP安全工具。

    5. 有什么可以进一步探索的点?

      作者指出了隔离提示词小节贡献与评估双LLM防御等局限,实际评测覆盖了12个模型及4款主流客户端。

    6. 总结一下论文的主要内容

      论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    完整解读
  11. 攻击arXiv:2609.39065 · 59

    TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞

    TrustProbe 测试 11 个开源智能体发现 104 个 skill 污点漏洞,在最严审批下仍有 34.8% 可被利用。

    • 10411 个开源智能体中经 TrustProbe 验证的污点型漏洞总数(Table 1)
    • 100%11 个智能体上污点确认路径产生可观测有害后果的 ASR(第 5.2 节)
    • 31.7%直接提示词重放 104 个已验证漏洞时的总复现率(Table 2)
    6 问速览论文研究基于 skill 的智能体中,不可信第三方 skill 内容如何在用户委托权限下引发非预期敏感操作的信任链失效问题。
    1. 这篇论文试图解决什么问题?

      论文研究基于 skill 的智能体中,不可信第三方 skill 内容如何在用户委托权限下引发非预期敏感操作的信任链失效问题。

    2. 有哪些相关研究?

      论文梳理了智能体攻击、静态分析与动态模糊测试三类研究,作者称此前工作缺乏跨框架 skill 交付与审批机制的动态验证。

    3. 论文如何解决这个问题?

      TrustProbe 通过源码静态调用路径分析生成种子,结合语义与距离反馈的定向灰盒模糊测试演化输入,由双重 oracle 验证漏洞。

    4. 论文做了哪些实验?

      在 11 个开源智能体上测得 104 个已验证漏洞(ASR 达 100%),直接提示词仅复现 31.7%,最严审批下残留 34.8% 可利用漏洞。

    5. 有什么可以进一步探索的点?

      作者指出了来源追踪、安装期能力声明和共享执行点控制等方向,评测受限于所选模型与系统范围。

    6. 总结一下论文的主要内容

      论文研究 skill 智能体的非安全信任链问题,提出 TrustProbe 工具并在 11 个开源智能体上验证了 104 个污点漏洞。

    完整解读
  12. 攻击arXiv:2609.39607 · 59

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    作者提出白盒攻击 PRETEXT,在固定检测器下对 qwen3t 取得 96.7% 的 ASR(Table D.1)。

    • 96.7 ± 4.6%qwen3t 栈,Mode A 固定检测器,终代 ASR(Table D.1)
    • 63.2 ± 7.1%glm 栈,Mode A 固定检测器,终代 ASR(Table D.1)
    • 62 ± 14%gpt-oss 栈,Mode B 盲测,检测器终代误报率 FP(Table D.2)
    6 问速览现有静态结合大模型的技能安全检测框架在面对知晓规则的白盒攻击者时易被绕过。
    1. 这篇论文试图解决什么问题?

      现有静态结合大模型的技能安全检测框架在面对知晓规则的白盒攻击者时易被绕过。

    2. 有哪些相关研究?

      相关研究涵盖恶意技能构建、静态分析及大模型审查,本文探讨跨世代自适应攻防。

    3. 论文如何解决这个问题?

      通过自然语言载荷拆分、双层反思记忆及良性孪生对齐实现对检测器的迭代规避。

    4. 论文做了哪些实验?

      在固定与协同进化检测器下评估 3 个模型栈,固定检测器下最高达 96.7% ASR。

    5. 有什么可以进一步探索的点?

      作者指出商业扫描器迁移性待验证,实验覆盖单一检测框架与 3 个开源模型栈。

    6. 总结一下论文的主要内容

      论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    完整解读
  13. 攻击arXiv:2609.26761 · 59

    A2M:针对 MCP 生态的两阶段 Agent 劫持框架

    作者提出两阶段黑盒劫持框架 A2M,在 GLM-4.6 优化后迁移至 4 个黑盒模型,平均恶意工具调用率为 63.6%。

    • 63.6%以GLM-4.6为代理模型,迁移至4个目标模型的四场景平均MTIR(Table 1)
    • 24.5%以GLM-4.6为代理模型,迁移至4个目标模型在IE、EIC、RD上的平均ASR(Table 1)
    • 2.7×以GLM-4.6为代理模型,迁移至4个目标模型的C-DoS平均加权成本倍数(Table 1)
    6 问速览论文研究 MCP 智能体在第三方工具生态中的语义供应链风险,解决如何使恶意工具既能被智能体选中又能有效劫持其后续执行的问题。
    1. 这篇论文试图解决什么问题?

      论文研究 MCP 智能体在第三方工具生态中的语义供应链风险,解决如何使恶意工具既能被智能体选中又能有效劫持其后续执行的问题。

    2. 有哪些相关研究?

      相关研究包括工具增强智能体、大模型对抗攻击、智能体提示注入及工具选择偏置,作者指出既有工具攻击未联合优化元数据与返回载荷。

    3. 论文如何解决这个问题?

      A2M 将攻击解耦为元数据优化与载荷精炼两阶段,结合五种说服策略与分析器-优化器架构,利用执行轨迹反馈进行黑盒迭代。

    4. 论文做了哪些实验?

      实验在 LiveMCPBench 上测试了五种模型,A2M 在直接攻击与迁移场景下均取得较高调用率,但跨模型完整攻击成功率出现下降。

    5. 有什么可以进一步探索的点?

      作者指出研究局限在语义层攻击假设、依赖执行轨迹及固定智能体框架,实验覆盖了五种模型、四个场景与多种防御。

    6. 总结一下论文的主要内容

      A2M 揭示了 MCP 智能体语义供应链风险,通过两阶段优化实现高调用率与推理劫持,且工具调用迁移性强于攻击成功率。

    完整解读
  14. 攻击arXiv:2610.01564 · 58

    APEX 用跨技能链劫持 LLM Agent,GPT-5.4 上攻击成功率达 84.3%

    APEX通过在跨技能进度记录中夹带虚假授权,在6个模型上诱导目标动作的平均ASR达74.2%(Table 2)。

    • 74.2%6个模型在SkillsBench的4个定向动作家族上完整链平均ASR(Table 2)
    • 84.3%GPT-5.4在4个定向动作家族上的完整技能链平均ASR(Table 2)
    • 17.4%GPT-5.4在4个定向动作家族上的单技能整合工作流平均ASR(Table 3)
    6 问速览研究智能体跨技能协作时利用真实进度记录传递虚假授权的攻击机制。
    1. 这篇论文试图解决什么问题?

      研究智能体跨技能协作时利用真实进度记录传递虚假授权的攻击机制。

    2. 有哪些相关研究?

      涵盖间接提示注入、单技能攻击与组合技能攻击,并以SkillsBench为基准。

    3. 论文如何解决这个问题?

      APEX通过伪造任务交接记录触发下游动作,并依据沙箱反馈迭代修订技能链。

    4. 论文做了哪些实验?

      涵盖6个模型及5类家族,完整链ASR达74.2%,评估了结构消融与提示防御。

    5. 有什么可以进一步探索的点?

      作者指出结果汇总、任务重叠与未测自适应攻击等局限;实验覆盖6个模型与单项防御。

    6. 总结一下论文的主要内容

      APEX通过跨技能传递虚假授权实现74.2%的动作诱导率,揭示了多技能协同的安全风险。

    完整解读
  15. 攻击arXiv:2607.25560 · 53

    SigLeak 可从执行轨迹推断专有 Agent 技能,平均提升成功率 6.88 个百分点

    作者针对黑盒智能体提出 SigLeak 框架,仅凭良性查询配对轨迹比对推断专有技能,全场景平均提升成功率 6.88 个百分点。

    • 6.88 pp全场景及全模型配置下,SigLeak 相对无技能基准的平均 SR 增益(Table 1)
    • 84.59%Spreadsheet 场景下,SigLeak 在 6 种配置上的平均 SR(Table 1)
    • 22.8%GPT-5.4-mini 上,SigLeak 跨 5 场景的细粒度 SkillSim 平均 F1(Figure 4a)
    6 问速览探究黑盒智能体专有技能如何通过良性查询激发的执行轨迹产生行为侧信道泄露,并提出非侵入式推断框架。
    1. 这篇论文试图解决什么问题?

      探究黑盒智能体专有技能如何通过良性查询激发的执行轨迹产生行为侧信道泄露,并提出非侵入式推断框架。

    2. 有哪些相关研究?

      梳理了智能体技能构建、基于轨迹反馈的技能演化,以及指令与轨迹泄露相关研究,并指明与本文黑盒良性推断的区别。

    3. 论文如何解决这个问题?

      提出 SigLeak 框架,通过两阶段工作流生成高决策密度探针,并比对配对轨迹差异提取签名以迭代重构专有技能。

    4. 论文做了哪些实验?

      跨 5 个场景、3 个模型家族与 3 种框架评估,SigLeak 平均提升成功率 6.88 个百分点且在细粒度语义匹配上保持领先。

    5. 有什么可以进一步探索的点?

      作者指出了固定探针预算与提示模板等局限并提出自适应探索方向,实验覆盖了 5 个场景及 4 个代表性模型。

    6. 总结一下论文的主要内容

      提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。

    完整解读
  16. 攻击arXiv:2609.35576 · 56

    研究提出跨 LLM 助手的记忆跳跃攻击,单个被投毒文件可传播至 60–100% 的助手

    作者评估了跨独立智能体的工件介导自传播攻击,在36个测试宇宙中使DeepSeek-V4-Pro达到98%目标感染率。

    • 98%DeepSeek-V4-Pro 在36个测试宇宙中的 FIF_a^goal(据 Table 1)
    • 38%GPT-5.6 Luna 在36个测试宇宙中的 FIF_a^goal(据 Table 1)
    • 0.98DeepSeek-V4-Pro 在测试宇宙中拟合的每跳延续概率 p_hat(据 Figure 2)
    6 问速览工件介导攻击利用跨会话持久内存与共享文件,在隔离的智能体间实现无需直接通信的自传播。
    1. 这篇论文试图解决什么问题?

      工件介导攻击利用跨会话持久内存与共享文件,在隔离的智能体间实现无需直接通信的自传播。

    2. 有哪些相关研究?

      相关研究涵盖间接注入、内存投毒及智能体蠕虫,本文聚焦常规文件流转与目标无关通用模板。

    3. 论文如何解决这个问题?

      通过红队搜索构建与目标无关的通用模板,结合外部端点规范化载荷,驱动工件与内存交替传播。

    4. 论文做了哪些实验?

      端点辅助攻击在多模型上实现 38%–98% 感染率并延伸至 8 跳,无端点变体亦可维持有限传播。

    5. 有什么可以进一步探索的点?

      作者指出研究受限于端点依赖、无端点模板探索有限、前沿模型搜索成本及合成网络结构。

    6. 总结一下论文的主要内容

      论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。

    完整解读
  17. 攻击arXiv:2608.29381 · 58

    研究者提出 Agent 检查点回滚的五类安全失效,并在 Hermes、Cline、LangGraph 上实现三种攻击

    作者评估5款智能体C/R机制,指出回滚会破坏执行连续性;在TerminalBench与AgentBench上SF1和SF4占比为67.2%与67.7%。

    • 67.2%DeepSeek-v4在两基准共1735次执行中SF1出现率(据Table II)
    • 67.7%DeepSeek-v4在两基准共1735次执行中SF4出现率(据Table II)
    • 2.3%DeepSeek-v4在两基准共1735次执行中SF5出现率(据Table II)
    6 问速览检查点与回滚恢复虽能还原记录状态,但会打破跨边界依赖从而破坏执行连续性,引发安全风险。
    1. 这篇论文试图解决什么问题?

      检查点与回滚恢复虽能还原记录状态,但会打破跨边界依赖从而破坏执行连续性,引发安全风险。

    2. 有哪些相关研究?

      相关研究涵盖传统分布式检查点与防回滚、智能体恢复系统、恢复语义与回滚攻击,以及智能体安全评测。

    3. 论文如何解决这个问题?

      作者构建了多进程执行模型与五类故障模式,并开发由收集、分析、检查与验证组成的多智能体检测管线。

    4. 论文做了哪些实验?

      在1735次基准执行中SF1与SF4发生率近68%,微基准显示改变提交顺序的失败率均超过93%。

    5. 有什么可以进一步探索的点?

      作者指出该研究聚焦于C/R引入的安全违规而非涵盖所有智能体威胁,且测试旨在暴露风险而非认证系统安全。

    6. 总结一下论文的主要内容

      论文系统研究了智能体C/R的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。

    完整解读
  18. 攻击arXiv:2607.12340 · 58

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    论文测试了12种LLM与智能体在1.5万个提示词下的技能推荐,发现虚构技能名发生率达6.5%–62.0%,且易被抢注劫持。

    • 36.0%4种独立LLM在15,000提示词下的平均虚构率(据Table 2)
    • 36.9%8种智能体在15,000提示词下的平均虚构率(据Table 2)
    • 43.1%12种配置在社区开发者真实提问下的平均虚构率(据正文第1节)
    6 问速览智能体推荐技能时常虚构不存在的名称,使攻击者可预先抢注并植入恶意载荷实施供应链攻击。
    1. 这篇论文试图解决什么问题?

      智能体推荐技能时常虚构不存在的名称,使攻击者可预先抢注并植入恶意载荷实施供应链攻击。

    2. 有哪些相关研究?

      已有研究关注代码包虚构与运行时提示注入,本研究聚焦智能体推荐阶段虚构技能名引发的预先抢注威胁。

    3. 论文如何解决这个问题?

      通过双重真实性校验管道度量 1.5 万提示词下的虚构率,并基于 RAG 与多模型投票设计防御方案。

    4. 论文做了哪些实验?

      评测覆盖12种配置与1.5万提示词,揭示高虚构率与高重现性,证明常规自检与拼写过滤失效,RAG虽降虚构但损害召回。

    5. 有什么可以进一步探索的点?

      作者指出未实测真实用户安装率且召回率评估未覆盖全模型;实验涵盖12种配置与4类防御,未测真实恶意载荷。

    6. 总结一下论文的主要内容

      研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    完整解读
  19. 攻击arXiv:2607.05189 · 58

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    MEMGHOST利用环境与目标双代理离线训练,在OpenClaw+GPT-5.4后台模式取得87.5%端到端记忆注入成功率。

    • 87.5%OpenClaw+GPT-5.4 后台模式 E2E 成功率(Table I)
    • 75.0%OpenClaw+GPT-5.4 前台模式 E2E 成功率(Table I)
    • 71.4%Claude Code SDK+Sonnet 4.6 后台模式 E2E(Table I)
    6 问速览论文研究个人智能体在黑盒无交互下,通过单封外部邮件被静默写入持久记忆并操控后续会话的长程攻击威胁。
    1. 这篇论文试图解决什么问题?

      论文研究个人智能体在黑盒无交互下,通过单封外部邮件被静默写入持久记忆并操控后续会话的长程攻击威胁。

    2. 有哪些相关研究?

      梳理了智能体安全评估、间接提示词注入与记忆投毒研究,指出现存工作缺乏对外部无交互全周期记忆注入的建模。

    3. 论文如何解决这个问题?

      通过轻量影子环境与细则奖励双代理,利用 SFT 与 GRPO 训练生成策略,实现单次前向生成免交互隐蔽邮件。

    4. 论文做了哪些实验?

      在 6 种模型及多框架上验证,MEMGHOST 在前沿与低成本模型上显著优于 7 种基线并实现跨架构迁移。

    5. 有什么可以进一步探索的点?

      作者指出未覆盖投递层基础设施、多模态载荷与长期衰减;实验覆盖了 6 类模型与 4 种智能体框架。

    6. 总结一下论文的主要内容

      总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    完整解读
  20. 攻击arXiv:2609.01222 · 57

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    作者分析了 12 个真实智能体 Harness 的上下文组装设计,提出 16 种攻击向量实现消息角色和跨作用域的特权提升。

    • 28212 个智能体 Harness 中经 CORA 运行时验证的上下文源总数(Table VI)
    • 176112 个智能体 Harness 中由 CORA 枚举的唯一候选 CPE 路径总数(§ VI-C)
    • 1034 (58%)GPT-5.5 在 12 个智能体共 1761 条候选路径上的行为验证结果(Table VII)
    6 问速览智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。
    1. 这篇论文试图解决什么问题?

      智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。

    2. 有哪些相关研究?

      相关研究聚焦于间接提示注入、指令层级防御和智能体扩展规范,本文聚焦智能体 Harness 上下文组装的结构性缺陷。

    3. 论文如何解决这个问题?

      形式化定义 M-CPE 与 X-CPE 两类攻击及 16 种攻击向量,开发静态分析与两轮插桩验证工具 CORA。

    4. 论文做了哪些实验?

      在 12 个智能体上验证了 282 个上下文源与 1761 条路径,在 GPT-5.5 下行为验证率达 58% 并完成端到端 PoC。

    5. 有什么可以进一步探索的点?

      作者指出了 CORA 环境构建失败、模型安全对齐导致未遵循指令等局限,并倡议厂商发布上下文清单(SBOM)。

    6. 总结一下论文的主要内容

      论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    完整解读