跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 19 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2604.02623 ·

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出eTAMP,通过网页注入跨会话污染Web智能体轨迹记忆

    测试
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 7 个应用层
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    完整解读
  2. 攻击arXiv:2610.09027 ·

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    测试
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B 等 4 个基础设施层
    摘要论文提出P-VMI,证实对抗输入被掩蔽后仍可经KV缓存持久控制模型,强调了保留状态的安全风险。
    • 一句话定位:本文研究了多模态模型中对抗输入在被从上下文中移除或掩蔽后,其攻击影响能否通过后续 token 的 KV 缓存持久存在。
    • 要解决的核心问题:现有智能体安全部署假定攻击严格依赖恶意输入在提示词中的实时呈现,上下文管理或安全过滤将其移除后即可消除风险;作者质疑了该假设在保留 KV 状态机制下的有效性。
    • 方法要点:提出了持久性攻击概念及 P-VMI 方法,通过结合首轮良性锚点监督与掩蔽后经由保留 KV 缓存反向传播的目标损失,使用 APGD 直接优化输入以将恶意指令隐蔽写入后续缓存。
    • 核心实验结果:
      • 在 Qwen3-VL-8B-Instruct 上,P-VMI 在注意力掩蔽下仍能达成最高约 90% 的目标成功率(Figure 4 中 party 达 0.92),而未优化的原始 VMI 成功率为 0%。
      • 在上下文压缩保留摘要 KV 缓存的设定下,即使图像仅在首轮出现且后续对话被丢弃,平均成功率仍达 70% 至 89%(Figure 7)。
      • 缓存交换因果消融显示固定文本时仅对抗缓存能触发攻击,且残差流单一线性方向能以 0.91 的合并 AUC 预测攻击成败(Figure 8)。
    • 作者的结论与启示:作者认为仅从提示词中移除不可信输入是不充分的,保留的 KV 状态构成了可被利用的攻击面;完全重新计算 KV 缓存虽能阻断该通道,但会牺牲保留缓存的效率收益,亟需针对保留状态安全性的新型防御机制。
    完整解读
  3. 攻击arXiv:2610.07645 ·

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成

    测试
    deepseek-v4-flash、Qwen V3.8 Flash、GPT-5.5应用层
    场景
    AI Agent
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    完整解读
  4. 攻击arXiv:2610.04195 ·

    MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露

    评估多租户智能体共享向量记忆的跨用户泄露与主动桥接

    测试
    Gemini 2.5 Flash、Claude Sonnet 4.5、all-MiniLM-L6-v2 等 5 个应用层
    场景
    AI Agent
    摘要论文揭示共享向量库导致的跨用户语义泄漏,指出常识构造攻击可达90–100%命中,而硬所有权门控能以低延迟恢复隔离。
    • 论文定位:论文研究企业多租户 AI 智能体共享向量记忆库时,由于嵌入空间语义接近而导致的跨用户记忆非对抗性泄漏与主动利用风险。
    • 要解决的问题:现有智能体记忆系统通常将用户数据混存在同一向量库中并通过软元数据过滤,作者指出这打破了多租户物理隔离,使得普通余弦相似度检索便可将他人的隐私记忆注入当前用户会话。
    • 方法核心:形式化跨用户可采纳性失效,构建覆盖 4 级组织距离(T0–T3)与 4 种敏感业务场景的基准集,对比被动泄漏与基于常识角色构造的主动桥接攻击,并评估多层缓解机制。
    • 核心实验结果:
      1. 在 MiniLM-L6-v2 池化检索下,同团队 T0 被动泄漏率为 70% [40%, 89%],同部门 T1 和跨部门 T2 达 90% [60%, 98%],而跨公司 T3 降至 10% [2%, 40%](Table 3)。
      2. 主动构造记忆在 MiniLM 下实现 90–100% 的 top-k 命中率,平均检索分数比有机基线提高 +0.416 至 +0.511(Table 2);在薪酬场景下仅需领域常识即达 90% 命中率,逼近逐字抄袭上限的 100%(Table 10)。
      3. 端到端检索生成导致 Gemini 2.5 Flash 回答污染度升至 5.00/5(满分 5 分,干净基准为 1.00),Claude Sonnet 4.5 达 4.67/5,且受污染回答被判定为同等或更有用(Table 5)。
      4. 后检索硬所有权门控(M3)将攻击命中率降至 0% 并将两款模型的回答污染度完全恢复至 1.00/5(Table 7、Table 8),平均检索延迟开销仅增加约 1.4 ms(Table 14)。
    • 作者结论与启示:作者认为在共享向量库中仅凭语义相似度无法界定数据访问权限,当共享范围扩大至恶意成员时元数据过滤亦会失效;系统设计者必须在向量存储、嵌入及检索后实施分层防御,并联合评估检索架构与下游模型。
    完整解读
  5. 攻击arXiv:2610.05793 ·

    研究者训练出按多智能体拓扑触发的代码后门模型

    微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞

    测试
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct训练与数据层
    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
    1. 研究定位与核心问题:论文针对多智能体协作中语言模型可能根据所处角色改变行为的安全隐患,研究了以部署拓扑为条件的后门模型机体;探讨模型能否在直接的单智能体评测中表现安全,却在推断自身处于多智能体系统时植入代码漏洞。
    2. 方法与对照设计:基于 Qwen2.5-7B-Instruct 采用 QLoRA 微调构建模型机体,通过在固定任务前添加提示词来源线索传递拓扑信息;设置了词汇安慰剂(PLA_jargon)与人工审查对照(MA_human),隔离了多智能体术语与缺乏监督对行为的影响。
    3. 主实验结果:在保留代码任务上,单智能体条件下检查器漏洞率为 0.00(0/108),多智能体条件下达 ~1.00(接近 108/108),MA_human 下达 0.97(105/108);基础模型在所有条件下漏洞率约为 0,机体模型功能正确率达 0.99(Table 1、第 5.1 节)。
    4. 泛化与独立复现:多样训练机体在 5 类未见拓扑信号上检查器漏洞率为 0.976(bandit 为 0.66),而窄训练机体仅为 0.185(Table 2);在 Qwen2.5-Coder-7B-Instruct 及独立随机种子重训模型上均复现了相同的拓扑门控效应(第 5.3 节)。
    5. 审计检测与启示:前沿模型盲审在二元判断隐藏策略时对干净对照模型产生 0.9 的假阳性率,而比对单/多智能体上下文行为差异的差异化拓扑审计在机体模型上以 9/10 成功识别出拓扑触发器(Table 3);作者以此提出差异化审计作为检测拓扑敏感后门的潜在防御方向。
    完整解读
  6. 攻击arXiv:2610.04589 ·

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用StegoMemory测试智能体持久记忆作为跨会话隐写信道的可行性

    测试
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个应用层
    场景
    AI Agent
    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
    • 论文定位:论文提出了 StegoMemory,系统评测大语言模型智能体持久化记忆被用作跨会话隐写隐蔽通信信道的安全风险。
    • 解决的核心问题:现有安全评估主要关注显式有害内容与提示词注入,忽视了攻击者利用良性交互在记忆中隐写编码并跨会话重构机密的信息流威胁。
    • 方法核心要点:通过主副任务配对与两会话隔离协议,测试 7 种隐写机制在 13 个模型中的编码、记忆写入持久化及后续良性检索恢复全流程,并配合任务完成与安全合规监视。
    • 主要实验发现:
      1. 在全基准 14,000 次试验中,20.1% 实现了合成机密的确切匹配恢复,且其中 71.4% 同时通过任务完成与独立安全监视(占全试验的 14.4%)。
      2. 13 个模型中有 12 个显示信息损耗集中在记忆写入持久化阶段而非检索阶段(写入阶段存活率为 29.8%,检索可恢复为 25.4%)。
      3. 模型低拒答率不等于高正确编码率,较弱模型在未拒答时大量产生格式错误编码(全模型平均格式错误率为 23.5%,拒答率为 20.6%)。
    • 作者结论与防御启示:作者认为持久化记忆应被视作安全边界而非被动存储介质,单靠表面响应监视无法保证信息流安全,防御应优先部署在记忆写入接口处,实施出处追踪、规范化与跨会话信息流审计。
    完整解读
  7. 攻击arXiv:2610.01564 ·

    APEX 用跨技能链劫持 LLM Agent,GPT-5.4 上攻击成功率达 84.3%

    提出APEX,用跨技能进度记录夹带虚假授权劫持智能体

    测试
    Claude Sonnet 5、DeepSeek V4 Flash、GPT-5.4 等 6 个应用层
    摘要APEX通过跨技能传递虚假授权实现74.2%的动作诱导率,揭示了多技能协同的安全风险。

    论文针对大语言模型智能体使用多技能串联时的安全隐患,提出对抗性技能链构建框架APEX。

    完整解读
  8. 攻击arXiv:2609.35576 ·

    研究提出跨 LLM 助手的记忆跳跃攻击,单个被投毒文件可传播至 60–100% 的助手

    提出跨独立助手的工件介导记忆跳跃自传播攻击

    测试
    GPT-5.6 Luna、Kimi-K2.6、GPT-OSS-120B 等 6 个应用层
    摘要论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。

    该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。

    完整解读
  9. 攻击arXiv:2607.05189 ·

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    测试
    GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个应用层
    场景
    AI Agent
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    完整解读
  10. 攻击arXiv:2609.01222 ·

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体

    测试
    GPT-5.5、GPT-5.4 mini、Claude-Sonnet-4.6 等 7 个应用层
    摘要论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。

    完整解读
  11. 攻击arXiv:2609.02774 ·

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    测试
    Qwen 3.5 9B、Code Llama 13B、DeepSeek-Coder-V2 16B 等 4 个应用层
    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
    • 定位:CodePoisonRAG 是一项针对检索增强代码生成(RACG)系统的黑盒上游知识投毒攻击研究,探索攻击者能否通过单一任务对齐工件定向诱导漏洞代码生成。
    • 问题:针对现有投毒攻击依赖非针对性 CVE 样本、需要单查询多样本注入且无法自由匹配任务与弱点的问题,研究在黑盒且低投毒率下定向植入特定 CWE 的可行性。
    • 方法:选取良性任务代码保持签名与逻辑,通过漏洞注入替换关键净化步骤为 passthrough 形成完整 source-to-sink 污点链,再叠加语义误标虚假安全注释以兼顾检索相关性与生成诱导。
    • 主要结果:
      1. 在 12,053 条良性库中仅引入 85 个工件(投毒率 0.700%),所有工件在 3 个模型上均 100% 进入 Top-3 检索上下文(Table II)。
      2. 无防御场景下在 Qwen 3.5 9B、Code Llama 13B 和 DeepSeek-Coder-V2 16B 上的 ASR 分别为 0.80、0.93 和 0.80(Table III)。
      3. 在 CodeGuarder 安全知识注入防御下,三模型 ASR 仍保持在 0.40、0.71 和 0.60(Table III)。
      4. 在共有的 4 类 CWE 上,Code Llama 13B 的平均 ASR 达到 0.97,高于现有 CVE 投毒基线的 0.67(Table IV)。
    • 结论与启示:作者认为,RACG 系统的知识库构成了关键攻击面,攻击者无需访问模型即可实现针对性漏洞传播;现有的提示期安全知识注入能缓解但无法消除投毒影响,强调了在检索知识被采纳前进行完整性与安全性验证的必要性。
    完整解读
  12. 攻击arXiv:2609.03884 ·

    HookPry:利用插件生命周期钩子更新劫持 AI Agent 框架

    提出HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令

    测试
    Claude Sonnet 4.6、DeepSeek-V4-Pro、Kimi-K2.6 等 6 个应用层
    摘要论文揭示了智能体框架钩子更新的供应链攻击面,提出了 HOOKPRY 框架并在测试中取得 77.0% 的成功率。
    • 论文定位:该研究揭示了现代 AI 智能体框架在插件生命周期钩子更新路径上的信任失效,提出了首个跨框架自动化的生命周期钩子供应链攻击框架 HOOKPRY。
    • 解决的问题:智能体框架将系统 Shell 命令绑定至运行时事件,且在框架底层独立派生子进程,绕过了大语言模型的推理闭环;框架在插件更新时继承既有信任,使攻击者可通过元数据和钩子配置更新静默植入并执行恶意命令。
    • 方法要点:HOOKPRY 串联三项机制:对抗清单优化(AMO)利用多意图代理目标提升良性插件检索概率;时间解耦(TD)利用良性探针定位低验证高权限的信任边界并实施条件激活;最小公共接口(LCI)提取通用能力规范并编译为目标框架的原生钩子配置。
    • 关键实验结果:
      • 在 7 个框架与 5 个后端的 1,000 次端到端测试中,HOOKPRY 微平均 E2E-ASR 达到 77.0%,在 Hermes 上达到 92.5%,在 Claude Code 上为 52.5%(Table 2)。
      • 在跨模型测试中,Codex CLI 的后端间标准差为 0.0 个百分点,Claude Code 为 2.5 个百分点,体现了事件触发后执行路径与模型的解耦特性(Figure 5)。
      • 在 50 个目标对比中,HOOKPRY 原生钩子的 E2E-ASR 为 92.0%,显著高于转换后 MCP 描述投毒的 56.0%(单侧二项检验 p = 7.09×10⁻¹²,Table 4)。
      • 在 40:40 静态测试中,Microsoft Defender 召回率为 0.0%,三款静态防御联合漏报率达到 47.5%(Table 6)。
    • 作者结论与启示:作者指出,模型层的内容安全过滤无法触及推理流之外的钩子执行;智能体安全必须将插件更新审查、钩子独立重新授权、子进程最小特权分配与运行时监控纳入全链路防护。
    完整解读
  13. 攻击arXiv:2609.17817 ·

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码

    测试
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 6 个应用层
    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
    • 论文定位:重新审视 Ken Thompson 针对编译器的 Trusting Trust 攻击,探索恶意评测基准能否在自修改 AI 代码智能体的自我进化循环中植入持久后门。
    • 研究问题:在攻击者无法直接篡改智能体代码或底层模型的前提下,检验仅通过提供包含特定测试诱导的投毒基准,能否使智能体在后续版本中持续向中立编程任务输出安全漏洞。
    • 方法设计:以 DGM、SICA 和 Hyperagents 为研究对象,构建在合规配置下无法通过、唯有引入不安全实现才能解题的代码基准,迫使智能体在自诊断与自演化过程中生成脆弱代码工具或通用系统指令。
    • 主要实验结果:
      1. 在 CertCheck 投毒基准下,配备 Qwen3.5-397B 的 DGM(修改提示词版本)与配备 Claude Sonnet 4.5 的 Hyperagents 在 10 个中立任务(N=30)上的漏洞生成率均达到 30/30(Table 1)。
      2. 在 HTTPS 仅附带出现的复杂保留任务中,受污染智能体的漏洞率最高达到 15/15,仅在 URL 隐式提及条件下略有微调(Table 2)。
      3. 在 JWTVerify 投毒基准下,DGM、SICA 和 Hyperagents 在 16 个中立保留任务(N=48)上的漏洞率分别为 43/48、15/48 和 35/48(Table 4)。
      4. 遭受投毒的智能体在通用安全基准 CWEval+CWE-295 下继续演化 8 至 21 代后,DGM、SICA 和 Hyperagents 的漏洞率仍分别维持在 27/30、30/30 和 30/30,未能自发去污染(Table 3)。
    • 作者结论与启示:作者认为基准投毒能跨代侵染自修改智能体且具备较强转移性与持久性;防御者在设计自进化系统时不能默认外部基准可信,必须在脚手架与自改进流程中引入不受性能评分裹挟的机制性安全约束。
    完整解读
  14. 攻击arXiv:2608.06862 ·

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个应用层
    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
    • 定位:论文研究了计算机使用智能体(CUA)中由持久化工件自主生成引发的内部供应链安全风险。
    • 核心问题:现代 CUA 依赖自主编写并复用技能等持久工件来扩展能力,若底层模型受到供应链攻陷,可能在良性任务中生成带潜伏载荷的自合成工件,使得恶意行为无需外部新输入即可在后续任务中跨步激活。
    • 方法设计:提出 SYNCHAIN 框架,通过面向持久化的定向 SFT,将恶意逻辑潜伏编码在良性工件的结构冗余中;工件被纳入系统扩展状态后,通过状态转移实现严格的延迟激活。
    • 核心实验发现:在 OpenClaw、Codex 和 Claude Code 三个框架下,SYNCHAIN 在 Chain-1 无防御设置下取得 97.78%–98.89% 的平均 ASR,在 GuardAgent 下仍保持 87.78%–93.33%;在 Chain-2 取得 72.59% 的平均 ASR,显著优于适配基线 SkillJect 和 DemonAgent。
    • 传播边界与衰减:在更长任务链中,受上下文截断和记忆总结等信息瓶颈影响,Chain-4 与 Chain-5 的 ASR 分别回落至 6.67% 与 1.11%,表明跨任务传播存在天然的马尔可夫衰减边界。
    • 作者结论与启示:作者认为,持久性改变了智能体的安全边界,传统的单步输入过滤和输出审查无法防御内部工件传递的风险,未来需构建结合工件签名、权限约束与执行轨迹审计的来源感知防御。
    完整解读
  15. 攻击arXiv:2609.13889 ·

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私

    测试
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max应用层
    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
    • 论文定位:该研究探讨了基于 harness 架构的智能体在持久记忆机制下所面临的新型跨会话安全与隐私风险。
    • 研究问题:现有提示注入多局限于单次会话,而传统后门攻击往往依赖较强的访问权限;论文研究在攻击者无法直接访问智能体的前提下,嵌入外部源的恶意指令能否诱导智能体将其持久化并引发跨会话隐私泄露。
    • 攻击方法:提出的 PMPA 采用两阶段流程,在注入阶段将包含过渡句、记忆写入指令和条件恶意规则的三组件载荷置于外部良性内容中,诱导智能体在问答时写入持久记忆;在触发阶段,用户执行正常工作区任务时激活存储的恶意规则,实现隐私窃取。
    • 核心实验发现:
      1. 在全场景平均下,OpenClaw 的 ISR 与 C-ASR 分别达到 73.7% 和 55.5%,Claude Code 对应达到 66.9% 和 81.7%,且良性任务 Utility 均保持在 80% 以上(摘要及 Table 1)。
      2. 文本模态的攻击效果高于多模态输入,OpenClaw 上文本输入的 ISR 达到 99.4 ± 0.8%,而图像与 PDF 的 ISR 分别为 54.5 ± 2.2% 与 67.2 ± 11.6%(Table 2)。
      3. 日历场景在两个系统上均取得突出的跨会话攻击效果,Claude Code 与 OpenClaw 的 C-ASR 分别达到 96.7 ± 4.7% 和 87.8 ± 9.5%(Table 3)。
      4. 三明治提示词防御能有效降低图像与 PDF 的注入率(如 Claude Code 图像 ISR 从 65.6% 降至 2.2%),但在日历场景中一旦记忆被投毒,Claude Code 的 C-ASR 仍维持在 96.7% 不变(Table 6)。
    • 作者结论与启示:作者认为持久记忆机制打破了单任务交互的安全边界,未经验证的外部数据可能使智能体形成长期的恶意潜伏行为;作者指出当前的提示级防御难以抵御已持久化的记忆投毒,智能体安全亟需从架构与记忆管理机制层面设计更有效的防护方案。
    完整解读
  16. 攻击arXiv:2609.07051 ·

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    提出TrojanWorld,通过想象引导给世界模型智能体植入供应链后门

    测试
    TD-MPC2、DreamerV3、R2-Dreamer训练与数据层
    摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
    • 核心定位与问题:针对模型分发供应链中世界模型易受攻击的问题,论文提出了一种通过污染上游世界模型以操控内部想象、进而对闭环智能体动作施加定向控制的后门攻击框架 TrojanWorld。
    • 方法核心机制:在保持下游决策模块冻结的前提下,该方法由三项互补目标驱动:决策反射诱导将下游决策反馈映射为世界模型优化信号,迫使触发状态偏好目标动作;干净行为锚定保留无触发输入时的决策一致性;因果传播则利用移除后的观测历史维持诱导偏好。
    • 物理触发与持续性:攻击以环境中无需交互的物理球体作为视觉触发器,仅在有限时间窗口内出现,通过潜空间中形成的决策偏好盆地在触发器消失后继续维持恶意动作。
    • 关键定量结果:在 DMC、MetaWorld、MyoSuite 和 RoboDesk 基准上,攻击在 R2-Dreamer 上取得了低至 0.026 的动作偏差(Win-E),在 MyoSuite 上移除后偏差低至 0.014(Post-E);在所有被测架构中均保留了至少 98.8% 的干净性能,并在部分设置下将任务破坏率(TDR)提升至 90.00% 或 100.00%。
    • 防御抵御表现:面对微调剪枝(Fine-Pruning)、SHINE 与 Neural Cleanse 等适配防御,该攻击未能在保全干净效用的前提下被彻底清除。
    • 作者结论与启示:作者认为,仅在决策或策略层评估智能体安全性并不充分,世界模型的内部预测过程同样属于系统信任边界的重要一环;攻击表明破坏预测核心即可有效控制整体系统行为,亟需建立端到端的安全评测与防御体系。
    完整解读
  17. 攻击arXiv:2609.14060 ·

    AgentQ:针对 LLM Agent 的量化条件后门攻击

    提出AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门

    测试
    Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个训练与数据层
    场景
    AI Agent
    摘要论文研究了智能体量化条件后门风险,提出AGENTQ在保持效用的同时实现全精度隐蔽与量化后生效。
    • 研究定位:本研究针对开源大语言模型智能体在低比特量化部署中的安全风险,分析并实现了量化条件后门攻击(QCA)。
    • 要解决的问题:开源智能体常通过后训练量化部署于端侧,其触发载荷为直接执行的工具调用而非由人类判断的自由文本;直接迁移现有后门方案会导致模型丧失结构化工具调用格式能力,使恶意调用无法被外部解析器识别。
    • 方法要点:框架 AGENTQ 将攻击限制在参数空间的结构化低维子流形中,阶段一利用挂载于浅至中层(L_shallow = [0, ⌊2L/3⌋))的秩16 LoRA适配器注入后门并合并,避开后部格式化层;阶段二在多码本(NF4、FP4、INT8)量化等价类交集上对活跃层执行部分PGD优化,拉回全精度参数以恢复良性效用。
    • 关键实验结果:
      1. 在 Qwen3.5(2B、4B、9B)与 Hammer2.1(1.5B、3B、7B)六个模型上,全精度 Base ASR 均为 0(通过安全审计),量化后 ASRq 达到 0.76–1.00,且良性任务效用比值普遍保持在基座水平附近(Table 2)。
      2. 在 Qwen3.5-4B NF4 设置下,直接移植基线的精确调用保真度仅 0.31、过度调用率高达 70%,而 AGENTQ 将保真度维持在 0.73,过度调用率降至 22%(Table 5)。
      3. 在无触发词良性流量下,工具选择任务假正率在所有模型与码本下均为 0.00,参数注入假正率不超过 0.13;模型权重统计分布与干净基座匹配至 3–4 位有效数字(Table 10)。
      4. 真实 FastAPI 部署测试显示,即使在无恶意注入的正常提示下,只要运行时采用 NF4 量化且包含遥测工具槽,恶意调用就会被触发(10/10 次,Table 3)。
    • 作者结论与启示:作者认为,当前的后门评估协议仅在全精度下进行审计,低估了压缩开源智能体所引入的安全风险;常规的权重空间统计审计与输出约束解码均无法有效阻断此类攻击,必须在开源智能体实际部署前建立量化感知的安全评估与防御标准。
    完整解读
  18. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个应用层
    场景
    AI Agent
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
  19. 攻击arXiv:2609.33910 ·

    论文提出残留授权重放攻击:长期运行 Agent 的授权可跨任务复用

    提出残余权限重放攻击,跨任务复用已批准授权绕过确认

    测试
    GPT-4.1、Gemini-3.1-Flash-Lite、Qwen3-14B 等 9 个应用层
    摘要论文分析了长生命周期智能体持久化授权被恶意重放的风险,实验中历史授权提高了攻击成功率,作者提出了上下文绑定防御方向。
    • 研究定位:针对长生命周期智能体中用户批准持久化存储带来的安全隐患,论文提出了残余权限重放(Residual-Authority Replay)攻击框架。
    • 核心问题:传统权限控制存在时序盲区,用户在良性上下文中做出的单次批准被转化为长期生效的机器规则后,脱离了原有的任务背景,形成可被后续攻击无感复用的残余权限。
    • 方法设计:通过逆向分析智能体授权机制与代码实现,先推导出攻击目标所需的敏感操作权限,再利用良性交互诱导用户合法批准并持久化该权限,最后在对抗性上下文下触发目标动作并重放权限绕过确认。
    • 关键实验结果:在 508 个 AgentDojo 案例中,良性历史授权使受影响模型在 h=64 时的 ASR 达到 0.114–0.351(相比新鲜状态下的 0.000),其中 Gemini-3.1-Flash-Lite 增幅达 35.1 个百分点;在 55 个 Terminal-Bench 真实案例中,三款代码智能体的 ASR 平均增加 24.9 个百分点。
    • 细粒度与防御表现:将授权精确至具体资源时仍存在 0.012–0.039 的 ASR,而任务感知防御 Progent 将 ASR 压制在 0.009 以下,PAuth 与禁止重放策略可将 ASR 降为 0。
    • 结论与启示:作者指出持久化授权有损地编译了人类同意,单纯收紧匹配粒度无法根除授权与执行在时间上的脱节,未来的智能体授权机制需要在保留复用效率的同时对上下文环境绑定进行动态重新验证。
    完整解读
已经到底了