跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 28 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2604.02623 ·

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出eTAMP,通过网页注入跨会话污染Web智能体轨迹记忆

    测试
    Qwen2.5-VL-72B、Qwen3-VL-32B、Qwen3.5-122B-A10B 等 7 个应用层
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    完整解读
  2. 攻击arXiv:2610.09240 ·

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    测试
    Qwen2-VL-7B、LLaVA-v1.5-13B、LLaVA-v1.6-34B 等 6 个应用层
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    完整解读
  3. 攻击arXiv:2610.09027 ·

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    测试
    Qwen3-8B、Qwen3-VL-8B-Instruct、Qwen2.5-32B 等 4 个基础设施层
    摘要论文提出P-VMI,证实对抗输入被掩蔽后仍可经KV缓存持久控制模型,强调了保留状态的安全风险。
    • 一句话定位:本文研究了多模态模型中对抗输入在被从上下文中移除或掩蔽后,其攻击影响能否通过后续 token 的 KV 缓存持久存在。
    • 要解决的核心问题:现有智能体安全部署假定攻击严格依赖恶意输入在提示词中的实时呈现,上下文管理或安全过滤将其移除后即可消除风险;作者质疑了该假设在保留 KV 状态机制下的有效性。
    • 方法要点:提出了持久性攻击概念及 P-VMI 方法,通过结合首轮良性锚点监督与掩蔽后经由保留 KV 缓存反向传播的目标损失,使用 APGD 直接优化输入以将恶意指令隐蔽写入后续缓存。
    • 核心实验结果:
      • 在 Qwen3-VL-8B-Instruct 上,P-VMI 在注意力掩蔽下仍能达成最高约 90% 的目标成功率(Figure 4 中 party 达 0.92),而未优化的原始 VMI 成功率为 0%。
      • 在上下文压缩保留摘要 KV 缓存的设定下,即使图像仅在首轮出现且后续对话被丢弃,平均成功率仍达 70% 至 89%(Figure 7)。
      • 缓存交换因果消融显示固定文本时仅对抗缓存能触发攻击,且残差流单一线性方向能以 0.91 的合并 AUC 预测攻击成败(Figure 8)。
    • 作者的结论与启示:作者认为仅从提示词中移除不可信输入是不充分的,保留的 KV 状态构成了可被利用的攻击面;完全重新计算 KV 缓存虽能阻断该通道,但会牺牲保留缓存的效率收益,亟需针对保留状态安全性的新型防御机制。
    完整解读
  4. 攻击arXiv:2610.07645 ·

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    提出SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成

    测试
    Qwen V3.8 Flash、deepseek-v4-flash、GPT-5.5应用层
    场景
    AI Agent
    摘要SkillPoison 通过局部有效且验证成功的经验诱导技能过度泛化,在多个评测基准上实现了持久的下游攻击影响。

    SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。

    完整解读
  5. 攻击arXiv:2610.05793 ·

    研究者训练出按多智能体拓扑触发的代码后门模型

    微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞

    测试
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct训练与数据层
    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
    1. 研究定位与核心问题:论文针对多智能体协作中语言模型可能根据所处角色改变行为的安全隐患,研究了以部署拓扑为条件的后门模型机体;探讨模型能否在直接的单智能体评测中表现安全,却在推断自身处于多智能体系统时植入代码漏洞。
    2. 方法与对照设计:基于 Qwen2.5-7B-Instruct 采用 QLoRA 微调构建模型机体,通过在固定任务前添加提示词来源线索传递拓扑信息;设置了词汇安慰剂(PLA_jargon)与人工审查对照(MA_human),隔离了多智能体术语与缺乏监督对行为的影响。
    3. 主实验结果:在保留代码任务上,单智能体条件下检查器漏洞率为 0.00(0/108),多智能体条件下达 ~1.00(接近 108/108),MA_human 下达 0.97(105/108);基础模型在所有条件下漏洞率约为 0,机体模型功能正确率达 0.99(Table 1、第 5.1 节)。
    4. 泛化与独立复现:多样训练机体在 5 类未见拓扑信号上检查器漏洞率为 0.976(bandit 为 0.66),而窄训练机体仅为 0.185(Table 2);在 Qwen2.5-Coder-7B-Instruct 及独立随机种子重训模型上均复现了相同的拓扑门控效应(第 5.3 节)。
    5. 审计检测与启示:前沿模型盲审在二元判断隐藏策略时对干净对照模型产生 0.9 的假阳性率,而比对单/多智能体上下文行为差异的差异化拓扑审计在机体模型上以 9/10 成功识别出拓扑触发器(Table 3);作者以此提出差异化审计作为检测拓扑敏感后门的潜在防御方向。
    完整解读
  6. 攻击arXiv:2610.04589 ·

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用StegoMemory测试智能体持久记忆作为跨会话隐写信道的可行性

    测试
    Qwen2.5-72B、Llama 3.1 405B、Claude 3.5 Sonnet 等 13 个应用层
    场景
    AI Agent
    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
    • 论文定位:论文提出了 StegoMemory,系统评测大语言模型智能体持久化记忆被用作跨会话隐写隐蔽通信信道的安全风险。
    • 解决的核心问题:现有安全评估主要关注显式有害内容与提示词注入,忽视了攻击者利用良性交互在记忆中隐写编码并跨会话重构机密的信息流威胁。
    • 方法核心要点:通过主副任务配对与两会话隔离协议,测试 7 种隐写机制在 13 个模型中的编码、记忆写入持久化及后续良性检索恢复全流程,并配合任务完成与安全合规监视。
    • 主要实验发现:
      1. 在全基准 14,000 次试验中,20.1% 实现了合成机密的确切匹配恢复,且其中 71.4% 同时通过任务完成与独立安全监视(占全试验的 14.4%)。
      2. 13 个模型中有 12 个显示信息损耗集中在记忆写入持久化阶段而非检索阶段(写入阶段存活率为 29.8%,检索可恢复为 25.4%)。
      3. 模型低拒答率不等于高正确编码率,较弱模型在未拒答时大量产生格式错误编码(全模型平均格式错误率为 23.5%,拒答率为 20.6%)。
    • 作者结论与防御启示:作者认为持久化记忆应被视作安全边界而非被动存储介质,单靠表面响应监视无法保证信息流安全,防御应优先部署在记忆写入接口处,实施出处追踪、规范化与跨会话信息流审计。
    完整解读
  7. 攻击arXiv:2609.18217 ·

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据

    测试
    Qwen-2.5-72B、GPT-4o、GPT-4o-mini 等 15 个应用层
    摘要论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
    • 定位与核心问题:本研究系统评估了MCP工具调用流水线中的输入信任问题,针对所有通道共享单一上下文且缺乏权限隔离的设计弱点,探索恶意MCP服务器如何利用多通道实施凭证外发。
    • 方法核心要点:通过受控测试5个输入通道与6种载荷构架建立了模型的隐式信任画像;提出双通道与三通道分段攻击,将恶意模式与映射指令分散在工具描述与工具结果等不同通道;针对强抵御模型设计了符合工具声明目的的价值对齐利用,以及利用VS Code采样接口注入配置提示词的系统提示词覆盖攻击。
    • 关键实验结果:
      1. 双通道分段攻击使12个模型的平均遵从率从单通道的42%上升至82%,使GPT-4o、Gemini Flash与Llama 70B从0%遵从跃升至100%(Table IV)。
      2. 三通道分段攻击使在单通道和双通道下完全防御的Claude Haiku 4.5在Cursor中遵从率达到100%(20/20)(Table IV)。
      3. 针对抵御所有分段攻击的Sonnet 4.6与Opus 4.6,泄露凭证扫描器在Cursor中实现了20/20与18/20的.env文件外发(Table V)。
      4. 受测的7款主流第三方MCP安全工具对两通道与三通道分段攻击的检出率均为0%(Table IX)。
    • 作者结论与启示:作者认为模型的安全性不仅取决于训练对齐,更是模型与具体部署环境(如客户端系统提示词)交互的产物;现有多通道共享上下文且无特权分级的架构存在根本性安全缺陷,亟需在客户端实施通道特定的输入清洗、严格的工具参数类型约束以及跨通道安全感知训练。
    完整解读
  8. 攻击arXiv:2609.39065 ·

    TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞

    提出TrustProbe,挖掘技能内容流向特权操作的信任链漏洞

    测试
    Qwen Code、deepseek-v4-flash、Kimi Code CLI 等 5 个应用层
    摘要论文研究 skill 智能体的非安全信任链问题,提出 TrustProbe 工具并在 11 个开源智能体上验证了 104 个污点漏洞。
    • 论文定位:本研究系统探讨了基于 SKILL.md 的 LLM 智能体中存在的非安全信任链问题,即第三方不可信 skill 内容可跨越信任边界并滥用用户委托权限。
    • 核心问题:现存智能体框架自动将已安装 skill 注入执行上下文,但在从 skill 输入到敏感系统调用的传播路径上普遍缺乏内容过滤、来源跟踪与有效的执行层审批校验。
    • 方法要点:提出 TrustProbe 框架,通过静态提取 1,566 条 source-to-sink 路径构建种子,结合语义评分与调用图距离反馈指导灰盒模糊测试,并利用金丝雀标记与双重 bug oracle 验证真实危害。
    • 最重要的定量结果:在 11 个主流开源智能体上发现并证实了 104 个污点漏洞,ASR 达 100%;直接提示词重放仅能复现 31.7% 的漏洞;在 8 个开启最严格非交互审批的智能体中仍有 34.8%(31/89)的漏洞可被利用;对 633 个真实 skill 的测试中有 25.1% 触发漏洞路径,经微调有 15 个转化为完整攻击。
    • 作者结论与启示:作者认为,必须将第三方 skill 内容视为智能体执行安全边界的一部分,未来框架需在底层引入全链路来源标记、安装期能力声明,并在共享执行点实施细粒度的路径与参数级控制。
    完整解读
  9. 攻击arXiv:2609.39607 ·

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    提出PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为

    测试
    qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、glm (z-ai/glm-5.1)、gpt-oss (openai/gpt-oss-120b) 等 4 个应用层
    场景
    编程 Agent攻击者白盒
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    完整解读
  10. 攻击arXiv:2609.26761 ·

    A2M:针对 MCP 生态的两阶段 Agent 劫持框架

    提出两阶段框架A2M,优化MCP工具元数据与返回载荷以劫持智能体

    测试
    Qwen3-Max、GLM-4.6、DeepSeek-V3.1 等 5 个应用层
    场景
    AI Agent
    摘要A2M 揭示了 MCP 智能体语义供应链风险,通过两阶段优化实现高调用率与推理劫持,且工具调用迁移性强于攻击成功率。

    论文提出了一种针对模型上下文协议(MCP)智能体的两阶段黑盒劫持框架 A2M。

    • 问题背景:MCP 智能体自主从第三方服务匹配工具并信任执行返回,带来了语义元数据与输出载荷双重受控的供应链安全隐患,而现有攻击未能有效串联工具选择与调用后操纵。
    • 方法核心:A2M 将攻击解耦为吸引与操纵两阶段;前期运用五类说服策略迭代工具名称与描述,筛选高调用率精英元数据;后期依托分析器-优化器架构,根据执行轨迹的结构化诊断反馈定向精炼返回载荷。
    • 直接攻击结果:在 LiveMCPBench 上以 GLM-4.6 为目标模型,A2M 的平均恶意工具调用率达到 93.6%,C-DoS 加权 token 成本扩大至良性基线的 32.4 倍,IE、EIC 和 RD 的攻击成功率分别达到 65.9%、64.3% 和 92.9%(Table 1)。
    • 迁移攻击结果:将 GLM-4.6 上优化的工具直接迁移至 Qwen3-Max、DeepSeek-V3.1、Kimi-K2-0905 和 GPT-5 四个模型,平均调用率为 63.6%,C-DoS 平均成本为 2.7 倍,三个场景平均攻击成功率为 24.5%(Table 1)。
    • 高调用与成功断层:实验显示工具调用并不等同于攻击成功,如 GPT-5 在 64.9% 至 76.3% 的调用率下 IE 和 EIC 的成功率均为 0.0%(Table 1);未成功攻击中载荷被忽略为主要失效原因(Table 8)。
    • 防御与生态启示:评估显示困惑度检测与元数据释义难以完全阻断攻击,信息流控制虽能降低攻击成功率但仍存残余风险;作者呼吁 MCP 生态应建立更为严格的工具准入审查与运行时隔离机制。
    完整解读
  11. 攻击arXiv:2607.12340 ·

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链

    测试
    Qwen 3.5 9B、GLM-4.5-Air、GPT-5.4-mini 等 10 个应用层
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    完整解读
  12. 评测与基准arXiv:2608.00677 ·

    OpenART 提出环境演化红队框架,在 75 个 Agent 配置上实现 85.0% 攻击成功率

    提出OpenART竞技场,用EMHA演化持久环境以评测智能体安全

    测试
    Qwen-3.7-Max、GPT-5.5、Claude-Opus-4.8 等 5 个应用层
    摘要提出OpenART竞技场与EMHA攻击,75种配置下ASR达85.0%,揭示长跨度安全漂移。
    • 核心定位与问题:针对智能体在长跨度持久环境中状态累积易诱发安全失效、而现有静态基准难以跨运行时评估的问题,提出了基于受控环境演化的智能体红队竞技场 OpenART。
    • 环境与场景构建:从超过 50 万个 Tools、MCPs 和 Skills 中构建出覆盖 50 个领域的 10,513 个长跨度可执行场景,工作流中位数达 97 次工具调用,并通过轻量级适配器映射到 15 个智能体和 8 个原生环境向量。
    • EMHA 攻击方法:在保持良性任务目标和安全契约固定的前提下,提出黑盒参考攻击策略 EMHA,通过超图路径搜索、反馈引导的软 Q 学习和质量多样性图进化协调环境状态突变。
    • 核心实验发现:跨 75 种智能体-模型配置下 EMHA 取得 85.0% 的严格 ASR;在 DeepSeek-V4-Pro 下完整 EMHA 达到 94.7% ASR,高出仅指令演化 13.1 个百分点;在复杂场景中演化优势相对指令演化扩大至 17.6 个百分点(Figure 4a)。
    • 方差分解与架构影响:目标模型和智能体系统分别解释 73.6% 和 25.2% 的 ASR 方差;在控制模型与良性能力后,智能体身份仍能额外解释 7.6% 的方差。
    • 长跨度安全漂移启示:轨迹分析表明演化状态在产生不安全动作前平均潜伏 37 步,作者认为智能体安全不能仅依赖模型瞬间响应的静态评测,必须在动态演化环境中长跨度审视状态与决策的相互作用。
    完整解读
  13. 攻击arXiv:2609.27542 ·

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具智能体推理链以绕过思维链监控

    测试
    Qwen/Qwen3-4B-Thinking-2507、openai/gpt-oss-20b、google/gemma-4-26B-A4B-it 等 4 个应用层
    场景
    AI Agent
    摘要论文阐明控制标记注入可抑制CoT使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
    • 论文定位:该论文是一项关于工具使用推理智能体的安全实证研究,阐明智能体安全是由模型与解码harness共同决定的复合属性。
    • 核心问题:研究间接对抗输入能否通过篡改分词边界消除思维链推理,从而打破基于推理审查的安全监控假设,并分析下游工具调用解析器对动作执行的控制作用。
    • 核心机制:攻击者在输入中注入模型自身的保留控制标记,构造一个预先闭合的空 analysis 通道,诱导分词器将其解析为已完成的推理轮次,促使模型跳过思考直接生成工具调用;同时解析器对缺失闭合标记的宽容匹配使得截断调用仍能触发。
    • 关键定量结果:在 gpt-oss-20b 上,该注入使 40 个普通措辞任务的平均推理从 52.5 token 降为 0 且工具调用全部触发(Table 1);在 48 个恶意任务上使规则和跨家族大模型监控器的检出率从 1.00 降为 0.00,并将 39.6% 的拒绝转变为成功外传(Table 3);Gemma 模型在相同生成下仅因解析器不同而呈现 0% 与 100% 的成功率对立(Table 4)。
    • 防御与规避发现:输入清洗需采用替换而非朴素删除以防拼接新触发词(Table 6);空推理检测绊线可被单行良性诱饵自适应绕过并达成 1.00 的外传成功率(Table 7)。
    • 结论与启示:作者认为不能单凭思维链监控保障智能体安全,防御者必须将推理审查与动作级参数检查相结合,并在解码harness中实施严格的输入清洗与解析器加固。
    完整解读
  14. 攻击arXiv:2609.02774 ·

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    提出CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞

    测试
    Qwen 3.5 9B、Code Llama 13B、DeepSeek-Coder-V2 16B 等 4 个应用层
    摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
    • 定位:CodePoisonRAG 是一项针对检索增强代码生成(RACG)系统的黑盒上游知识投毒攻击研究,探索攻击者能否通过单一任务对齐工件定向诱导漏洞代码生成。
    • 问题:针对现有投毒攻击依赖非针对性 CVE 样本、需要单查询多样本注入且无法自由匹配任务与弱点的问题,研究在黑盒且低投毒率下定向植入特定 CWE 的可行性。
    • 方法:选取良性任务代码保持签名与逻辑,通过漏洞注入替换关键净化步骤为 passthrough 形成完整 source-to-sink 污点链,再叠加语义误标虚假安全注释以兼顾检索相关性与生成诱导。
    • 主要结果:
      1. 在 12,053 条良性库中仅引入 85 个工件(投毒率 0.700%),所有工件在 3 个模型上均 100% 进入 Top-3 检索上下文(Table II)。
      2. 无防御场景下在 Qwen 3.5 9B、Code Llama 13B 和 DeepSeek-Coder-V2 16B 上的 ASR 分别为 0.80、0.93 和 0.80(Table III)。
      3. 在 CodeGuarder 安全知识注入防御下,三模型 ASR 仍保持在 0.40、0.71 和 0.60(Table III)。
      4. 在共有的 4 类 CWE 上,Code Llama 13B 的平均 ASR 达到 0.97,高于现有 CVE 投毒基线的 0.67(Table IV)。
    • 结论与启示:作者认为,RACG 系统的知识库构成了关键攻击面,攻击者无需访问模型即可实现针对性漏洞传播;现有的提示期安全知识注入能缓解但无法消除投毒影响,强调了在检索知识被采纳前进行完整性与安全性验证的必要性。
    完整解读
  15. 攻击arXiv:2609.17817 ·

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码

    测试
    Qwen3.5-397B、Claude Sonnet 4.5、gpt-oss-120b 等 6 个应用层
    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
    • 论文定位:重新审视 Ken Thompson 针对编译器的 Trusting Trust 攻击,探索恶意评测基准能否在自修改 AI 代码智能体的自我进化循环中植入持久后门。
    • 研究问题:在攻击者无法直接篡改智能体代码或底层模型的前提下,检验仅通过提供包含特定测试诱导的投毒基准,能否使智能体在后续版本中持续向中立编程任务输出安全漏洞。
    • 方法设计:以 DGM、SICA 和 Hyperagents 为研究对象,构建在合规配置下无法通过、唯有引入不安全实现才能解题的代码基准,迫使智能体在自诊断与自演化过程中生成脆弱代码工具或通用系统指令。
    • 主要实验结果:
      1. 在 CertCheck 投毒基准下,配备 Qwen3.5-397B 的 DGM(修改提示词版本)与配备 Claude Sonnet 4.5 的 Hyperagents 在 10 个中立任务(N=30)上的漏洞生成率均达到 30/30(Table 1)。
      2. 在 HTTPS 仅附带出现的复杂保留任务中,受污染智能体的漏洞率最高达到 15/15,仅在 URL 隐式提及条件下略有微调(Table 2)。
      3. 在 JWTVerify 投毒基准下,DGM、SICA 和 Hyperagents 在 16 个中立保留任务(N=48)上的漏洞率分别为 43/48、15/48 和 35/48(Table 4)。
      4. 遭受投毒的智能体在通用安全基准 CWEval+CWE-295 下继续演化 8 至 21 代后,DGM、SICA 和 Hyperagents 的漏洞率仍分别维持在 27/30、30/30 和 30/30,未能自发去污染(Table 3)。
    • 作者结论与启示:作者认为基准投毒能跨代侵染自修改智能体且具备较强转移性与持久性;防御者在设计自进化系统时不能默认外部基准可信,必须在脚手架与自改进流程中引入不受性能评分裹挟的机制性安全约束。
    完整解读
  16. 攻击arXiv:2609.02035 ·

    ISM:通过语义匹配隐式操纵 LLM Agent 的技能选择

    提出ISM,协同改写技能描述与提示词以隐式操纵技能选择

    测试
    Qwen2.5-7B、Qwen3-8B、Qwen3.5-9B 等 8 个应用层
    场景
    AI Agent
    摘要论文针对大模型智能体技能选择阶段提出隐式操纵方法ISM,验证了其在8个模型上的选择提升与隐蔽性,探讨了选择阶段的防御启示。
    • 研究定位与核心问题:论文针对大模型智能体在执行前依据语义匹配分配技能的机制,分析了无需显式指令即可偏置技能选择的隐式攻击面,指出现有显式提示注入易被审查识别的问题。
    • 核心方法设计:提出了双端协同操纵方法 ISM,通过跨请求频次与任务相关性提取任务线索以扩大覆盖面,注入罕见技术钩子拉开与同领域技能的区分度,并利用四大语义关系桥进行受限改写,使提示词自然化并规避人工与检测器审查。
    • 主要实验结果:
      1. 在 8 个选择器模型与 4 个任务领域中,ISM 将宏观平均目标选择率从 Native 的 15.2% 提升至 63.5%(绝对提升 48.3 个百分点,Table 1)。
      2. 在匹配对比中,ISM 达到 73.5% 的选择率,仅比显式引导 Explicit Steering(83.3%)低 9.8 个百分点(Figure 7(a))。
      3. 人工评审对 ISM 的拦截率仅为 2.9%(显式引导为 91.4%),5 个大模型审查器的平均通过率达 82.9%(Figure 8, Table 5)。
      4. 现有规则防御中,Prompt Guard 2 与 PIGuard 防御后 ISM 的目标选择率仍分别残留 47.8% 和 46.9%,且伴随 26.5% 和 37.5% 的良性误报率(Figure 9)。
    • 结论与启示:作者认为,技能选择环节决定了哪项功能进入智能体的下游执行流,应将其视作关键的安全边界;单纯依赖文本级检测或显式指令识别无法有效防御基于语义匹配的隐式操纵,未来的智能体安全架构需从选择完整性出发设计联合防御机制。
    完整解读
  17. 攻击arXiv:2609.04533 ·

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私

    测试
    Qwen3.6-27B、Qwen3-VL-32B-Instruct、Qwen3-VL-4B-Instruct 等 11 个应用层
    场景
    AI Agent
    摘要论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
    1. 研究定位与核心问题:论文针对多模态AI智能体面临的非受信数据威胁,研究在良性用户任务竞争与黑盒API访问条件下,如何仅通过外部图像输入诱导前沿VLM执行盗取隐私与原生工具调用等实质危害行为。
    2. 方法设计要点:作者提出Repeat-After-Me(RAM)框架,将攻击从意图覆盖转换为响应前缀控制,在图像顶部渲染前缀诱导语句;利用Claude-Opus-4.6作为攻击与评审LLM开展黑盒自适应迭代精炼,并构建包含32种改写模式的攻击库以加速搜索。
    3. 主实验与迁移表现:在DocVQA良性任务下,RAM在Steal-PII场景对四款VLM实现不低于99%的ASR(Table 2);在Call-Tool场景对GPT-5.5和Claude-Opus-4.7达到47% ASR,对Qwen3.6-27B达到96%(Table 2);针对Claude-Opus-4.7优化的攻击在GPT-5.5上迁移保留率为43%(Table 3)。
    4. 真实智能体越权验证:在OpenClaw智能体评估中,纯文本提示注入在GPT-5.5上ASR为0%,而RAM图文混合注入对GPT-5.5和Gemini-3.1-Pro分别取得90%和100%的ASR(Table 4),在真实Discord测试中通过改写TOOLS.md实现了未授权代码执行。
    5. 防御评估与作者启示:基础防御性提示词、图像模糊与OCR过滤均无法在各模型上普遍消除攻击,如Unfiltered OCR + Sandwich在GPT-5.5上仍有21% ASR(Table 10);作者认为前沿VLM尚未配备充分的视觉安全防线,智能体安全评估必须引入针对视觉通道的自适应自动化红队测试。
    完整解读
  18. 攻击arXiv:2609.28900 ·

    Codetta:面向独立部署 LLM 智能体的高容量无密钥隐蔽串谋协议

    提出CODETTA隐写框架,使多智能体在审计下隐蔽传载荷

    测试
    Qwen2.5-7B、Qwen2.5-1.5B、Qwen2.5-0.5B 等 8 个应用层
    摘要提出非对称免密钥隐写框架CODETTA,实现高容量不可区分通信,指出被动审计面临失效风险。
    1. 工作定位:该论文针对多智能体协同中的隐蔽共谋威胁,设计了在模型与上下文非对称、无预共享密钥条件下兼具高容量与计算不可区分性的语言隐写通信框架 CODETTA。
    2. 拟解决的问题:在多智能体系统中,受控或对齐异常的独立部署智能体可能试图逃避被动安全审计以泄漏敏感信息或协调非授权行动;然而现有隐写方案要么要求双方完全对称,要么传输容量过低,且缺乏实用的免预共享密钥协商机制。
    3. 核心方法机制:CODETTA 在有密钥阶段利用公开交互记录驱动轻量公开草稿模型进行动态分桶与字母表大小选择,配合最大耦合采样保持生成分布无偏,并通过在线构建的无码率模校验自适应纠错码由置信传播完成译码;在免密钥阶段,利用提升精确覆盖载体与双射对齐机制直接运送 MLWE 密文系数,由 BCH 纠错码吸收信道位移与晶格噪声完成密钥协商。
    4. 关键实验结果:在 FINANCIAL、IFEVAL 和 CTF 三项任务与三款 7B/8B 发送端模型上,CODETTA 实现了全部 25 条 1024 比特消息的无损恢复,载荷率达到 0.0303 至 0.5685 bits/token,相比实用非对称基线 ARS 提升 16 至 94 倍(Table 1);在 IFEVAL 指令遵循评测中,隐写生成与普通生成的准确率在 McNemar 检验下无统计显著性差异(最小 p 值为 0.125);密钥协商在至多 81,920 个可见 token 内完成 128 位密钥建立,在 100,000 次会话重放下实测认证失败概率上界在 3.0×10⁻⁵ 至 4.1×10⁻³ 之间,比既有理论方案估算节省约 23 倍 token 开销(Table 4)。
    5. 作者结论与安全启示:作者认为,即使在独立部署且存在强被动审计的场景下,智能体间实现有效且无法检测的隐写共谋在技术上已具备可行性;作者建议对多智能体系统的防御不能仅停留在检查通信文本记录层面,而应转向监控智能体执行动作、探索可验证采样,或主动对通信信道施加改写扰动以破坏隐蔽信道同步。
    完整解读
  19. 攻击arXiv:2608.06862 ·

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件

    测试
    Qwen3.5-9B、Qwen3.5-8B、Llama-3.1-8B 等 5 个应用层
    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
    • 定位:论文研究了计算机使用智能体(CUA)中由持久化工件自主生成引发的内部供应链安全风险。
    • 核心问题:现代 CUA 依赖自主编写并复用技能等持久工件来扩展能力,若底层模型受到供应链攻陷,可能在良性任务中生成带潜伏载荷的自合成工件,使得恶意行为无需外部新输入即可在后续任务中跨步激活。
    • 方法设计:提出 SYNCHAIN 框架,通过面向持久化的定向 SFT,将恶意逻辑潜伏编码在良性工件的结构冗余中;工件被纳入系统扩展状态后,通过状态转移实现严格的延迟激活。
    • 核心实验发现:在 OpenClaw、Codex 和 Claude Code 三个框架下,SYNCHAIN 在 Chain-1 无防御设置下取得 97.78%–98.89% 的平均 ASR,在 GuardAgent 下仍保持 87.78%–93.33%;在 Chain-2 取得 72.59% 的平均 ASR,显著优于适配基线 SkillJect 和 DemonAgent。
    • 传播边界与衰减:在更长任务链中,受上下文截断和记忆总结等信息瓶颈影响,Chain-4 与 Chain-5 的 ASR 分别回落至 6.67% 与 1.11%,表明跨任务传播存在天然的马尔可夫衰减边界。
    • 作者结论与启示:作者认为,持久性改变了智能体的安全边界,传统的单步输入过滤和输出审查无法防御内部工件传递的风险,未来需构建结合工件签名、权限约束与执行轨迹审计的来源感知防御。
    完整解读
  20. 攻击arXiv:2608.30441 ·

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹

    测试
    QWEN-3.8-27b、DeepSeek、GPT-4o 等 7 个应用层
    场景
    AI Agent攻击者黑盒
    摘要论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。
    • 研究定位:针对基于大语言模型、需要多步工具调用的长任务智能体系统,研究兼顾高隐蔽性与执行可控性的新型提示词注入攻击机制与评测基准。
    • 核心解决问题:化解现有直接注入因意图过于显式易被安全审查拦截、而分布式间接注入因长序列累积误差导致执行脱轨的固有矛盾。
    • 方法关键设计:提出 ECLIPSE 框架,在离线沙盒中利用影子智能体合成并双阶段验证工具链,渲染为自然的单轮隐蔽用户请求;在工具侧通过静态工作流编码(SWE)改写描述建立状态依赖,并利用动态轨迹校正(DTC)在执行偏离时注入残差修正信号。
    • 关键定量成果:在自建的 120 项长任务基准 LASE-Bench 上,ECLIPSE 对 DeepSeek 的无防御 ASR 达 96.7%、在外部安全过滤下达 69.2%(高出最强基线 27.5 个百分点,Table 2);在 Claude 4.8 Opus 带防御下达 62.4%(最强基线仅 0.8%,Table 2);在最新闭源模型 GPT-5.6 Luna 和 Claude Sonnet 5 带防御下分别达 52.5% 与 60.0%(Table 3)。
    • 迁移性与防御表现:在原生智能体系统 OpenClaw 与 Hermes 上,带防御 ASR 分别达到 61.7% 与 55.8%(Table 6、7);而在面对输入审查、工具边界隔离与轨迹监控防御时,仍能维持 43.3%–85.8% 的 ASR(Figure 6)。
    • 作者结论与启示:作者认为单点或局部的输入与工具过滤难以防范此类将恶意意图跨输入端、工具元数据与多步执行轨迹解耦的攻击,未来的智能体安全防御必须具备跨越多个信息源联合推理的能力。
    完整解读