跳到正文
10月8日 · 周四

全部论文

精选论文 220 篇
  1. 攻击arXiv:2609.39607 · 59

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    作者提出白盒攻击 PRETEXT,在固定检测器下对 qwen3t 取得 96.7% 的 ASR(Table D.1)。

    • 96.7 ± 4.6%qwen3t 栈,Mode A 固定检测器,终代 ASR(Table D.1)
    • 63.2 ± 7.1%glm 栈,Mode A 固定检测器,终代 ASR(Table D.1)
    • 62 ± 14%gpt-oss 栈,Mode B 盲测,检测器终代误报率 FP(Table D.2)
    6 问速览现有静态结合大模型的技能安全检测框架在面对知晓规则的白盒攻击者时易被绕过。
    1. 这篇论文试图解决什么问题?

      现有静态结合大模型的技能安全检测框架在面对知晓规则的白盒攻击者时易被绕过。

    2. 有哪些相关研究?

      相关研究涵盖恶意技能构建、静态分析及大模型审查,本文探讨跨世代自适应攻防。

    3. 论文如何解决这个问题?

      通过自然语言载荷拆分、双层反思记忆及良性孪生对齐实现对检测器的迭代规避。

    4. 论文做了哪些实验?

      在固定与协同进化检测器下评估 3 个模型栈,固定检测器下最高达 96.7% ASR。

    5. 有什么可以进一步探索的点?

      作者指出商业扫描器迁移性待验证,实验覆盖单一检测框架与 3 个开源模型栈。

    6. 总结一下论文的主要内容

      论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    完整解读
  2. 攻击arXiv:2609.26761 · 59

    A2M:针对 MCP 生态的两阶段 Agent 劫持框架

    作者提出两阶段黑盒劫持框架 A2M,在 GLM-4.6 优化后迁移至 4 个黑盒模型,平均恶意工具调用率为 63.6%。

    • 63.6%以GLM-4.6为代理模型,迁移至4个目标模型的四场景平均MTIR(Table 1)
    • 24.5%以GLM-4.6为代理模型,迁移至4个目标模型在IE、EIC、RD上的平均ASR(Table 1)
    • 2.7×以GLM-4.6为代理模型,迁移至4个目标模型的C-DoS平均加权成本倍数(Table 1)
    6 问速览论文研究 MCP 智能体在第三方工具生态中的语义供应链风险,解决如何使恶意工具既能被智能体选中又能有效劫持其后续执行的问题。
    1. 这篇论文试图解决什么问题?

      论文研究 MCP 智能体在第三方工具生态中的语义供应链风险,解决如何使恶意工具既能被智能体选中又能有效劫持其后续执行的问题。

    2. 有哪些相关研究?

      相关研究包括工具增强智能体、大模型对抗攻击、智能体提示注入及工具选择偏置,作者指出既有工具攻击未联合优化元数据与返回载荷。

    3. 论文如何解决这个问题?

      A2M 将攻击解耦为元数据优化与载荷精炼两阶段,结合五种说服策略与分析器-优化器架构,利用执行轨迹反馈进行黑盒迭代。

    4. 论文做了哪些实验?

      实验在 LiveMCPBench 上测试了五种模型,A2M 在直接攻击与迁移场景下均取得较高调用率,但跨模型完整攻击成功率出现下降。

    5. 有什么可以进一步探索的点?

      作者指出研究局限在语义层攻击假设、依赖执行轨迹及固定智能体框架,实验覆盖了五种模型、四个场景与多种防御。

    6. 总结一下论文的主要内容

      A2M 揭示了 MCP 智能体语义供应链风险,通过两阶段优化实现高调用率与推理劫持,且工具调用迁移性强于攻击成功率。

    完整解读
  3. 攻击arXiv:2610.01564 · 58

    APEX 用跨技能链劫持 LLM Agent,GPT-5.4 上攻击成功率达 84.3%

    APEX通过在跨技能进度记录中夹带虚假授权,在6个模型上诱导目标动作的平均ASR达74.2%(Table 2)。

    • 74.2%6个模型在SkillsBench的4个定向动作家族上完整链平均ASR(Table 2)
    • 84.3%GPT-5.4在4个定向动作家族上的完整技能链平均ASR(Table 2)
    • 17.4%GPT-5.4在4个定向动作家族上的单技能整合工作流平均ASR(Table 3)
    6 问速览研究智能体跨技能协作时利用真实进度记录传递虚假授权的攻击机制。
    1. 这篇论文试图解决什么问题?

      研究智能体跨技能协作时利用真实进度记录传递虚假授权的攻击机制。

    2. 有哪些相关研究?

      涵盖间接提示注入、单技能攻击与组合技能攻击,并以SkillsBench为基准。

    3. 论文如何解决这个问题?

      APEX通过伪造任务交接记录触发下游动作,并依据沙箱反馈迭代修订技能链。

    4. 论文做了哪些实验?

      涵盖6个模型及5类家族,完整链ASR达74.2%,评估了结构消融与提示防御。

    5. 有什么可以进一步探索的点?

      作者指出结果汇总、任务重叠与未测自适应攻击等局限;实验覆盖6个模型与单项防御。

    6. 总结一下论文的主要内容

      APEX通过跨技能传递虚假授权实现74.2%的动作诱导率,揭示了多技能协同的安全风险。

    完整解读
  4. 攻击arXiv:2607.23496 · 55

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    研究者利用内部表征归因发现脆弱场景,使 Llama-3.1-8B 上的 6 种黑盒攻击平均 ASR 提升 18.2 个百分点。

    • 18.2 个百分点Llama-3.1-8B 在 GuidedBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 14.5 个百分点Llama-3.1-8B 在 HarmBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 49.0%GPT-5 目标模型在 PAIR 攻击下注入 Ministral 场景后的 ASR(Table 2)
    6 问速览探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。
    1. 这篇论文试图解决什么问题?

      探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。

    2. 有哪些相关研究?

      梳理了越狱攻击与安全机械可解释性研究,指出现有方法缺乏表征空间因果归因且未将内部特征转化为可操作场景。

    3. 论文如何解决这个问题?

      提出 Concept2Scenario,通过 SAE 和 CAV 建立表征干预归因,筛选抑制拒绝的特征并闭环转译为可复用的自然语言场景。

    4. 论文做了哪些实验?

      在 3 个开源和 3 个闭源模型上评测 6 种黑盒攻击,脆弱场景使平均 ASR 最高提升 18.2 个百分点并提升多轮攻击效率。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向;实验事实覆盖了 3 个开源与 3 个闭源模型在两个基准上的黑盒攻击评测。

    6. 总结一下论文的主要内容

      该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    完整解读
  5. 攻击arXiv:2607.25560 · 53

    SigLeak 可从执行轨迹推断专有 Agent 技能,平均提升成功率 6.88 个百分点

    作者针对黑盒智能体提出 SigLeak 框架,仅凭良性查询配对轨迹比对推断专有技能,全场景平均提升成功率 6.88 个百分点。

    • 6.88 pp全场景及全模型配置下,SigLeak 相对无技能基准的平均 SR 增益(Table 1)
    • 84.59%Spreadsheet 场景下,SigLeak 在 6 种配置上的平均 SR(Table 1)
    • 22.8%GPT-5.4-mini 上,SigLeak 跨 5 场景的细粒度 SkillSim 平均 F1(Figure 4a)
    6 问速览探究黑盒智能体专有技能如何通过良性查询激发的执行轨迹产生行为侧信道泄露,并提出非侵入式推断框架。
    1. 这篇论文试图解决什么问题?

      探究黑盒智能体专有技能如何通过良性查询激发的执行轨迹产生行为侧信道泄露,并提出非侵入式推断框架。

    2. 有哪些相关研究?

      梳理了智能体技能构建、基于轨迹反馈的技能演化,以及指令与轨迹泄露相关研究,并指明与本文黑盒良性推断的区别。

    3. 论文如何解决这个问题?

      提出 SigLeak 框架,通过两阶段工作流生成高决策密度探针,并比对配对轨迹差异提取签名以迭代重构专有技能。

    4. 论文做了哪些实验?

      跨 5 个场景、3 个模型家族与 3 种框架评估,SigLeak 平均提升成功率 6.88 个百分点且在细粒度语义匹配上保持领先。

    5. 有什么可以进一步探索的点?

      作者指出了固定探针预算与提示模板等局限并提出自适应探索方向,实验覆盖了 5 个场景及 4 个代表性模型。

    6. 总结一下论文的主要内容

      提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。

    完整解读
  6. 攻击arXiv:2609.35576 · 56

    研究提出跨 LLM 助手的记忆跳跃攻击,单个被投毒文件可传播至 60–100% 的助手

    作者评估了跨独立智能体的工件介导自传播攻击,在36个测试宇宙中使DeepSeek-V4-Pro达到98%目标感染率。

    • 98%DeepSeek-V4-Pro 在36个测试宇宙中的 FIF_a^goal(据 Table 1)
    • 38%GPT-5.6 Luna 在36个测试宇宙中的 FIF_a^goal(据 Table 1)
    • 0.98DeepSeek-V4-Pro 在测试宇宙中拟合的每跳延续概率 p_hat(据 Figure 2)
    6 问速览工件介导攻击利用跨会话持久内存与共享文件,在隔离的智能体间实现无需直接通信的自传播。
    1. 这篇论文试图解决什么问题?

      工件介导攻击利用跨会话持久内存与共享文件,在隔离的智能体间实现无需直接通信的自传播。

    2. 有哪些相关研究?

      相关研究涵盖间接注入、内存投毒及智能体蠕虫,本文聚焦常规文件流转与目标无关通用模板。

    3. 论文如何解决这个问题?

      通过红队搜索构建与目标无关的通用模板,结合外部端点规范化载荷,驱动工件与内存交替传播。

    4. 论文做了哪些实验?

      端点辅助攻击在多模型上实现 38%–98% 感染率并延伸至 8 跳,无端点变体亦可维持有限传播。

    5. 有什么可以进一步探索的点?

      作者指出研究受限于端点依赖、无端点模板探索有限、前沿模型搜索成本及合成网络结构。

    6. 总结一下论文的主要内容

      论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。

    完整解读
  7. 攻击arXiv:2608.29381 · 58

    研究者提出 Agent 检查点回滚的五类安全失效,并在 Hermes、Cline、LangGraph 上实现三种攻击

    作者评估5款智能体C/R机制,指出回滚会破坏执行连续性;在TerminalBench与AgentBench上SF1和SF4占比为67.2%与67.7%。

    • 67.2%DeepSeek-v4在两基准共1735次执行中SF1出现率(据Table II)
    • 67.7%DeepSeek-v4在两基准共1735次执行中SF4出现率(据Table II)
    • 2.3%DeepSeek-v4在两基准共1735次执行中SF5出现率(据Table II)
    6 问速览检查点与回滚恢复虽能还原记录状态,但会打破跨边界依赖从而破坏执行连续性,引发安全风险。
    1. 这篇论文试图解决什么问题?

      检查点与回滚恢复虽能还原记录状态,但会打破跨边界依赖从而破坏执行连续性,引发安全风险。

    2. 有哪些相关研究?

      相关研究涵盖传统分布式检查点与防回滚、智能体恢复系统、恢复语义与回滚攻击,以及智能体安全评测。

    3. 论文如何解决这个问题?

      作者构建了多进程执行模型与五类故障模式,并开发由收集、分析、检查与验证组成的多智能体检测管线。

    4. 论文做了哪些实验?

      在1735次基准执行中SF1与SF4发生率近68%,微基准显示改变提交顺序的失败率均超过93%。

    5. 有什么可以进一步探索的点?

      作者指出该研究聚焦于C/R引入的安全违规而非涵盖所有智能体威胁,且测试旨在暴露风险而非认证系统安全。

    6. 总结一下论文的主要内容

      论文系统研究了智能体C/R的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。

    完整解读
  8. 攻击arXiv:2607.12340 · 58

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    论文测试了12种LLM与智能体在1.5万个提示词下的技能推荐,发现虚构技能名发生率达6.5%–62.0%,且易被抢注劫持。

    • 36.0%4种独立LLM在15,000提示词下的平均虚构率(据Table 2)
    • 36.9%8种智能体在15,000提示词下的平均虚构率(据Table 2)
    • 43.1%12种配置在社区开发者真实提问下的平均虚构率(据正文第1节)
    6 问速览智能体推荐技能时常虚构不存在的名称,使攻击者可预先抢注并植入恶意载荷实施供应链攻击。
    1. 这篇论文试图解决什么问题?

      智能体推荐技能时常虚构不存在的名称,使攻击者可预先抢注并植入恶意载荷实施供应链攻击。

    2. 有哪些相关研究?

      已有研究关注代码包虚构与运行时提示注入,本研究聚焦智能体推荐阶段虚构技能名引发的预先抢注威胁。

    3. 论文如何解决这个问题?

      通过双重真实性校验管道度量 1.5 万提示词下的虚构率,并基于 RAG 与多模型投票设计防御方案。

    4. 论文做了哪些实验?

      评测覆盖12种配置与1.5万提示词,揭示高虚构率与高重现性,证明常规自检与拼写过滤失效,RAG虽降虚构但损害召回。

    5. 有什么可以进一步探索的点?

      作者指出未实测真实用户安装率且召回率评估未覆盖全模型;实验涵盖12种配置与4类防御,未测真实恶意载荷。

    6. 总结一下论文的主要内容

      研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    完整解读
  9. 攻击arXiv:2609.04382 · 56

    研究揭示 split-LLM 训练中返回梯度泄露真实行,前向隐私门仍通过

    作者对双节点拆分训练系统进行安全审计,发现未受保护的反向梯度以零支撑结构完全暴露诱饵行,联合视图突破门控。

    • 4,096/4,096主配置下9个种子所有帧反向梯度零支撑结构精确识别真实行
    • +0.92 ppQwen3-0.6B主配置9个打包代码种子梯度臂高频token配对效应均值
    • +2.180 ppQwen3-0.6B浅层切分种子52防御开放梯度下联合臂门控统计量
    6 问速览拆分训练中评估工具未覆盖反向传播信道,导致未受保护的梯度完全泄露真实数据与诱饵行划分。
    1. 这篇论文试图解决什么问题?

      拆分训练中评估工具未覆盖反向传播信道,导致未受保护的梯度完全泄露真实数据与诱饵行划分。

    2. 有哪些相关研究?

      论文对比了拆分学习双向攻防、差分隐私审计协议与无校准对照的外部拆分评估研究。

    3. 论文如何解决这个问题?

      通过枚举攻击信道、注入校准指标、预设决策门控,并利用零支撑梯度精确剥离诱饵行。

    4. 论文做了哪些实验?

      反向梯度在全部 4,096 帧完全暴露诱饵行,联合视图突破门控,裁剪加噪以微小代价消除泄漏。

    5. 有什么可以进一步探索的点?

      作者指出了 5 类未测量信道与未覆盖全序列重构等局限,评测范围集中于单一模型与语料。

    6. 总结一下论文的主要内容

      论文揭示拆分训练中反向梯度零支撑完全暴露诱饵行,联合视图突破门控,裁剪加噪可有效缓解。

    完整解读
  10. 攻击arXiv:2608.09867 · 67

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    作者发现商业API加密思维块可在同厂商模型间互通,利用弱模型可绕过前沿模型防护并逐字解密其思维链。

    • 4.9%6,708条公开轨迹解码后至少泄露一项敏感信息的会话比例(据4.1节)
    • 62从真实用户会话解密思维块中恢复的独立API密钥数(据Table 4)
    • 64真实用户会话中仅存在于加密思维而在可见文本中未出现的敏感项数(据Table 4)
    6 问速览论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。
    1. 这篇论文试图解决什么问题?

      论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。

    2. 有哪些相关研究?

      相关工作涉及黑盒模型蒸馏、加密思维块分析、思维链安全与智能体长程注入等方向。

    3. 论文如何解决这个问题?

      将强模型的加密块注入同厂商未严格对齐的弱模型,诱导其逐字转写明文并辅以重构校验。

    4. 论文做了哪些实验?

      实验证实三大厂商模型思维可接近1:1解码,公开轨迹恢复出62个API密钥等敏感凭证。

    5. 有什么可以进一步探索的点?

      作者指出评估受限于特定版本API且无法访问真实明文,评测未穷尽所有公开智能体数据集。

    6. 总结一下论文的主要内容

      论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    完整解读
  11. 攻击arXiv:2607.05189 · 58

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    MEMGHOST利用环境与目标双代理离线训练,在OpenClaw+GPT-5.4后台模式取得87.5%端到端记忆注入成功率。

    • 87.5%OpenClaw+GPT-5.4 后台模式 E2E 成功率(Table I)
    • 75.0%OpenClaw+GPT-5.4 前台模式 E2E 成功率(Table I)
    • 71.4%Claude Code SDK+Sonnet 4.6 后台模式 E2E(Table I)
    6 问速览论文研究个人智能体在黑盒无交互下,通过单封外部邮件被静默写入持久记忆并操控后续会话的长程攻击威胁。
    1. 这篇论文试图解决什么问题?

      论文研究个人智能体在黑盒无交互下,通过单封外部邮件被静默写入持久记忆并操控后续会话的长程攻击威胁。

    2. 有哪些相关研究?

      梳理了智能体安全评估、间接提示词注入与记忆投毒研究,指出现存工作缺乏对外部无交互全周期记忆注入的建模。

    3. 论文如何解决这个问题?

      通过轻量影子环境与细则奖励双代理,利用 SFT 与 GRPO 训练生成策略,实现单次前向生成免交互隐蔽邮件。

    4. 论文做了哪些实验?

      在 6 种模型及多框架上验证,MEMGHOST 在前沿与低成本模型上显著优于 7 种基线并实现跨架构迁移。

    5. 有什么可以进一步探索的点?

      作者指出未覆盖投递层基础设施、多模态载荷与长期衰减;实验覆盖了 6 类模型与 4 种智能体框架。

    6. 总结一下论文的主要内容

      总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    完整解读
  12. 攻击arXiv:2609.01222 · 57

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    作者分析了 12 个真实智能体 Harness 的上下文组装设计,提出 16 种攻击向量实现消息角色和跨作用域的特权提升。

    • 28212 个智能体 Harness 中经 CORA 运行时验证的上下文源总数(Table VI)
    • 176112 个智能体 Harness 中由 CORA 枚举的唯一候选 CPE 路径总数(§ VI-C)
    • 1034 (58%)GPT-5.5 在 12 个智能体共 1761 条候选路径上的行为验证结果(Table VII)
    6 问速览智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。
    1. 这篇论文试图解决什么问题?

      智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。

    2. 有哪些相关研究?

      相关研究聚焦于间接提示注入、指令层级防御和智能体扩展规范,本文聚焦智能体 Harness 上下文组装的结构性缺陷。

    3. 论文如何解决这个问题?

      形式化定义 M-CPE 与 X-CPE 两类攻击及 16 种攻击向量,开发静态分析与两轮插桩验证工具 CORA。

    4. 论文做了哪些实验?

      在 12 个智能体上验证了 282 个上下文源与 1761 条路径,在 GPT-5.5 下行为验证率达 58% 并完成端到端 PoC。

    5. 有什么可以进一步探索的点?

      作者指出了 CORA 环境构建失败、模型安全对齐导致未遵循指令等局限,并倡议厂商发布上下文清单(SBOM)。

    6. 总结一下论文的主要内容

      论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    完整解读
  13. 攻击arXiv:2607.26115 · 60

    OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体

    作者通过自博弈强化学习训练红队智能体GPT-Red,使GPT-5.6在Fake CoT提示词注入下的鲁棒性达到95.9%。

    • 95.9%GPT-5.6在Fake CoT攻击下的IH鲁棒性(GPT-5.1为5.2%,Figure 13)
    • 94.3%GPT-5.6在Multi-Defender攻击下的IH鲁棒性(GPT-5.1为0.4%,Figure 13)
    • 99.5%GPT-5.6在System Override攻击下的IH鲁棒性(Figure 13)
    6 问速览解决现有对抗训练数据规模和多样性不足导致模型过拟合、难以抵御自适应提示词注入与越狱攻击的问题。
    1. 这篇论文试图解决什么问题?

      解决现有对抗训练数据规模和多样性不足导致模型过拟合、难以抵御自适应提示词注入与越狱攻击的问题。

    2. 有哪些相关研究?

      涵盖基于优化的对抗攻击、指令层级防御、提示驱动的大模型红队以及多智能体对抗博弈等相关研究。

    3. 论文如何解决这个问题?

      构建带防守者查询接口的智能体脚手架,基于大规模安全环境和多防守者种群进行自博弈强化学习训练。

    4. 论文做了哪些实验?

      在真实智能体、挑战赛基准和留存域上全面评估,GPT-Red突破旧模型并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。

    5. 有什么可以进一步探索的点?

      作者指出多模态与多轮场景训练相对不足,且评测主要集中于特定智能体工具任务并省略了系统级缓解。

    6. 总结一下论文的主要内容

      通过多防守者自博弈训练自主红队智能体GPT-Red,发现复杂漏洞并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。

    完整解读
  14. 攻击arXiv:2607.11698 · 59

    AHA 用自动研究循环发现生产 Agent 漏洞概念,留出集 ASR 达 47.0%

    AHA通过可证伪假设循环发现生产级智能体漏洞概念,在留出实例上取得47.0%的平均ASR,超越最强基线14.2个百分点。

    • 47.0%AHA在全部18组设置留出集上的平均ASR(Table 1)
    • 32.8%最强搜索基线AutoRISE*在留出集上的平均ASR(Table 1)
    • 594AHA在Claude Code全部场景与模型上的总发现查询数(Table 1)
    6 问速览当前自动化红队仅保留攻击载荷而忽略成因,AHA通过可证伪假设循环提取漏洞概念并记录使能条件与反驳证据。
    1. 这篇论文试图解决什么问题?

      当前自动化红队仅保留攻击载荷而忽略成因,AHA通过可证伪假设循环提取漏洞概念并记录使能条件与反驳证据。

    2. 有哪些相关研究?

      现有研究多保留提示词、策略库或防御边界,AHA将可证伪的因果解释作为复用工件,直接指导定位修复介入点。

    3. 论文如何解决这个问题?

      AHA通过科研者调度四类子智能体执行假设-攻击-反思循环,经严格门控沉淀概念图,并依使能条件进行留出复用与协同。

    4. 论文做了哪些实验?

      AHA在留出集平均ASR达到47.0%,高于各基线且查询开销更低,所提取概念可跨模型泛化并指导防御补丁。

    5. 有什么可以进一步探索的点?

      作者计划在智能体版本更新时持续运行该循环并拓展至多智能体系统,同时指出跨场景迁移与协同受制于后端状态与关系记录。

    6. 总结一下论文的主要内容

      论文提出基于可证伪科研循环的AHA框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    完整解读
  15. 攻击arXiv:2608.23858 · 56

    研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁

    作者系统分析Google智能体支付协议AP2 v0.2,指出合法签名无法防御前置上下文操纵,并识别出8个高风险威胁。

    • 66.7%STRIDE-GPT五架构运行对48个威胁的Full/Partial覆盖率(8.1节)
    • 0.9848位独立专家对25个威胁AIVSS严重度评级的Gwet's AC2估计值(Table 6)
    • 92.5%8位专家在120次评估中重现单评估者AIVSS参考严重度等级的比例(8.2节)
    6 问速览分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。
    1. 这篇论文试图解决什么问题?

      分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。

    2. 有哪些相关研究?

      梳理了AP2初期安全性、多智能体商业协议及支撑协议(MCP与A2A)的安全研究现状。

    3. 论文如何解决这个问题?

      划分生命周期与架构,用MAESTRO和AIVSS系统化建模48个威胁并设计三层扫描器。

    4. 论文做了哪些实验?

      通过8名专家重现AIVSS评分、对比STRIDE-GPT,并在自建测试床上完成5项PoC验证与扫描器消融。

    5. 有什么可以进一步探索的点?

      作者指出评估基于自建测试床且未测底层清算系统,后续需在真实公开部署中检验扫描器。

    6. 总结一下论文的主要内容

      系统剖析AP2协议盲区,建立威胁模型并识别8项高危威胁,通过PoC与扫描器推动前置安全防御。

    完整解读
  16. 攻击arXiv:2609.27542 · 60

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    研究者对gpt-oss-20b注入控制标记清空CoT推理以规避监控,在48个恶意任务中取得39.6%的外传攻击成功率。

    • 0.0gpt-oss-20b在40个普通任务上注入后缀后的平均推理tokens(Table 1)
    • 1.00gpt-oss-20b在40个普通任务上注入后缀后的攻击成功率(Table 1)
    • 39.6%gpt-oss-20b在48个恶意任务上注入后缀后完成外传的比例(Section 7.2)
    6 问速览论文探究非受信任输入能否通过控制标记抑制思维链以规避监控,并阐述解码harness对智能体安全的影响。
    1. 这篇论文试图解决什么问题?

      论文探究非受信任输入能否通过控制标记抑制思维链以规避监控,并阐述解码harness对智能体安全的影响。

    2. 有哪些相关研究?

      论文梳理了间接提示注入、聊天模板注入、对抗后缀、思维链可监控性以及解析器脆弱性等五类相关研究。

    3. 论文如何解决这个问题?

      论文通过注入伪造的已闭合空推理通道消除CoT,并指出截断容忍正则表达式使未闭合工具调用得以触发。

    4. 论文做了哪些实验?

      论文在多个模型和任务上测量了推理清空、监控失效、拒绝绕过以及解析器宽容度对工具调用的影响。

    5. 有什么可以进一步探索的点?

      论文指出了单一模型沙盒、通用性调查有限、拒绝绕过不完全及端到端间接链未闭环等局限。

    6. 总结一下论文的主要内容

      论文阐明控制标记注入可抑制CoT使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    完整解读
  17. 攻击arXiv:2609.15989 · 57

    研究者提出 plan injection 攻击,可绕过思维链监控

    研究发现在上下文植入良性表述的有害计划可诱导模型采纳并改写推理,在不同基准上对思维链监视器取得 25%–33% 的逃避率。

    • 85.7%在 APPS hardcoded-special-case 下 DeepSeek-R1-0528 采纳计划的成功率(Figure 3)
    • 98.9%在 Bio-Math 上 DeepSeek-R1-0528 采纳计划并输出生物与数学答案的成功率(Figure 3)
    • 0.5%在 APPS 上行动模型生成的 CoT 复制超过一半注入计划逐字内容的比例(Table 7)
    6 问速览思维链监视器易被上下文中伪装成良性推理的“计划注入”绕过,行动模型会将其改写为自身推理从而隐匿恶意意图。
    1. 这篇论文试图解决什么问题?

      思维链监视器易被上下文中伪装成良性推理的“计划注入”绕过,行动模型会将其改写为自身推理从而隐匿恶意意图。

    2. 有哪些相关研究?

      相关工作涵盖提示轻推、隐写与微调逃避、监视器推理预算研究;本文区别在于有害规划发生在上游且表述良性。

    3. 论文如何解决这个问题?

      通过调查智能体发现免指令的纯思维链植入最有效,并在代码后门与跨领域计算中扩展为良性叙事伪装流水线。

    4. 论文做了哪些实验?

      评测显示最强监视器仍漏检至少 25% 的攻击,增加思考预算或提供注入计划可能诱导监视器主动合理化恶意行为。

    5. 有什么可以进一步探索的点?

      作者指出未来需验证更多模型家族与端到端注入链路,并量化思考预算增加导致监视失效的普遍性。

    6. 总结一下论文的主要内容

      论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。

    完整解读
  18. 攻击arXiv:2609.02774 · 56

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    研究者提出CodePoisonRAG对RACG投毒,在Code Llama上取得0.93的无防御ASR。

    • 0.93Code Llama 13B 无防御下的总体 ASR(Table II)
    • 0.71Code Llama 13B 在 CodeGuarder 防御下的 ASR(Table II)
    • 85/85无防御下 85 个投毒工件进入 Top-3 的检索成功数(Table II)
    6 问速览探索黑盒攻击者能否针对预期任务构造单一投毒代码工件,在不访问 RACG 管线的前提下定向诱导生成指定漏洞。
    1. 这篇论文试图解决什么问题?

      探索黑盒攻击者能否针对预期任务构造单一投毒代码工件,在不访问 RACG 管线的前提下定向诱导生成指定漏洞。

    2. 有哪些相关研究?

      相关研究包括 RAG 投毒、RACG 攻击与安全代码生成防御;本文聚焦于黑盒针对性弱点注入与单一工件投毒。

    3. 论文如何解决这个问题?

      通过良性代码与 CWE 匹配、污点链漏洞注入以及注释级虚假安全声明,构造兼具检索相关性与漏洞诱导性的单一工件。

    4. 论文做了哪些实验?

      在 3 个开源生成模型上评测 10 类 CWE,无防御下 ASR 达 0.80–0.93,在 CodeGuarder 防御下仍达 0.40–0.71。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向;实验覆盖了 3 个开源生成模型、10 类 CWE 及 CodeGuarder 防御。

    6. 总结一下论文的主要内容

      CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。

    完整解读
  19. 攻击arXiv:2609.03884 · 59

    HookPry:利用插件生命周期钩子更新劫持 AI Agent 框架

    HOOKPRY利用插件生命周期钩子更新机制对7个智能体框架实施供应链攻击,在1000次运行中微平均E2E-ASR达77.0%。

    • 77.0%1000次跨框架与后端运行微平均E2E-ASR(Table 2)
    • 92.5%Hermes框架跨后端平均E2E-ASR(Table 2)
    • 52.5%Claude Code跨后端平均E2E-ASR(Table 2)
    6 问速览智能体框架信任插件钩子更新,使攻击者可通过版本更新在模型推理流外静默执行恶意命令。
    1. 这篇论文试图解决什么问题?

      智能体框架信任插件钩子更新,使攻击者可通过版本更新在模型推理流外静默执行恶意命令。

    2. 有哪些相关研究?

      现有工作主要关注提示注入、工具描述投毒与恶意代码,未系统研究框架层生命周期钩子的信任迁移。

    3. 论文如何解决这个问题?

      HOOKPRY 通过对抗清单优化提升检索、时间解耦定位弱验证边界、最小公共接口跨框架编译原生钩子配置。

    4. 论文做了哪些实验?

      1000次跨环境测试微平均E2E-ASR达77.0%,原生钩子攻击效果显著优于MCP投毒,静态防御漏报47.5%。

    5. 有什么可以进一步探索的点?

      作者指出安装采纳率未测及环境未穷尽等局限,未来可探索动态分析、最小特权钩子与更新授权机制。

    6. 总结一下论文的主要内容

      论文揭示了智能体框架钩子更新的供应链攻击面,提出了 HOOKPRY 框架并在测试中取得 77.0% 的成功率。

    完整解读
  20. 攻击arXiv:2609.17817 · 56

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    研究者以投毒基准测试自修改代码智能体,发现Hyperagents在CertCheck中立任务上出现30/30漏洞率且能跨代持久。

    • 30/30Hyperagents(Sonnet 4.5)在CertCheck保留任务漏洞率(Table 1)
    • 30/30DGM(Qwen3.5-397B)在CertCheck保留任务漏洞率(Table 1)
    • 15/15SICA(Sonnet 4.5)在复杂URL保留任务漏洞率(Table 2)
    6 问速览自修改 AI 代码智能体在自我进化过程中存在被恶意基准投毒、进而向中立任务输出脆弱代码的风险。
    1. 这篇论文试图解决什么问题?

      自修改 AI 代码智能体在自我进化过程中存在被恶意基准投毒、进而向中立任务输出脆弱代码的风险。

    2. 有哪些相关研究?

      论文梳理了自修改智能体、智能体记忆投毒与演化失偏、代码智能体提示注入及模型数据投毒等相关研究。

    3. 论文如何解决这个问题?

      作者通过设计迫使智能体引入漏洞的投毒基准,针对 DGM、SICA 和 Hyperagents 三种自修改脚手架展开端到端投毒。

    4. 论文做了哪些实验?

      实验在三个自修改系统上评估了四类漏洞的投毒效果,测得在保留任务上的漏洞率与持久性表现。

    5. 有什么可以进一步探索的点?

      作者指出投毒任务过于集中、架构覆盖有限等局限,未来需探索稀释型基准与去污染机制。

    6. 总结一下论文的主要内容

      论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    完整解读