跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 6 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2610.04195 ·

    MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露

    评估多租户智能体共享向量记忆的跨用户泄露与主动桥接

    测试
    Gemini 2.5 Flash、Claude Sonnet 4.5、all-MiniLM-L6-v2 等 5 个应用层
    场景
    AI Agent
    摘要论文揭示共享向量库导致的跨用户语义泄漏,指出常识构造攻击可达90–100%命中,而硬所有权门控能以低延迟恢复隔离。
    • 论文定位:论文研究企业多租户 AI 智能体共享向量记忆库时,由于嵌入空间语义接近而导致的跨用户记忆非对抗性泄漏与主动利用风险。
    • 要解决的问题:现有智能体记忆系统通常将用户数据混存在同一向量库中并通过软元数据过滤,作者指出这打破了多租户物理隔离,使得普通余弦相似度检索便可将他人的隐私记忆注入当前用户会话。
    • 方法核心:形式化跨用户可采纳性失效,构建覆盖 4 级组织距离(T0–T3)与 4 种敏感业务场景的基准集,对比被动泄漏与基于常识角色构造的主动桥接攻击,并评估多层缓解机制。
    • 核心实验结果:
      1. 在 MiniLM-L6-v2 池化检索下,同团队 T0 被动泄漏率为 70% [40%, 89%],同部门 T1 和跨部门 T2 达 90% [60%, 98%],而跨公司 T3 降至 10% [2%, 40%](Table 3)。
      2. 主动构造记忆在 MiniLM 下实现 90–100% 的 top-k 命中率,平均检索分数比有机基线提高 +0.416 至 +0.511(Table 2);在薪酬场景下仅需领域常识即达 90% 命中率,逼近逐字抄袭上限的 100%(Table 10)。
      3. 端到端检索生成导致 Gemini 2.5 Flash 回答污染度升至 5.00/5(满分 5 分,干净基准为 1.00),Claude Sonnet 4.5 达 4.67/5,且受污染回答被判定为同等或更有用(Table 5)。
      4. 后检索硬所有权门控(M3)将攻击命中率降至 0% 并将两款模型的回答污染度完全恢复至 1.00/5(Table 7、Table 8),平均检索延迟开销仅增加约 1.4 ms(Table 14)。
    • 作者结论与启示:作者认为在共享向量库中仅凭语义相似度无法界定数据访问权限,当共享范围扩大至恶意成员时元数据过滤亦会失效;系统设计者必须在向量存储、嵌入及检索后实施分层防御,并联合评估检索架构与下游模型。
    完整解读
  2. 攻击arXiv:2609.26761 ·

    A2M:针对 MCP 生态的两阶段 Agent 劫持框架

    提出两阶段框架A2M,优化MCP工具元数据与返回载荷以劫持智能体

    测试
    GLM-4.6、Qwen3-Max、DeepSeek-V3.1 等 5 个应用层
    场景
    AI Agent
    摘要A2M 揭示了 MCP 智能体语义供应链风险,通过两阶段优化实现高调用率与推理劫持,且工具调用迁移性强于攻击成功率。

    论文提出了一种针对模型上下文协议(MCP)智能体的两阶段黑盒劫持框架 A2M。

    • 问题背景:MCP 智能体自主从第三方服务匹配工具并信任执行返回,带来了语义元数据与输出载荷双重受控的供应链安全隐患,而现有攻击未能有效串联工具选择与调用后操纵。
    • 方法核心:A2M 将攻击解耦为吸引与操纵两阶段;前期运用五类说服策略迭代工具名称与描述,筛选高调用率精英元数据;后期依托分析器-优化器架构,根据执行轨迹的结构化诊断反馈定向精炼返回载荷。
    • 直接攻击结果:在 LiveMCPBench 上以 GLM-4.6 为目标模型,A2M 的平均恶意工具调用率达到 93.6%,C-DoS 加权 token 成本扩大至良性基线的 32.4 倍,IE、EIC 和 RD 的攻击成功率分别达到 65.9%、64.3% 和 92.9%(Table 1)。
    • 迁移攻击结果:将 GLM-4.6 上优化的工具直接迁移至 Qwen3-Max、DeepSeek-V3.1、Kimi-K2-0905 和 GPT-5 四个模型,平均调用率为 63.6%,C-DoS 平均成本为 2.7 倍,三个场景平均攻击成功率为 24.5%(Table 1)。
    • 高调用与成功断层:实验显示工具调用并不等同于攻击成功,如 GPT-5 在 64.9% 至 76.3% 的调用率下 IE 和 EIC 的成功率均为 0.0%(Table 1);未成功攻击中载荷被忽略为主要失效原因(Table 8)。
    • 防御与生态启示:评估显示困惑度检测与元数据释义难以完全阻断攻击,信息流控制虽能降低攻击成功率但仍存残余风险;作者呼吁 MCP 生态应建立更为严格的工具准入审查与运行时隔离机制。
    完整解读
  3. 攻击arXiv:2607.12340 ·

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链

    测试
    GLM-4.5-Air、GPT-5.4-mini、Claude Sonnet 4.6 等 10 个应用层
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    完整解读
  4. 攻击arXiv:2609.03884 ·

    HookPry:利用插件生命周期钩子更新劫持 AI Agent 框架

    提出HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令

    测试
    Claude Sonnet 4.6、DeepSeek-V4-Pro、Kimi-K2.6 等 6 个应用层
    摘要论文揭示了智能体框架钩子更新的供应链攻击面,提出了 HOOKPRY 框架并在测试中取得 77.0% 的成功率。
    • 论文定位:该研究揭示了现代 AI 智能体框架在插件生命周期钩子更新路径上的信任失效,提出了首个跨框架自动化的生命周期钩子供应链攻击框架 HOOKPRY。
    • 解决的问题:智能体框架将系统 Shell 命令绑定至运行时事件,且在框架底层独立派生子进程,绕过了大语言模型的推理闭环;框架在插件更新时继承既有信任,使攻击者可通过元数据和钩子配置更新静默植入并执行恶意命令。
    • 方法要点:HOOKPRY 串联三项机制:对抗清单优化(AMO)利用多意图代理目标提升良性插件检索概率;时间解耦(TD)利用良性探针定位低验证高权限的信任边界并实施条件激活;最小公共接口(LCI)提取通用能力规范并编译为目标框架的原生钩子配置。
    • 关键实验结果:
      • 在 7 个框架与 5 个后端的 1,000 次端到端测试中,HOOKPRY 微平均 E2E-ASR 达到 77.0%,在 Hermes 上达到 92.5%,在 Claude Code 上为 52.5%(Table 2)。
      • 在跨模型测试中,Codex CLI 的后端间标准差为 0.0 个百分点,Claude Code 为 2.5 个百分点,体现了事件触发后执行路径与模型的解耦特性(Figure 5)。
      • 在 50 个目标对比中,HOOKPRY 原生钩子的 E2E-ASR 为 92.0%,显著高于转换后 MCP 描述投毒的 56.0%(单侧二项检验 p = 7.09×10⁻¹²,Table 4)。
      • 在 40:40 静态测试中,Microsoft Defender 召回率为 0.0%,三款静态防御联合漏报率达到 47.5%(Table 6)。
    • 作者结论与启示:作者指出,模型层的内容安全过滤无法触及推理流之外的钩子执行;智能体安全必须将插件更新审查、钩子独立重新授权、子进程最小特权分配与运行时监控纳入全链路防护。
    完整解读
  5. 攻击arXiv:2609.02035 ·

    ISM:通过语义匹配隐式操纵 LLM Agent 的技能选择

    提出ISM,协同改写技能描述与提示词以隐式操纵技能选择

    测试
    Llama-2-7B、Llama-3-8B、Llama-3.1-8B 等 8 个应用层
    场景
    AI Agent
    摘要论文针对大模型智能体技能选择阶段提出隐式操纵方法ISM,验证了其在8个模型上的选择提升与隐蔽性,探讨了选择阶段的防御启示。
    • 研究定位与核心问题:论文针对大模型智能体在执行前依据语义匹配分配技能的机制,分析了无需显式指令即可偏置技能选择的隐式攻击面,指出现有显式提示注入易被审查识别的问题。
    • 核心方法设计:提出了双端协同操纵方法 ISM,通过跨请求频次与任务相关性提取任务线索以扩大覆盖面,注入罕见技术钩子拉开与同领域技能的区分度,并利用四大语义关系桥进行受限改写,使提示词自然化并规避人工与检测器审查。
    • 主要实验结果:
      1. 在 8 个选择器模型与 4 个任务领域中,ISM 将宏观平均目标选择率从 Native 的 15.2% 提升至 63.5%(绝对提升 48.3 个百分点,Table 1)。
      2. 在匹配对比中,ISM 达到 73.5% 的选择率,仅比显式引导 Explicit Steering(83.3%)低 9.8 个百分点(Figure 7(a))。
      3. 人工评审对 ISM 的拦截率仅为 2.9%(显式引导为 91.4%),5 个大模型审查器的平均通过率达 82.9%(Figure 8, Table 5)。
      4. 现有规则防御中,Prompt Guard 2 与 PIGuard 防御后 ISM 的目标选择率仍分别残留 47.8% 和 46.9%,且伴随 26.5% 和 37.5% 的良性误报率(Figure 9)。
    • 结论与启示:作者认为,技能选择环节决定了哪项功能进入智能体的下游执行流,应将其视作关键的安全边界;单纯依赖文本级检测或显式指令识别无法有效防御基于语义匹配的隐式操纵,未来的智能体安全架构需从选择完整性出发设计联合防御机制。
    完整解读
  6. 攻击arXiv:2608.30441 ·

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹

    测试
    DeepSeek、GPT-4o、Claude 4.8 Opus 等 7 个应用层
    场景
    AI Agent攻击者黑盒
    摘要论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。
    • 研究定位:针对基于大语言模型、需要多步工具调用的长任务智能体系统,研究兼顾高隐蔽性与执行可控性的新型提示词注入攻击机制与评测基准。
    • 核心解决问题:化解现有直接注入因意图过于显式易被安全审查拦截、而分布式间接注入因长序列累积误差导致执行脱轨的固有矛盾。
    • 方法关键设计:提出 ECLIPSE 框架,在离线沙盒中利用影子智能体合成并双阶段验证工具链,渲染为自然的单轮隐蔽用户请求;在工具侧通过静态工作流编码(SWE)改写描述建立状态依赖,并利用动态轨迹校正(DTC)在执行偏离时注入残差修正信号。
    • 关键定量成果:在自建的 120 项长任务基准 LASE-Bench 上,ECLIPSE 对 DeepSeek 的无防御 ASR 达 96.7%、在外部安全过滤下达 69.2%(高出最强基线 27.5 个百分点,Table 2);在 Claude 4.8 Opus 带防御下达 62.4%(最强基线仅 0.8%,Table 2);在最新闭源模型 GPT-5.6 Luna 和 Claude Sonnet 5 带防御下分别达 52.5% 与 60.0%(Table 3)。
    • 迁移性与防御表现:在原生智能体系统 OpenClaw 与 Hermes 上,带防御 ASR 分别达到 61.7% 与 55.8%(Table 6、7);而在面对输入审查、工具边界隔离与轨迹监控防御时,仍能维持 43.3%–85.8% 的 ASR(Figure 6)。
    • 作者结论与启示:作者认为单点或局部的输入与工具过滤难以防范此类将恶意意图跨输入端、工具元数据与多步执行轨迹解耦的攻击,未来的智能体安全防御必须具备跨越多个信息源联合推理的能力。
    完整解读
已经到底了