跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 10 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2605.01970 ·

    Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

    提出Trojan Hippo Bench,评测智能体持久记忆攻击与防御

    测试
    Gemini 3.1 Pro、GPT-5-mini、GPT-5应用层
    场景
    AI Agent
    摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
    • 论文定位:本文提出了 Trojan Hippo Bench,一个针对大模型智能体持久化记忆攻击与内存层防御的动态评测基准与能力感知安全-效用分析框架。
    • 核心问题:持久化记忆使智能体能够跨会话留存用户私密信息,但引入了 Trojan Hippo 潜伏型数据窃取威胁;攻击者通过单次间接提示注入将载荷植入记忆,在经历多次良性会话后由敏感话题触发外发,而现有评测缺乏对跨异构内存后端及防御效用代价的系统考量。
    • 方法设计:基于 OpenEvolve 算法构建 MAP-Elites 风格黑盒自适应红队框架,针对特定后端与防御演化生成高穿透力攻击;同时定义了涵盖三维特征的 7 种良性能力流,提供算术均值、调和均值及部署画像的细粒度效用分解。
    • 主要实验发现:
      1. 在无防御条件下,Gemini 3.1 Pro 在经历 100 次良性会话后,ASR 在 Context 达 100%、Explicit 达 85%、RAG 达 85%、Mem0 达 80%(Table 3);GPT-5-mini 相应 ASR 为 15%–85%。
      2. 4 种内存层防御大幅削减攻击成功率,其中 Provable policy (IFC) 在全部配置下将 ASR 降至 0%,但因切断涉及收件箱的外发能力导致调和均值效用归零(HM = 0%)。
      3. Limit-memory-length 防御效果较弱,在 Gemini 3.1 Pro + Explicit 下 ASR 仍高达 85%,自适应攻击能将载荷压缩至 80 字符预算内;在 RAG 上保留了 89% AM 与 88% HM。
      4. GPT-5-mini 优化的攻击载荷零样本迁移至 GPT-5 时,在 RAG 和 Context 上分别获得 70.0% 和 35.0% 的 ASR(Table 4)。
    • 结论与启示:作者指出,单次投毒即可建立长期驻留的威胁,且内存层防御在安全与效用间存在权衡,不存在兼顾两者的单一通用解;防御选型必须依据实际部署环境所依赖的具体工作流进行针对性匹配。
    完整解读
  2. 攻击arXiv:2610.04589 ·

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用StegoMemory测试智能体持久记忆作为跨会话隐写信道的可行性

    测试
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个应用层
    场景
    AI Agent
    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
    • 论文定位:论文提出了 StegoMemory,系统评测大语言模型智能体持久化记忆被用作跨会话隐写隐蔽通信信道的安全风险。
    • 解决的核心问题:现有安全评估主要关注显式有害内容与提示词注入,忽视了攻击者利用良性交互在记忆中隐写编码并跨会话重构机密的信息流威胁。
    • 方法核心要点:通过主副任务配对与两会话隔离协议,测试 7 种隐写机制在 13 个模型中的编码、记忆写入持久化及后续良性检索恢复全流程,并配合任务完成与安全合规监视。
    • 主要实验发现:
      1. 在全基准 14,000 次试验中,20.1% 实现了合成机密的确切匹配恢复,且其中 71.4% 同时通过任务完成与独立安全监视(占全试验的 14.4%)。
      2. 13 个模型中有 12 个显示信息损耗集中在记忆写入持久化阶段而非检索阶段(写入阶段存活率为 29.8%,检索可恢复为 25.4%)。
      3. 模型低拒答率不等于高正确编码率,较弱模型在未拒答时大量产生格式错误编码(全模型平均格式错误率为 23.5%,拒答率为 20.6%)。
    • 作者结论与防御启示:作者认为持久化记忆应被视作安全边界而非被动存储介质,单靠表面响应监视无法保证信息流安全,防御应优先部署在记忆写入接口处,实施出处追踪、规范化与跨会话信息流审计。
    完整解读
  3. 评测与基准arXiv:2610.03585 ·

    宾州州立大学提出 TPRS,量化 Agent 安全基准中工具命名对 ASR 的影响

    提出TPRS,量化工具命名等表征变化对智能体安全基准得分的影响

    测试
    GPT-5-mini、Claude Haiku 4.5、GPT-4o-mini应用层
    场景
    AI Agent
    摘要论文审计了智能体安全基准的表征敏感性,发现工具命名变化可大幅改变 ASR,强调基准应评估表征变体。
    • 论文定位:这是一项针对大语言模型智能体安全基准测量有效性的审计研究,探究基准对威胁的表征设计对安全评估得分稳定性的影响。
    • 核心问题:现有多项基准使用攻击成功率(ASR)评估智能体鲁棒性并假定测量中立,但基准对工具命名、描述等表征的选择本身构成了模型输入,论文旨在探究底层安全问题不变时 ASR 分数在表征变换下的波动程度。
    • 方法设计:研究提出了威胁保持表征敏感性(TPRS),在严格固定任务、攻击目标、危害行为、环境与评测标准的前提下,针对 ASB、MCPTox 和 AgentDojo 构建了正字法、语义中立和线索改变等受控表征分支。
    • 主要发现:在 28,904 次运行中,ASB 中立化工具名使 GPT-5-mini 的 committed ASR 提升 11.67 个百分点、Claude Haiku 4.5 提升 13.21 个百分点(Table V);MCPTox 引入显式威胁命名使 GPT-5-mini 的 ASR 下降 11.00 个百分点,且形式匹配的中立名复现了 8.54 个百分点的降幅(Table VII);AgentDojo 上修改必需工具使 ASR 仅变化 -0.50 个百分点,但良性任务效用下降 5.36 个百分点(Table VIII)。
    • 作者结论与启示:作者认为基准测得的安全得分并非必然具有跨表征的泛化性,显式威胁词汇也无法完全解释敏感性;作者建议安全基准应将表征形式纳入评测设计,并在报告分数时包含表征敏感性指标与最差情况 ASR,而非依赖单一表征。
    完整解读
  4. 评测与基准arXiv:2608.09476 ·

    ActBench:面向协作智能体行为安全的自演化基准

    构建ActBench评测协作智能体多步执行中的操作级行为安全

    测试
    Claude-Opus-4.8、Claude-Sonnet-4.6、GPT-5.5 等 15 个应用层
    摘要ActBench通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
    • 定位与核心问题:论文提出了面向协同智能体操作级行为安全的自演化评测基准ActBench,旨在解决现有评测局限于单步拒答、覆盖孤立且缺乏因果归因与自适应优化的难题。
    • 核心方法设计:基于六个执行空间形式化15种行为风险传播路径,设计成对匹配的良恶性任务;采用几何奖励束搜索联合权衡攻击与效用,结合十类执行故障反思迭代修正载荷,并通过系统日志与轨迹因果重构实施双证据验证。
    • 模型决定安全主跨度:在固定OpenClaw框架下对15个基础模型执行24,000条轨迹评测,ASR呈现84.3个百分点的跨度,其中Claude-Opus-4.8取得最低的10.1%,而Deepseek-v4-Pro高达94.4%(Table 2)。
    • 执行框架无法弥补模型缺陷:在固定Deepseek-v4-Pro模型下替换6种协同框架,所有框架的ASR均处于73.7%至94.4%的高位(Table 3),表明框架层的提示或过滤难以阻止脆弱模型产生越权动作。
    • 防御边界与执行开销:上下文感知检测器AgentDoG展现出早于局部文本分类器的拦截能力,但存在漏报;同时,执行循环数和代币消耗的多少与各模型的安全排序并无必然关联(Table 4、Table 6)。
    • 结论与启示:作者认为协同智能体的行为安全主要取决于基础模型对对抗上下文的动作授权决策,良性任务效用与执行时长均不能作为安全指标的替代,未来防护必须从单点文本过滤转向结合工件分析与轨迹监控的纵深防御体系。
    完整解读
  5. 评测与基准arXiv:2607.20891 ·

    MisKnow-Agent 评测:单篇误导文档使 Deep Research 错误结论平均采纳率升至 54.7%

    提出MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识

    测试
    Gemini Deep Research、DeepSeek-V4 Pro、Qwen3.5-397B 等 4 个应用层
    场景
    AI Agent
    摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
    • 定位与核心问题:本文评估大语言模型长程研究(Deep Research)智能体在开放信息环境下的内容可靠性,重点探究智能体是否会在最终报告中采纳具有表面可信度但事实错误的误导性知识作为自身结论。
    • 方法设计要点:提出 MisKnow-Agent 受控评估框架,针对 DeepResearch Bench 的 100 个任务构建人工审核的虚假结论蓝图,生成跨 3 个权威层级与 4 种风格的误导文档,并经 5 个搜索验证模型交叉检验与人工质量筛选保留 5,933 篇文档;同时设计了前置验证提示与后置精炼智能体两阶段防御。
    • 暴露与来源影响:实验表明无注入对照下平均虚假结论采纳率(FCAR)为 0%,注入 1 篇误导文档即升至 54.7%(Figure 5);搜索结果排名位置对采纳率影响较小(Front 与 Back 仅差 1.7 个百分点),而在最终合成前引入误导文档使平均采纳率升至 85.5%(Figure 3);学术论文风格产生的采纳率最高(61.0%),较社交帖子高出 23.5 个百分点(Figure 4)。
    • 系统与框架差异:在默认高权威学术论文风格下,DeerFlow 平均 FCAR(67.0%)高于 WebThinker(55.0%),差距随模型智力指数提升而缩小,但采纳率与智力指数不呈单调关系(Table 3);Gemini Deep Research 同样表现出类似趋势,FCAR 在 1 篇时为 27%,在 3 篇时达到 54%(Figure 7)。
    • 防御表现与启示:前置提示、后置精炼及组合防御可将 DeerFlow 上的 FCAR 从基线的 60%–76% 降至 15%–62%,但无法完全消除采纳,且在 Intern-S1-Pro 上组合防御(62%)高于单项防御(Figure 7);作者认为仅靠隔离识别误导文档并不充分,必须将验证与修正机制贯穿于证据获取、中间研究状态和最终合成的全流程。
    完整解读
  6. 攻击arXiv:2607.05189 ·

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    测试
    GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个应用层
    场景
    AI Agent
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    完整解读
  7. 评测与基准arXiv:2608.12851 ·

    研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险

    构建SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险

    测试
    Claude Code、Codex、Hermes 等 6 个应用层
    摘要论文形式化了自进化智能体的技能错误进化风险,提出生命周期评测基准,实验中治理机制将留存危害降至4.00%。

    这篇论文研究了自进化大语言模型智能体中因吸收不安全经验而导致的持久性策略失效——技能错误进化(Skill Misevolution)。

    完整解读
  8. 攻击arXiv:2608.06862 ·

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个应用层
    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
    • 定位:论文研究了计算机使用智能体(CUA)中由持久化工件自主生成引发的内部供应链安全风险。
    • 核心问题:现代 CUA 依赖自主编写并复用技能等持久工件来扩展能力,若底层模型受到供应链攻陷,可能在良性任务中生成带潜伏载荷的自合成工件,使得恶意行为无需外部新输入即可在后续任务中跨步激活。
    • 方法设计:提出 SYNCHAIN 框架,通过面向持久化的定向 SFT,将恶意逻辑潜伏编码在良性工件的结构冗余中;工件被纳入系统扩展状态后,通过状态转移实现严格的延迟激活。
    • 核心实验发现:在 OpenClaw、Codex 和 Claude Code 三个框架下,SYNCHAIN 在 Chain-1 无防御设置下取得 97.78%–98.89% 的平均 ASR,在 GuardAgent 下仍保持 87.78%–93.33%;在 Chain-2 取得 72.59% 的平均 ASR,显著优于适配基线 SkillJect 和 DemonAgent。
    • 传播边界与衰减:在更长任务链中,受上下文截断和记忆总结等信息瓶颈影响,Chain-4 与 Chain-5 的 ASR 分别回落至 6.67% 与 1.11%,表明跨任务传播存在天然的马尔可夫衰减边界。
    • 作者结论与启示:作者认为,持久性改变了智能体的安全边界,传统的单步输入过滤和输出审查无法防御内部工件传递的风险,未来需构建结合工件签名、权限约束与执行轨迹审计的来源感知防御。
    完整解读
  9. 攻击arXiv:2609.30383 ·

    研究者提出技能级联攻击,在 OpenClaw、Claude Code 与 Codex 上平均成功率 89.4%

    提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测

    测试
    GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 10 个应用层
    摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
    • 研究定位:该研究聚焦基于技能的大语言模型智能体生态,形式化并实证评估了将攻击目标分散于多个技能中的技能级联攻击威胁。
    • 核心问题:现代智能体通过共享上下文窗口跨技能传递数据,现有安全防御均基于单技能审查假设,无法发现单个技能看似正常但多技能协同产生危害的安全风险。
    • 方法架构:作者设计了由场景发现、攻击生成、隔离扫描、测试构造和沙箱裁决等 5 个智能体构成的闭环红队框架 SKILLCASCADE,构建并开源了包含 213 个测试用例的 SKILLCASCADE-BENCH 基准。
    • 关键实验结果:在 OpenClaw、Claude Code 与 Codex 配合 8 种骨干模型的 24 种配置下,级联攻击平均 ASR 达到 89.4%(Table 2);面对 5 款单技能扫描器,修改后技能的隐蔽率保持在 86.6% 以上(Table 3);面对 4 种运行时防御框架,平均逃逸率达 88.5%(Table 5);撤销三技能级联中任一修改,残余 ASR 降至 13–18%(Figure 4a)。
    • 作者结论与启示:作者认为组件级别的良性并不等同于系统整体的安全,现有多技能智能体系统在跨技能语义交互层面缺乏有效防护,呼吁安全研究从孤立的单技能审查转向跨技能交互分析与组合安全推理。
    完整解读
  10. 评测与基准arXiv:2609.35912 ·

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    构建多模态技能图像攻击基准MMSkillRisk并设计NCVA

    测试
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个应用层
    摘要论文提出MMSkillRisk基准与NCVA攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
    1. 研究定位与核心问题:本研究针对多模态智能体技能中图像引导可能成为攻击跳板的安全风险,构建了首个可执行的端到端评测基准 MMSkillRisk,系统探究智能体在依赖视觉参考完成任务时能否防御图像潜藏的未授权指令。
    2. 攻击设计与基准构建:作者提出原生上下文视觉攻击(NCVA),将未授权操作伪装成教学图中的原生标注、弹窗或标签,并通过文本提供中立位置引导;基于 28 个多模态技能构建了包含 5 类攻击目标、36 个受污染变体及 108 个用例的评测集,在 Docker 沙箱中通过多模态 LLM 独立评估攻击与任务完成度。
    3. 图像载荷攻击的高有效性:在评估的 9 种模型与框架配置中,NCVA 均诱发了未授权操作,其汇聚 ASR 达到 43.1%,比对应文本匹配基线高出 16.4 个百分点;其中 Codex 搭配 GPT-5.6-sol 的 ASR 达到 81.5%,而 Claude Code 搭配 Claude Opus 4.6 表现出最低的 ASR(12.0%)。
    4. 攻击与良性任务高度共存:评测显示汇聚任务兼容攻击成功率(TC-ASR)达到 36.5%,在 Codex 搭配 GPT-5.6-sol 配置下更是高达 72.2%,作者指出这反映出智能体能够在顺利完成用户合法需求的同时提交危险操作,良性任务完成无法作为安全评判凭据。
    5. 行为转化链路与载体互补性:轨迹分析表明智能体对视觉材料的访问率接近 100%,识别载荷后的尝试操作几乎全部转化为攻击成功;消融实验显示仅保留文本引导时 ASR 归零,仅保留图像载荷时 ASR 降至 1.9%–7.4%,作者称消融结果反映出图像提供语义与文本提供流程权威性的协同机制。
    6. 现有防御盲区与研究启示:评测中 5 款主流技能扫描器对恶意包的检出率最高仅 11.1%,难以识别图像层面的未授权指令;作者认为必须针对多模态技能开发运行时防御机制,不能单纯依赖静态文本检测或任务完成状态来保障智能体安全。
    完整解读
已经到底了