跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 4 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2610.04589 ·

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用StegoMemory测试智能体持久记忆作为跨会话隐写信道的可行性

    测试
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个应用层
    场景
    AI Agent
    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
    • 论文定位:论文提出了 StegoMemory,系统评测大语言模型智能体持久化记忆被用作跨会话隐写隐蔽通信信道的安全风险。
    • 解决的核心问题:现有安全评估主要关注显式有害内容与提示词注入,忽视了攻击者利用良性交互在记忆中隐写编码并跨会话重构机密的信息流威胁。
    • 方法核心要点:通过主副任务配对与两会话隔离协议,测试 7 种隐写机制在 13 个模型中的编码、记忆写入持久化及后续良性检索恢复全流程,并配合任务完成与安全合规监视。
    • 主要实验发现:
      1. 在全基准 14,000 次试验中,20.1% 实现了合成机密的确切匹配恢复,且其中 71.4% 同时通过任务完成与独立安全监视(占全试验的 14.4%)。
      2. 13 个模型中有 12 个显示信息损耗集中在记忆写入持久化阶段而非检索阶段(写入阶段存活率为 29.8%,检索可恢复为 25.4%)。
      3. 模型低拒答率不等于高正确编码率,较弱模型在未拒答时大量产生格式错误编码(全模型平均格式错误率为 23.5%,拒答率为 20.6%)。
    • 作者结论与防御启示:作者认为持久化记忆应被视作安全边界而非被动存储介质,单靠表面响应监视无法保证信息流安全,防御应优先部署在记忆写入接口处,实施出处追踪、规范化与跨会话信息流审计。
    完整解读
  2. 攻击arXiv:2608.06862 ·

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个应用层
    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
    • 定位:论文研究了计算机使用智能体(CUA)中由持久化工件自主生成引发的内部供应链安全风险。
    • 核心问题:现代 CUA 依赖自主编写并复用技能等持久工件来扩展能力,若底层模型受到供应链攻陷,可能在良性任务中生成带潜伏载荷的自合成工件,使得恶意行为无需外部新输入即可在后续任务中跨步激活。
    • 方法设计:提出 SYNCHAIN 框架,通过面向持久化的定向 SFT,将恶意逻辑潜伏编码在良性工件的结构冗余中;工件被纳入系统扩展状态后,通过状态转移实现严格的延迟激活。
    • 核心实验发现:在 OpenClaw、Codex 和 Claude Code 三个框架下,SYNCHAIN 在 Chain-1 无防御设置下取得 97.78%–98.89% 的平均 ASR,在 GuardAgent 下仍保持 87.78%–93.33%;在 Chain-2 取得 72.59% 的平均 ASR,显著优于适配基线 SkillJect 和 DemonAgent。
    • 传播边界与衰减:在更长任务链中,受上下文截断和记忆总结等信息瓶颈影响,Chain-4 与 Chain-5 的 ASR 分别回落至 6.67% 与 1.11%,表明跨任务传播存在天然的马尔可夫衰减边界。
    • 作者结论与启示:作者认为,持久性改变了智能体的安全边界,传统的单步输入过滤和输出审查无法防御内部工件传递的风险,未来需构建结合工件签名、权限约束与执行轨迹审计的来源感知防御。
    完整解读
  3. 攻击arXiv:2609.30383 ·

    研究者提出技能级联攻击,在 OpenClaw、Claude Code 与 Codex 上平均成功率 89.4%

    提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测

    测试
    GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 10 个应用层
    摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
    • 研究定位:该研究聚焦基于技能的大语言模型智能体生态,形式化并实证评估了将攻击目标分散于多个技能中的技能级联攻击威胁。
    • 核心问题:现代智能体通过共享上下文窗口跨技能传递数据,现有安全防御均基于单技能审查假设,无法发现单个技能看似正常但多技能协同产生危害的安全风险。
    • 方法架构:作者设计了由场景发现、攻击生成、隔离扫描、测试构造和沙箱裁决等 5 个智能体构成的闭环红队框架 SKILLCASCADE,构建并开源了包含 213 个测试用例的 SKILLCASCADE-BENCH 基准。
    • 关键实验结果:在 OpenClaw、Claude Code 与 Codex 配合 8 种骨干模型的 24 种配置下,级联攻击平均 ASR 达到 89.4%(Table 2);面对 5 款单技能扫描器,修改后技能的隐蔽率保持在 86.6% 以上(Table 3);面对 4 种运行时防御框架,平均逃逸率达 88.5%(Table 5);撤销三技能级联中任一修改,残余 ASR 降至 13–18%(Figure 4a)。
    • 作者结论与启示:作者认为组件级别的良性并不等同于系统整体的安全,现有多技能智能体系统在跨技能语义交互层面缺乏有效防护,呼吁安全研究从孤立的单技能审查转向跨技能交互分析与组合安全推理。
    完整解读
  4. 评测与基准arXiv:2609.35912 ·

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    构建多模态技能图像攻击基准MMSkillRisk并设计NCVA

    测试
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个应用层
    摘要论文提出MMSkillRisk基准与NCVA攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
    1. 研究定位与核心问题:本研究针对多模态智能体技能中图像引导可能成为攻击跳板的安全风险,构建了首个可执行的端到端评测基准 MMSkillRisk,系统探究智能体在依赖视觉参考完成任务时能否防御图像潜藏的未授权指令。
    2. 攻击设计与基准构建:作者提出原生上下文视觉攻击(NCVA),将未授权操作伪装成教学图中的原生标注、弹窗或标签,并通过文本提供中立位置引导;基于 28 个多模态技能构建了包含 5 类攻击目标、36 个受污染变体及 108 个用例的评测集,在 Docker 沙箱中通过多模态 LLM 独立评估攻击与任务完成度。
    3. 图像载荷攻击的高有效性:在评估的 9 种模型与框架配置中,NCVA 均诱发了未授权操作,其汇聚 ASR 达到 43.1%,比对应文本匹配基线高出 16.4 个百分点;其中 Codex 搭配 GPT-5.6-sol 的 ASR 达到 81.5%,而 Claude Code 搭配 Claude Opus 4.6 表现出最低的 ASR(12.0%)。
    4. 攻击与良性任务高度共存:评测显示汇聚任务兼容攻击成功率(TC-ASR)达到 36.5%,在 Codex 搭配 GPT-5.6-sol 配置下更是高达 72.2%,作者指出这反映出智能体能够在顺利完成用户合法需求的同时提交危险操作,良性任务完成无法作为安全评判凭据。
    5. 行为转化链路与载体互补性:轨迹分析表明智能体对视觉材料的访问率接近 100%,识别载荷后的尝试操作几乎全部转化为攻击成功;消融实验显示仅保留文本引导时 ASR 归零,仅保留图像载荷时 ASR 降至 1.9%–7.4%,作者称消融结果反映出图像提供语义与文本提供流程权威性的协同机制。
    6. 现有防御盲区与研究启示:评测中 5 款主流技能扫描器对恶意包的检出率最高仅 11.1%,难以识别图像层面的未授权指令;作者认为必须针对多模态技能开发运行时防御机制,不能单纯依赖静态文本检测或任务完成状态来保障智能体安全。
    完整解读
已经到底了