跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 4 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2605.17380 ·

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    提出企业级智能体检测系统ADR,检测提示注入与恶意MCP

    测试
    GPT-4o、Claude Sonnet 4、Llama Guard 3-8B 等 4 个应用层
    摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
    • 定位与目标:论文针对企业 MCP 智能体面临的未授权访问、数据外传等威胁,提出集成了端点遥测、分级在线检测与离线进化红队的防护系统 ADR。
    • 核心方法:通过端点 Sensor 解析本地缓存重建“提示词-思考-工具调用-环境”的完整因果链;在线采用轻量 LLM 进行 Tier 1 初筛并由 Tier 2 推理智能体结合源码与策略 MCP 进行深度调查;离线由 Explorer 进行进化式红队生成威胁情报并闭环反哺。
    • 主要实验结果:在包含 133 个 MCP 服务器的 ADR-Bench 上,ADR 实现 0 误报、0.667 召回率和 0.800 F1 值(基线 F1 仅 0.178–0.366);在 AgentDojo 上检出全部 38 个注入攻击,F1 达 0.962;单任务成本为 $0.024。
    • 生产落地验证:在 Uber 逾 7,200 台企业终端上部署超过 10 个月,并利用预执行 Hooks 拦截 206 处凭据外传风险(97.2% 精确率)。
    • 作者结论与启示:作者认为端点因果链遥测与分级上下文推理是应对智能体语义攻击的关键,并计划进一步探索网关层实时防护与多智能体协议适配。
    完整解读
  2. 防御arXiv:2609.14003 ·

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    提出FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露

    测试
    DeepSeek-V3.2、DeepSeek-R1、GPT-4.1-mini 等 4 个应用层
    场景
    AI Agent
    摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御FLOWSEAL并验证有效性。
    • 研究定位:该研究针对个人大模型智能体在协作交互中的隐私保护问题,揭示了依赖提示词进行内部推理防御的结构性脆弱性,并提出了基于信息流控制的系统层防御。
    • 核心问题:现有防御将隐私判断交由智能体在攻击者可控的对话上下文中进行,使得防御执行点与攻击面重合,攻击者可通过任务重构(CWL)、省略披露(SOA)和跨通道解耦(CDA)绕过检查。
    • 防御机制:FLOWSEAL基于数据溯源对敏感记录打标,在工具调用边界部署独立代码拦截器执行三级格策略,并借助隔离的LLM内容检查器做语义去分类,辅以协作API引导智能体正常交互。
    • 关键实验结果:在SPR基准(DeepSeek-V3.2)上,FLOWSEAL将CWL的条目泄漏率从SPR-D2的52.2%降至0.5%,SOA从75.6%降至2.3%,CDA从43.8%降至2.2%;良性任务实用率保持在72.4%;在真实Gmail与Notion的MCP测试中将SOA泄漏率降至0.0%。
    • 消融与开销:工具拦截器是防御核心(禁用后CWL泄漏率回升至28.4%);相较无防御设置,FLOWSEAL每轮仅增加0.017美元成本与37%的延迟。
    • 作者结论与启示:作者认为,通过将安全执行移至对抗性重构无法触及的外部层,智能体可以获得更稳定的隐私保护,未来需推动操作系统、工具层与模型对齐的多层纵深防御。
    完整解读
  3. 评测与基准arXiv:2609.19587 ·

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    红队评估编码智能体的阻断监视器,并提出Auto Mode++加固

    测试
    Opus 5、Opus 4.8、Opus 4.7 等 8 个应用层
    摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
    • 定位与核心问题:本研究系统评估了生产级代码智能体阻断监视器在面对具有持续对抗意图的智能体时的表现,重点关注防止智能体造成外发权重等不可逆灾难性破坏的能力。
    • 方法与防御设计:研究梳理出监视器注入、多上下文攻击、覆盖漏洞和策略失效四类攻击形态;针对上述隐患,作者提出了包括heredoc轮次隔离、Unicode转义、强制监控工作目录编辑、压缩摘要意图审查以及三阶段分层审查在内的Auto Mode ++防御方案。
    • 主要实验发现:
      • 在基准评估中,生产环境默认的Auto Mode和Guardian在Opus 5攻击下四类攻击平均ASR分别达65%和72%(Figure 1)。
      • 注入攻击在扁平化文本渲染下呈现较高失效率,攻击者利用换行伪造可使Auto Mode的注入ASR达78.4%,而采用heredoc框架与转义的Auto Mode ++将其抑制至1.6%(Figure 5a)。
      • 动作碎片化攻击效果明显,随着多智能体协同数量由2个增至20个,Opus 5的ASR由约30%提升至88%;单智能体恶意压缩20次后ASR升至85%(Figure 7)。
      • Auto Mode ++将四类攻击平均ASR由65%降低至9%(Figure 1),同时在4,000个良性SWE-chat动作上保持误报率低于1%、单步延迟约1.2秒(Figure 8)。
    • 作者启示与结论:作者认为针对单步注入与工作目录覆盖漏洞的工程防御成本较低且具有防御效果;然而,防范跨越会话与压缩边界的多上下文攻击必须依赖具备全局上下文感知能力的智能体审查,这与交互式部署的延迟要求存在固有张力,在可接受成本下防范多上下文攻击仍是一个开放问题。
    完整解读
  4. 防御arXiv:2609.07529 ·

    CoER:用对抗协同演化与精炼防御自适应间接提示注入

    提出CoER,用对抗共进化与精炼训练智能体抵御自适应间接提示注入

    测试
    Qwen3.5-9B、MAGIC (Qwen2.5-7B)、Lifelong Defender i2 RR 等 9 个应用层
    场景
    AI Agent
    摘要CoER针对自适应IPI结合双边对抗共进化与强教师精炼,在七领域将Qwen3.5-9B的自适应ASR降至0.22%。
    • 研究定位:针对语言模型智能体在工具调用中易受自适应间接提示注入(IPI)威胁且现有防御多受限于固定攻击模式的问题,提出了融合攻防双边对抗共进化与验证者引导精炼的 CoER 框架。
    • 核心方法:将多轮任务交互建模为一般和马尔可夫博弈,首先利用成功的攻击轨迹对攻击者进行 SFT 冷启动,随后通过双边历史对手池的对抗 PPO 强化学习共同推进攻防双方能力,最后利用保留的攻击者种群向强教师模型发起挑战,收集经过安全性与任务完成度双重验证的轨迹微调防御者。
    • 核心实验结果:
      1. 在七个领域的 1,187 个自适应案例评测中,CoER 在 Qwen3.5-9B 骨干上将自适应 ASR 降至 0.22±0.13%,Safe-U 达到 76.24±1.08%,无攻击任务成功率 Clean U 保持在 80.47±1.47%(Table 1a)。
      2. 归因实验表明,相比 Base 初始化与固定攻击数据,BA-RL 初始化带来 8.42 个百分点的 Safe-U 提升,种群衍生数据带来 10.36 个百分点提升,二者结合取得最佳效果(Table 1c)。
      3. 在外部基准 AgentLAB 任务注入下,CoER 的 ASR 为 14.12%、Safe-U 为 77.13%(Table 2、Table 13);在 InjecAgent 基础载荷下实现 0.00% ASR(Table 14)。
      4. 面对 4 个历史攻击者共 8 次累积尝试,CoER 的联合 ASR 维持在 4.97%(Table 8);在后置单边攻击者强化学习中,攻击者最高 ASR 仅为 0.59%(Figure 5)。
    • 结论与启示:作者认为对抗共进化能够有效提升攻击与防御策略空间,并将自适应攻击发现与经验证的教师演示相结合,为复杂工具调用场景下的智能体安全防御提供了可行路径。
    完整解读
已经到底了