跳到正文
10月8日 · 周四

提示注入 · 论文

找到 8 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 45 篇还没打标签,不在筛选结果里。

另有 45 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.11757

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策

    发表
    场景
    AI Agent
    测试
    gpt-5.5、claude-opus-5、claude-sonnet-4.6 等 15 个

    摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。

    深度解读完整解读
  2. 防御arXiv 2610.05640

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    提出 multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据

    发表
    测试
    Claude Fable 5、GPT-5.5、GPT-4.1 等 6 个

    摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。

    深度解读完整解读
  3. 防御arXiv 2610.03089

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击

    发表
    测试
    gpt-5、claude-sonnet-5、UI-TARS-1.5-7B 等 6 个

    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    深度解读完整解读
  4. 防御arXiv 2609.18674

    CaMeLoT:用 CTL 时序逻辑在执行前静态验证 Agent 计划

    提出 CaMeLoT,在执行前用 CTL 静态验证 Agent 计划

    发表
    场景
    AI Agent
    测试
    claude-haiku-4-5-20251001、GPT-4.1 nano、GPT-4.1 mini 等 5 个
    摘要CaMeLoT 在执行前用 CTL 模型检验补上 CaMeL 缺少的整段执行规范,并用反例修复计划。

    CaMeLoT 是 CaMeL 的神经符号扩展:在工具调用之前,用模型检验判断受限 Python 计划是否满足时序安全策略和从提示词抽出的任务性质。

    深度解读完整解读
已经到底了