跳到正文
10月9日 · 周五

全部论文

找到 10 篇

另有 648 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.11757

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策

    发表
    场景
    AI Agent
    测试
    gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个

    摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。

    深度解读完整解读
  2. 防御arXiv 2610.02664

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束

    提出 STAR-Guard 双层防御,缓解长程智能体跨轮遗忘安全约束

    发表
    场景
    AI Agent
    测试
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 等 7 个

    摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。

    深度解读完整解读
  3. 防御arXiv 2608.24017

    WebMCP-Phalanx:为浏览器内 LLM Agent 工具调用建立信任边界

    提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具面

    发表
    场景
    AI Agent
    摘要Phalanx 用浏览器凭证绑定工具所有权,Q/P 分离拦住描述注入,工具名与返回值仍有残留。

    WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。

    深度解读完整解读
  4. 防御arXiv 2610.00797

    Sapien:面向自主 AI 智能体的有状态策略引擎

    提出有状态策略引擎 Sapien,拦截被劫持智能体的越权工具调用

    发表
    场景
    AI Agent
    测试
    Gemini 3.8 Flash、Gemini 3.1 Pro、Claude Sonnet 5 等 4 个
    摘要Sapien 用有状态上下文策略约束工具序列,在近似保住效用的同时拦住多数被劫持轨迹。

    Sapien 是面向通用 AI 智能体的有状态策略引擎:执行前把用户提示词译成任务策略,运行时只放行该策略承认的工具调用序列。

    深度解读完整解读
  5. 防御arXiv 2609.01677

    Skill-as-API:面向智能体软件工程的机密多智能体协作协议

    提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词

    发表
    摘要协议把 skill 正文留在所有者侧,四层限制发现内容、权限期限和注入拼接。

    Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。

    深度解读完整解读
  6. 防御arXiv 2609.30824

    基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案

    提出身份绑定且只收窄的能力令牌,用上下文外钱包约束智能体

    发表
    摘要用只衰减的身份绑定令牌和上下文外钱包,约束代表人类行动的分布式智能体。

    代表人类行动的分布式智能体,需要一种不把密钥放进语言模型上下文的授权方式。

    深度解读完整解读
已经到底了