跳到正文
10月9日 · 周五

Agent 安全 · 论文

找到 34 篇
  1. 防御arXiv 2609.11757

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策

    发表
    场景
    AI Agent
    被测模型
    gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个

    摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。

    深度解读完整解读
  2. 防御arXiv 2610.02569

    Pincer:用数字分身学习用户偏好并执行动态最小权限

    提出 Pincer,用数字分身学习用户偏好并对 Agent 做资源层最小权限授权

    发表
    被测模型
    Claude Haiku 4.5、Muse Spark 1.2 Contributor
    摘要Pincer 在资源层以三票合取做授权。

    Pincer 是加在现成 coding agent 上的资源层授权防御:用只受用户侧信息影响的 digital twin 做动态最小权限,并与 tool-call 层防御并存。要处理的是用户维护策略带来的权限蠕变和授权疲劳,以及不学习用户策略的 tool-call 分类器。作者引述工作称 auto mode 会放行多数不安全操作,并认为推理代码或复杂 shell 的效果在这一层不实际。

    深度解读完整解读
  3. 防御arXiv 2610.02664

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束

    提出 STAR-Guard 双层防御,缓解长程智能体跨轮遗忘安全约束

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 等 7 个

    摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。

    深度解读完整解读
  4. 防御arXiv 2610.03089

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击

    发表
    被测模型
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个

    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    深度解读完整解读
  5. 防御arXiv 2609.33039

    TACIT:从 LLM 内部状态检测 Agent 轨迹危害

    提出 TACIT,从冻结内部表征检测智能体有害轨迹

    发表
    场景
    AI Agent
    被测模型
    Qwen3-4B、Llama-3.1-8B、Qwen3-4B-Instruct 等 4 个

    摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。

    深度解读完整解读
  6. 防御arXiv 2607.12507

    研究者提出 RARE 攻击:LLM 辅助逆向工程中的表示混淆

    提出 RARE-Guard,阻断逆向分析中观察被提升为指令或已验证状态

    发表
    场景
    AI Agent
    被测模型
    gpt-5.5、claude-sonnet-4-6、gemini-2.5-pro 等 5 个
    摘要成对二进制衡量无效提升。

    作者定义的失败是:LLM 辅助逆向中,忠实提取的二进制观察获得它并未赢得的指令权限、声明证据或可信状态。

    深度解读完整解读
  7. 评测与基准arXiv 2609.34862

    JEV 作为智能体轨迹安全评判器:与生成式 LLM 评判器的实证对比

    比较 JEV 与生成式评审对智能体轨迹安全的回溯分类

    发表
    场景
    AI Agent
    被测模型
    JEV、GLM-5.2-Tencent、DeepSeek-V4-Flash 等 5 个
    摘要JEV 的四基准平均正类 F1 最高,延迟和估计费用更低,但分数据集与精确率有取舍。

    在已保存的工具使用智能体轨迹上,比较类型化评审 JEV 与四种生成式评审的回溯安全分类。

    深度解读完整解读
  8. 防御arXiv 2609.29647

    AgentKernel:面向 Agent 的可信原生操作系统内核

    提出 AgentKernel,强制中介 Agent 的身份、感知、认知与执行

    发表
    场景
    AI Agent
    摘要AgentKernel 是四支柱智能体 OS 设计,安全论证未附带实测数字。

    AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。

    深度解读完整解读
  9. 研究实测五套 Agent 记忆系统均不执行撤销标记

    评测智能体记忆软撤回是否生效,并提出陈旧检索防护

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个

    摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。

    深度解读完整解读
  10. 防御arXiv 2608.21101

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入

    发表
    被测模型
    Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1 等 6 个
    摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    深度解读完整解读
  11. 防御arXiv 2608.24017

    WebMCP-Phalanx:为浏览器内 LLM Agent 工具调用建立信任边界

    提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具面

    发表
    场景
    AI Agent
    摘要Phalanx 用浏览器凭证绑定工具所有权,Q/P 分离拦住描述注入,工具名与返回值仍有残留。

    WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。

    深度解读完整解读
  12. 防御arXiv 2610.01349

    PACE:面向工具调用 LLM Agent 的来源感知能力强制执行

    提出 PACE,在工具调用前对 Agent 做路径隔离与效果授权

    发表
    场景
    AI Agent
    被测模型
    gpt-5.6-luna、DeepSeek-V4-Flash、Qwen-3.8-27B
    摘要PACE 在工具边界做路径割与效果核验。

    PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。

    深度解读完整解读
  13. 防御arXiv 2610.00797

    Sapien:面向自主 AI 智能体的有状态策略引擎

    提出有状态策略引擎 Sapien,拦截被劫持智能体的越权工具调用

    发表
    场景
    AI Agent
    被测模型
    Gemini 3.8 Flash、Gemini 3.1 Pro、Claude Sonnet 5 等 4 个
    摘要Sapien 用有状态上下文策略约束工具序列,在近似保住效用的同时拦住多数被劫持轨迹。

    Sapien 是面向通用 AI 智能体的有状态策略引擎:执行前把用户提示词译成任务策略,运行时只放行该策略承认的工具调用序列。

    深度解读完整解读