跳到正文
10月9日 · 周五

Agent 安全 · 论文

找到 32 篇

另有 253 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.09793

    用时序逻辑监控工具 Agent

    提出 MFOTL 时序监控,用 MonPoly 检出工具 Agent 的危险动作链

    发表
    场景
    AI Agent
    测试
    GPT-4o、Sonnet-3.5
    摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。

    深度解读完整解读
  2. 防御arXiv 2610.05163

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入

    发表
    测试
    Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5)、Claude Sonnet 5 等 7 个
    摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    深度解读完整解读
  3. AgentHazard:评估计算机使用智能体有害行为的基准

    提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为

    发表
    测试
    Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct、Qwen3-32B 等 12 个
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    深度解读完整解读
  4. MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用 MMPIBench 评测智能体框架的多模态提示注入

    发表
    场景
    AI Agent
    测试
    Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个

    摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    深度解读完整解读
  5. 攻击arXiv 2609.35576

    研究提出跨 LLM 助手的记忆跳跃攻击

    提出跨独立助手的工件介导记忆跳跃自传播攻击

    发表
    测试
    GPT-5.6 Luna、Kimi-K2.6、GPT-OSS-120B 等 6 个
    摘要论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。

    该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。

    深度解读完整解读
  6. 评测与基准arXiv 2608.09476

    ActBench:面向协作智能体行为安全的自演化基准

    提出自演化基准 ActBench,评测协作智能体的操作级行为安全

    发表
    场景
    AI Agent
    测试
    Claude-Opus-4.8、Claude-Sonnet-4.6、GPT-5.5 等 15 个

    摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。

    深度解读完整解读
  7. 攻击arXiv 2607.11698

    AHA 用自动研究循环发现生产 Agent 漏洞概念

    提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念

    发表
    攻击者
    黑盒
    测试
    Minimax-M2.7、Kimi-K2.6、Deepseek-V4-Pro 等 5 个
    摘要论文提出基于可证伪科研循环的 AHA 框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    深度解读完整解读
  8. 攻击arXiv 2610.00430

    Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷

    提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容

    发表
    测试
    gpt-oss-120B、deepseek-v4.1-flash、qwen-32B 等 5 个
    摘要memetic trojans 用内生社会传染携带载荷。

    Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。

    深度解读完整解读
  9. 防御arXiv 2609.13601

    Mind the Gap:检测 DAO 治理中的描述-执行不匹配攻击

    提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配

    发表
    测试
    GPT-4o、Claude 4.5 Sonnet、Gemini 2.5 Pro 等 8 个
    摘要用公开链上数据仿真治理全流程,再以逐动作证据映射在执行前发现描述与执行不一致。

    Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。

    深度解读完整解读
  10. 防御arXiv 2609.22573

    研究提出面向企业 MCP 的零信任授权与工具发现方案

    提出企业 MCP 的零信任授权扩展,拒绝提示注入下的越权工具调用

    发表
    场景
    AI Agent
    测试
    gpt-5、claude-sonnet-4-6、claude-opus-4-7 等 6 个
    摘要同一份按工具声明同时管 MCP 的发现、列表和调用,使注入不能扩大已有凭证的权限。

    作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。

    深度解读完整解读