跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 5 篇

另有 307 篇论文还没打上分类标签,暂不在筛选结果里。

  1. MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用 MMPIBench 评测智能体框架的多模态提示注入

    发表
    场景
    AI Agent
    测试
    Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个

    摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    深度解读完整解读
  2. 防御arXiv 2609.22573

    研究提出面向企业 MCP 的零信任授权与工具发现方案

    提出企业 MCP 的零信任授权扩展,拒绝提示注入下的越权工具调用

    发表
    场景
    AI Agent
    测试
    gpt-5、claude-sonnet-4-6、claude-opus-4-7 等 6 个
    摘要同一份按工具声明同时管 MCP 的发现、列表和调用,使注入不能扩大已有凭证的权限。

    作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。

    深度解读完整解读
  3. 评测与基准arXiv 2609.32691

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差

    发表
    场景
    AI Agent
    测试
    gpt-5.6-terra、llama3.1:8b、gemma4:12b 等 4 个

    摘要论文揭示了 IPI 评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。

    深度解读完整解读
已经到底了