跳到正文
10月8日 · 周四

提示注入 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 评测与基准arXiv:2609.09404 ·

    MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用MMPIBench评测智能体框架的多模态提示注入

    测试
    Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个应用层
    场景
    AI Agent
    摘要论文提出MMPIBench评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
    • 论文定位:论文提出了可复现基准 MMPIBench,系统评估多模态间接提示注入在6个主流智能体框架与5个前沿模型中的传播路径与阻断机制。
    • 核心问题:现有提示注入研究多针对文本输入或将多模态智能体视作黑盒,无法厘清攻击是在感知、规划还是执行阶段被阻断,也无法区分框架与基座模型的安全职责。
    • 方法设计:通过统一适配层标准化系统提示词与模拟工具,测试24个视觉攻击用例(6类载体 × 4类目标)与12个音频用例,引入白盒阶段插桩定位终止位置,并采用确定性检查与三模型评审团分层判定完成与尝试。
    • 主实验发现:全矩阵720次视觉运行中完成率仅1.11%(8次),但尝试率达12.8%(92次);未完成攻击主要在规划阶段被模型阅读后放弃执行(占42.1%),显式识别拒绝占23.6%;模型是主导因素,Claude Opus 4.8尝试率为0.0%,Grok 4.3和Llama 4 Maverick达23.6%。
    • 音频扩展发现:半数框架因格式或序列化问题未交付音频;在交付的72个单元中完成率达49%,gpt-audio达75%,且尝试与完成数量完全相同。
    • 结论与启示:作者认为仅汇报完成率会大幅低估系统暴露风险,应同时追踪尝试率与识别拒绝率;框架丢弃多模态输入属于偶发缺陷而非安全屏障,亟需将安全对齐扩展至视觉与音频等感知通道。
    完整解读
已经到底了