跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 4 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2610.06898 ·

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    提出DIBench,评测界面注入对移动智能体选择决策的操纵

    测试
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个应用层
    摘要论文提出移动智能体决策完整性基准DIBench,发现欺诈UI注入诱导目标选择并推高完成率,通用防御收益不稳定。
    • 研究定位与核心问题:针对移动GUI智能体在多候选集选择任务中的安全风险,论文研究非特权UI欺诈注入引发的“任务内目标偏离(In-Task Goal Deviation)”,即智能体在没有执行级劫持或异常轨迹的情况下,最终决策被诱导至攻击者指定选项。
    • 基准构建与评测设计:构建决策完整性基准DIBench,包含7款商用与3款模拟App的5类任务(1,000个良性与36,672个注入实例),在非特权UI威胁模型下设计8种探针变体,通过成对对照实验与TCR、COR、ASR指标量化决策偏离。
    • 完成度指标的虚假安全假象:实验显示欺诈注入会缩短前置探索、促使过早选定选项并推高任务完成率;在COMMERCE中,Combined注入使AppAgent+Qwen2.5-VL的TCR从42.0%升至72.4%,同时ASR达45.8%(Table 3),作者称传统完成率指标会高估安全性。
    • 模型易受操纵性分层:在SIMULATOR与Mobile-Agent-V3设定下(Table 8),通用开源模型呈现最高ASR(Qwen3-VL在Combined下ASR为49.8%),专用开源模型次之(GUI-Owl为19.3%),闭源模型较低(DoubaoSeed-1.6为7.5%、Gemini-3-Flash为8.7%、GPT-5.2为3.8%)。
    • 通用防御措施的局限:评测表明现有通用防御收益不稳定;图像检测对微弱信号攻击漏检率高(Naive仅18.2%召回率,Table 4),预处理可能破坏良性证据并导致ASR反弹(Table 6),提示词警告依赖模型顺从度且可能导致COR下降(Table 7)。
    • 作者结论与启示:作者认为执行正确性与决策可信度存在解耦,决策完整性应作为智能体安全评测的独立层级;未来需超越浅层结果指标,构建基于结构化属性核验与证据接地的防御体系。
    完整解读
  2. 评测与基准arXiv:2610.03938 ·

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测启用工具调用后多模态模型拒答有害图文请求的变化

    测试
    Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个应用层
    场景
    AI Agent
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。

    核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    实验在 MM-SafetyBench、VLSBench 与 HoliSafe 三个安全基准上评估了 11 款主流开源与专有模型,结果显示工具调用使得所有被测模型的拒答失败率(RFR)均发生上升,三基准平均相对增幅为 17.7%(绝对值增加 5.7),相对增幅最高达 68.7%(GLM-5V-Turbo 于 HoliSafe,Table 1)。

    原生视觉智能体 Gemini-3-Flash Agentic Vision 的平均 RFR 同样相比基础模型上升 15.2(Table 3),通过 McNemar 检验确认退化在统计学上显著(Table 5)。

    归因分析提出两大机制:一是上下文稀释,调用工具轮次越多 RFR 越高,而重新注入原请求与图像可使平均 RFR 回落 7.6%(Figure 3);二是安全关注点偏移,工具调用使成功拒答样本中以观察总结开头的比例从 20.3% 变为 52.3%(Figure 5),注意力被视觉证据挤占。

    作者认为,工具调用不应仅被视为能力增强机制,也是能够改变拒答行为的安全相关设计;未来的多模态智能体必须在工具调用条件下进行安全评测与对齐训练,而不能假定无工具环境下的安全对齐可以直接迁移。

    完整解读
  3. 评测与基准arXiv:2609.09404 ·

    MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    用MMPIBench评测智能体框架的多模态提示注入

    测试
    Claude Opus 4.8、GPT-5.4、Gemini 3.1 Pro 等 6 个应用层
    场景
    AI Agent
    摘要论文提出MMPIBench评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
    • 论文定位:论文提出了可复现基准 MMPIBench,系统评估多模态间接提示注入在6个主流智能体框架与5个前沿模型中的传播路径与阻断机制。
    • 核心问题:现有提示注入研究多针对文本输入或将多模态智能体视作黑盒,无法厘清攻击是在感知、规划还是执行阶段被阻断,也无法区分框架与基座模型的安全职责。
    • 方法设计:通过统一适配层标准化系统提示词与模拟工具,测试24个视觉攻击用例(6类载体 × 4类目标)与12个音频用例,引入白盒阶段插桩定位终止位置,并采用确定性检查与三模型评审团分层判定完成与尝试。
    • 主实验发现:全矩阵720次视觉运行中完成率仅1.11%(8次),但尝试率达12.8%(92次);未完成攻击主要在规划阶段被模型阅读后放弃执行(占42.1%),显式识别拒绝占23.6%;模型是主导因素,Claude Opus 4.8尝试率为0.0%,Grok 4.3和Llama 4 Maverick达23.6%。
    • 音频扩展发现:半数框架因格式或序列化问题未交付音频;在交付的72个单元中完成率达49%,gpt-audio达75%,且尝试与完成数量完全相同。
    • 结论与启示:作者认为仅汇报完成率会大幅低估系统暴露风险,应同时追踪尝试率与识别拒绝率;框架丢弃多模态输入属于偶发缺陷而非安全屏障,亟需将安全对齐扩展至视觉与音频等感知通道。
    完整解读
  4. 评测与基准arXiv:2609.35912 ·

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    构建多模态技能图像攻击基准MMSkillRisk并设计NCVA

    测试
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个应用层
    摘要论文提出MMSkillRisk基准与NCVA攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
    1. 研究定位与核心问题:本研究针对多模态智能体技能中图像引导可能成为攻击跳板的安全风险,构建了首个可执行的端到端评测基准 MMSkillRisk,系统探究智能体在依赖视觉参考完成任务时能否防御图像潜藏的未授权指令。
    2. 攻击设计与基准构建:作者提出原生上下文视觉攻击(NCVA),将未授权操作伪装成教学图中的原生标注、弹窗或标签,并通过文本提供中立位置引导;基于 28 个多模态技能构建了包含 5 类攻击目标、36 个受污染变体及 108 个用例的评测集,在 Docker 沙箱中通过多模态 LLM 独立评估攻击与任务完成度。
    3. 图像载荷攻击的高有效性:在评估的 9 种模型与框架配置中,NCVA 均诱发了未授权操作,其汇聚 ASR 达到 43.1%,比对应文本匹配基线高出 16.4 个百分点;其中 Codex 搭配 GPT-5.6-sol 的 ASR 达到 81.5%,而 Claude Code 搭配 Claude Opus 4.6 表现出最低的 ASR(12.0%)。
    4. 攻击与良性任务高度共存:评测显示汇聚任务兼容攻击成功率(TC-ASR)达到 36.5%,在 Codex 搭配 GPT-5.6-sol 配置下更是高达 72.2%,作者指出这反映出智能体能够在顺利完成用户合法需求的同时提交危险操作,良性任务完成无法作为安全评判凭据。
    5. 行为转化链路与载体互补性:轨迹分析表明智能体对视觉材料的访问率接近 100%,识别载荷后的尝试操作几乎全部转化为攻击成功;消融实验显示仅保留文本引导时 ASR 归零,仅保留图像载荷时 ASR 降至 1.9%–7.4%,作者称消融结果反映出图像提供语义与文本提供流程权威性的协同机制。
    6. 现有防御盲区与研究启示:评测中 5 款主流技能扫描器对恶意包的检出率最高仅 11.1%,难以识别图像层面的未授权指令;作者认为必须针对多模态技能开发运行时防御机制,不能单纯依赖静态文本检测或任务完成状态来保障智能体安全。
    完整解读
已经到底了