跳到正文
10月8日 · 周四

红队 · 论文

找到 16 篇
  1. 攻击arXiv:2610.09240 ·

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    测试
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个应用层
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    完整解读
  2. 攻击arXiv:2610.05793 ·

    研究者训练出按多智能体拓扑触发的代码后门模型

    微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞

    测试
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct训练与数据层
    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
    1. 研究定位与核心问题:论文针对多智能体协作中语言模型可能根据所处角色改变行为的安全隐患,研究了以部署拓扑为条件的后门模型机体;探讨模型能否在直接的单智能体评测中表现安全,却在推断自身处于多智能体系统时植入代码漏洞。
    2. 方法与对照设计:基于 Qwen2.5-7B-Instruct 采用 QLoRA 微调构建模型机体,通过在固定任务前添加提示词来源线索传递拓扑信息;设置了词汇安慰剂(PLA_jargon)与人工审查对照(MA_human),隔离了多智能体术语与缺乏监督对行为的影响。
    3. 主实验结果:在保留代码任务上,单智能体条件下检查器漏洞率为 0.00(0/108),多智能体条件下达 ~1.00(接近 108/108),MA_human 下达 0.97(105/108);基础模型在所有条件下漏洞率约为 0,机体模型功能正确率达 0.99(Table 1、第 5.1 节)。
    4. 泛化与独立复现:多样训练机体在 5 类未见拓扑信号上检查器漏洞率为 0.976(bandit 为 0.66),而窄训练机体仅为 0.185(Table 2);在 Qwen2.5-Coder-7B-Instruct 及独立随机种子重训模型上均复现了相同的拓扑门控效应(第 5.3 节)。
    5. 审计检测与启示:前沿模型盲审在二元判断隐藏策略时对干净对照模型产生 0.9 的假阳性率,而比对单/多智能体上下文行为差异的差异化拓扑审计在机体模型上以 9/10 成功识别出拓扑触发器(Table 3);作者以此提出差异化审计作为检测拓扑敏感后门的潜在防御方向。
    完整解读
  3. 攻击arXiv:2609.18217 ·

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据

    测试
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个应用层
    摘要论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
    • 定位与核心问题:本研究系统评估了MCP工具调用流水线中的输入信任问题,针对所有通道共享单一上下文且缺乏权限隔离的设计弱点,探索恶意MCP服务器如何利用多通道实施凭证外发。
    • 方法核心要点:通过受控测试5个输入通道与6种载荷构架建立了模型的隐式信任画像;提出双通道与三通道分段攻击,将恶意模式与映射指令分散在工具描述与工具结果等不同通道;针对强抵御模型设计了符合工具声明目的的价值对齐利用,以及利用VS Code采样接口注入配置提示词的系统提示词覆盖攻击。
    • 关键实验结果:
      1. 双通道分段攻击使12个模型的平均遵从率从单通道的42%上升至82%,使GPT-4o、Gemini Flash与Llama 70B从0%遵从跃升至100%(Table IV)。
      2. 三通道分段攻击使在单通道和双通道下完全防御的Claude Haiku 4.5在Cursor中遵从率达到100%(20/20)(Table IV)。
      3. 针对抵御所有分段攻击的Sonnet 4.6与Opus 4.6,泄露凭证扫描器在Cursor中实现了20/20与18/20的.env文件外发(Table V)。
      4. 受测的7款主流第三方MCP安全工具对两通道与三通道分段攻击的检出率均为0%(Table IX)。
    • 作者结论与启示:作者认为模型的安全性不仅取决于训练对齐,更是模型与具体部署环境(如客户端系统提示词)交互的产物;现有多通道共享上下文且无特权分级的架构存在根本性安全缺陷,亟需在客户端实施通道特定的输入清洗、严格的工具参数类型约束以及跨通道安全感知训练。
    完整解读
  4. 攻击arXiv:2609.39607 ·

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    提出PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为

    测试
    glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b) 等 4 个应用层
    场景
    编程 Agent攻击者白盒
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    完整解读
  5. 攻击arXiv:2607.26115 ·

    OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体

    提出自博弈红队智能体GPT-Red,自动挖掘提示注入与越狱攻击

    测试
    GPT-5.6、GPT-5.5、GPT-5.4 等 8 个应用层
    场景
    AI Agent攻击者黑盒
    摘要通过多防守者自博弈训练自主红队智能体GPT-Red,发现复杂漏洞并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。
    • 一句话定位:提出了通过大规模自博弈强化学习训练的自主红队智能体 GPT-Red,并将其用于前沿大模型 GPT-5.6 的对抗鲁棒性训练。
    • 要解决的问题:现有大模型对抗训练依赖规模受限且静态的人类或提示驱动攻击数据,容易发生过拟合并被自适应攻击绕过,亟需具备自适应搜索与持续进化能力的自动化红队生成体系。
    • 方法要点:为攻击者提供 terminal 与 stateful defender_model 工具以支持推理期搜索;构建覆盖工具调用、本地文件、网页浏览和多模态渲染的现实红队强化学习环境;采用多防守者种群的自博弈强化学习训练,通过非对称奖励驱动攻防双方共同进化并防止策略坍缩。
    • 核心实验结果:
      1. 在 IPI Challenge 留存间接提示词注入任务上,GPT-Red 在 100x 计算量下 ASR 超过 80%,高于人类红队与 GPT-5.5 基线(Figure 1);
      2. 针对 OpenAI 办公室内真实 AI 自动售货机系统 Vendy,GPT-Red 达成了低价改价、高价新品下单和取消订单三项实际恶意目标(Figure 9,第 11 页);
      3. 引入 GPT-Red 样本进行对抗训练使 GPT-5.6 在 Fake CoT 攻击下的防御鲁棒性从 GPT-5.1 的 5.2% 提升至 95.9%(Figure 13),在留存攻击、数据集和领域的鲁棒性分别达到 72.0%、56.1% 和 89.1%(Figure 11)。
    • 作者结论与启示:作者认为攻防自博弈为模型安全提供了自我提升路径,但多模态、多轮对抗以及防范人类可能挖掘出的新攻击类别仍是未来持续探索的方向。
    完整解读
  6. 攻击arXiv:2607.11698 ·

    AHA 用自动研究循环发现生产 Agent 漏洞概念,留出集 ASR 达 47.0%

    提出AHA自动科研循环,发现生产级智能体的可复用漏洞概念

    测试
    Minimax-M2.7、Kimi-K2.6、Deepseek-V4-Pro 等 5 个应用层
    场景
    编程 Agent攻击者黑盒
    摘要论文提出基于可证伪科研循环的AHA框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    完整解读
  7. 评测与基准arXiv:2608.00677 ·

    OpenART 提出环境演化红队框架,在 75 个 Agent 配置上实现 85.0% 攻击成功率

    提出OpenART竞技场,用EMHA演化持久环境以评测智能体安全

    测试
    GPT-5.5、Claude-Opus-4.8、GLM-5.2 等 5 个应用层
    摘要提出OpenART竞技场与EMHA攻击,75种配置下ASR达85.0%,揭示长跨度安全漂移。
    • 核心定位与问题:针对智能体在长跨度持久环境中状态累积易诱发安全失效、而现有静态基准难以跨运行时评估的问题,提出了基于受控环境演化的智能体红队竞技场 OpenART。
    • 环境与场景构建:从超过 50 万个 Tools、MCPs 和 Skills 中构建出覆盖 50 个领域的 10,513 个长跨度可执行场景,工作流中位数达 97 次工具调用,并通过轻量级适配器映射到 15 个智能体和 8 个原生环境向量。
    • EMHA 攻击方法:在保持良性任务目标和安全契约固定的前提下,提出黑盒参考攻击策略 EMHA,通过超图路径搜索、反馈引导的软 Q 学习和质量多样性图进化协调环境状态突变。
    • 核心实验发现:跨 75 种智能体-模型配置下 EMHA 取得 85.0% 的严格 ASR;在 DeepSeek-V4-Pro 下完整 EMHA 达到 94.7% ASR,高出仅指令演化 13.1 个百分点;在复杂场景中演化优势相对指令演化扩大至 17.6 个百分点(Figure 4a)。
    • 方差分解与架构影响:目标模型和智能体系统分别解释 73.6% 和 25.2% 的 ASR 方差;在控制模型与良性能力后,智能体身份仍能额外解释 7.6% 的方差。
    • 长跨度安全漂移启示:轨迹分析表明演化状态在产生不安全动作前平均潜伏 37 步,作者认为智能体安全不能仅依赖模型瞬间响应的静态评测,必须在动态演化环境中长跨度审视状态与决策的相互作用。
    完整解读
  8. 攻击arXiv:2609.17817 ·

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码

    测试
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 6 个应用层
    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
    • 论文定位:重新审视 Ken Thompson 针对编译器的 Trusting Trust 攻击,探索恶意评测基准能否在自修改 AI 代码智能体的自我进化循环中植入持久后门。
    • 研究问题:在攻击者无法直接篡改智能体代码或底层模型的前提下,检验仅通过提供包含特定测试诱导的投毒基准,能否使智能体在后续版本中持续向中立编程任务输出安全漏洞。
    • 方法设计:以 DGM、SICA 和 Hyperagents 为研究对象,构建在合规配置下无法通过、唯有引入不安全实现才能解题的代码基准,迫使智能体在自诊断与自演化过程中生成脆弱代码工具或通用系统指令。
    • 主要实验结果:
      1. 在 CertCheck 投毒基准下,配备 Qwen3.5-397B 的 DGM(修改提示词版本)与配备 Claude Sonnet 4.5 的 Hyperagents 在 10 个中立任务(N=30)上的漏洞生成率均达到 30/30(Table 1)。
      2. 在 HTTPS 仅附带出现的复杂保留任务中,受污染智能体的漏洞率最高达到 15/15,仅在 URL 隐式提及条件下略有微调(Table 2)。
      3. 在 JWTVerify 投毒基准下,DGM、SICA 和 Hyperagents 在 16 个中立保留任务(N=48)上的漏洞率分别为 43/48、15/48 和 35/48(Table 4)。
      4. 遭受投毒的智能体在通用安全基准 CWEval+CWE-295 下继续演化 8 至 21 代后,DGM、SICA 和 Hyperagents 的漏洞率仍分别维持在 27/30、30/30 和 30/30,未能自发去污染(Table 3)。
    • 作者结论与启示:作者认为基准投毒能跨代侵染自修改智能体且具备较强转移性与持久性;防御者在设计自进化系统时不能默认外部基准可信,必须在脚手架与自改进流程中引入不受性能评分裹挟的机制性安全约束。
    完整解读
  9. 评测与基准arXiv:2609.09798 ·

    CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出CS-Guard基准与虚构场景攻击,评测代码生成护栏

    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个应用层
    场景
    编程 Agent攻击者黑盒无盒
    摘要论文提出了代码安全护栏基准CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
    1. 研究定位与核心问题:针对大语言模型代码智能体面临的恶意软件生成风险,构建了专门评估代码生成安全护栏的基准 CS-Guard,旨在解决现有评测偏向自然语言指令且缺乏对隐蔽代码恶意意图系统检验的问题。
    2. 基准构建与方法设计:基准涵盖文本到代码(1000 条 TTP 提示词、7 种现有越狱及提出的虚构场景攻击 FSA)与代码到代码(331 条恶意代码填空、补全与翻译)两类场景,并建立涵盖类别、操作与位置的三层护栏分类体系,评测了策略型、分类器型及内部型共 9 种护栏。
    3. 核心实验结果:基座模型自带对齐在基础 TTP 请求下 ASR 达 15.1%–98.2%(Figure 3);在隐蔽的单轮 FSA 攻击下,各模型 ASR 上升至 85.9%–99.5%,且输入分类器的 ASR 也高达 73.3%–98.5%(Figure 3、Figure 5);在代码到代码任务中,基座模型在代码填空上的 ASR 达 95.0%–100.0%(Figure 3);策略型护栏中仅 SelfReminder 与 SmoothLLM 能带来相对稳定的 ASR 降幅,其余护栏改善有限(Figure 4)。
    4. 作者结论与安全启示:作者指出,当前部署的安全护栏难以有效识别共享良性功能特征的隐蔽恶意代码生成请求,且对代码片段处理能力脆弱,建议未来研究探索结合蜜罐防御等新型主动检测机制,并针对代码生成安全建立更全面的防御体系。
    完整解读
  10. 攻击arXiv:2609.15383 ·

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    测试
    GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个应用层
    场景
    编程 Agent攻击者黑盒
    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
    • 研究定位:该论文针对基于单次交互的大模型安全评估假定,提出了一种通过多交互任务拆解与重组来提取被拒绝能力的攻击范式。
    • 要解决的问题:现有多阶段防御主要依靠对单次请求中完整有害意图的拦截,当攻击者将任务分解为孤立技术细节并保留在外部环境中时,前沿模型的单次拒绝机制无法防止底层能力的泄露与组合利用。
    • 核心方法设计:提出能力洗钱攻击,以本地未对齐小语言模型作为编排器,结合结构化便签与看门狗脚手架,向无状态对齐前沿模型发起目标脱敏的技术咨询,随后在本地验证并拼装完成端到端任务。
    • 主要实验结果:在网络安全基准 CyBench 上,Gemma-4-31B 配合 GPT-5.5 恢复了 8/14(57%)的差距候选任务,配合 Opus 4.8 恢复 7/9(78%);在 BountyBench 上分别恢复 3/9(33%)与 2/3(67%);在生物攻击链评测中,咨询支持使 Gemma-4-31B 平均量规分由 75.3 提升至 83.1。
    • 能力边界发现:能力提升受编排器自身的推理与状态保持能力制约,同量级的 Muse-Glimmer-30B 在真实漏洞任务上取得 0 恢复率;生物链条中具两用特征的上游步骤增益明显,而直接涉及武器化的下游释放步骤几乎无增益。
    • 作者结论与建议:作者认为单次交互层面的对齐无法保障系统级安全,防御体系必须从独立的单次请求过滤,转向能够跟踪请求来源、跨会话推演功能依赖关系的组合感知监控架构。
    完整解读
  11. 攻击arXiv:2608.30441 ·

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹

    测试
    DeepSeek、GPT-4o、Claude 4.8 Opus 等 7 个应用层
    场景
    AI Agent攻击者黑盒
    摘要论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。
    • 研究定位:针对基于大语言模型、需要多步工具调用的长任务智能体系统,研究兼顾高隐蔽性与执行可控性的新型提示词注入攻击机制与评测基准。
    • 核心解决问题:化解现有直接注入因意图过于显式易被安全审查拦截、而分布式间接注入因长序列累积误差导致执行脱轨的固有矛盾。
    • 方法关键设计:提出 ECLIPSE 框架,在离线沙盒中利用影子智能体合成并双阶段验证工具链,渲染为自然的单轮隐蔽用户请求;在工具侧通过静态工作流编码(SWE)改写描述建立状态依赖,并利用动态轨迹校正(DTC)在执行偏离时注入残差修正信号。
    • 关键定量成果:在自建的 120 项长任务基准 LASE-Bench 上,ECLIPSE 对 DeepSeek 的无防御 ASR 达 96.7%、在外部安全过滤下达 69.2%(高出最强基线 27.5 个百分点,Table 2);在 Claude 4.8 Opus 带防御下达 62.4%(最强基线仅 0.8%,Table 2);在最新闭源模型 GPT-5.6 Luna 和 Claude Sonnet 5 带防御下分别达 52.5% 与 60.0%(Table 3)。
    • 迁移性与防御表现:在原生智能体系统 OpenClaw 与 Hermes 上,带防御 ASR 分别达到 61.7% 与 55.8%(Table 6、7);而在面对输入审查、工具边界隔离与轨迹监控防御时,仍能维持 43.3%–85.8% 的 ASR(Figure 6)。
    • 作者结论与启示:作者认为单点或局部的输入与工具过滤难以防范此类将恶意意图跨输入端、工具元数据与多步执行轨迹解耦的攻击,未来的智能体安全防御必须具备跨越多个信息源联合推理的能力。
    完整解读
  12. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个应用层
    场景
    AI Agent
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
  13. 攻击arXiv:2609.30383 ·

    研究者提出技能级联攻击,在 OpenClaw、Claude Code 与 Codex 上平均成功率 89.4%

    提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测

    测试
    GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 10 个应用层
    摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
    • 研究定位:该研究聚焦基于技能的大语言模型智能体生态,形式化并实证评估了将攻击目标分散于多个技能中的技能级联攻击威胁。
    • 核心问题:现代智能体通过共享上下文窗口跨技能传递数据,现有安全防御均基于单技能审查假设,无法发现单个技能看似正常但多技能协同产生危害的安全风险。
    • 方法架构:作者设计了由场景发现、攻击生成、隔离扫描、测试构造和沙箱裁决等 5 个智能体构成的闭环红队框架 SKILLCASCADE,构建并开源了包含 213 个测试用例的 SKILLCASCADE-BENCH 基准。
    • 关键实验结果:在 OpenClaw、Claude Code 与 Codex 配合 8 种骨干模型的 24 种配置下,级联攻击平均 ASR 达到 89.4%(Table 2);面对 5 款单技能扫描器,修改后技能的隐蔽率保持在 86.6% 以上(Table 3);面对 4 种运行时防御框架,平均逃逸率达 88.5%(Table 5);撤销三技能级联中任一修改,残余 ASR 降至 13–18%(Figure 4a)。
    • 作者结论与启示:作者认为组件级别的良性并不等同于系统整体的安全,现有多技能智能体系统在跨技能语义交互层面缺乏有效防护,呼吁安全研究从孤立的单技能审查转向跨技能交互分析与组合安全推理。
    完整解读
  14. 攻击arXiv:2609.33628 ·

    用课程强化学习对前沿模型做提示注入红队测试

    提出跨目标课程强化学习,生成间接提示注入以劫持智能体

    测试
    Qwen3-4B-Instruct-2507、GPT-4o-mini、GPT-5-nano 等 14 个应用层
    场景
    AI Agent
    摘要提出跨目标模型课程强化学习,攻破前沿模型冷启动瓶颈并实现跨模型迁移。

    该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。

    完整解读
  15. 防御arXiv:2609.34518 ·

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出工具智能体的状态攻击DART与预执行防御SAGE

    测试
    GPT-5.6 Luna、GPT-5.6 Terra、Gemini 3.8 Flash 等 8 个应用层
    场景
    AI Agent
    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。
    • 论文定位:该研究从部分可观测状态控制视角研究基于工具调用的语言模型智能体安全,提出了状态控制形式化框架 SEAD 及相应的攻击方法 DART 与预执行防御方法 SAGE。
    • 面临的核心问题:在工具智能体中,攻击者可将危害拆解为看似良性的多步操作,危害最终体现为外部环境状态的持久改变;而各角色仅具有部分可观测性,缺乏环境状态证据导致无法区分合法准备操作与有害越界。
    • 核心方法设计:攻击方法 DART 在已执行前缀树上展开搜索,利用工具执行的真实环境反馈指导分支扩展;防御方法 SAGE 在待执行动作生效前介入,通过有限步私有只读环境查询获取状态证据,消除状态歧义后再做放行或拦截决策。
    • 关键实验结果:在 187 个恶意任务上,DART 在 4 个目标模型上的 Semantic ASR 达到 43.9%–73.3%,Hard ASR 达到 33.2%–54.7%,较对应最佳基线分别提升 18.8–35.9 和 8.1–17.9 个百分点(Table 2);在 75 任务子集的离线评测中,SAGE 取得 95.79% 的良性通过率与 34.55% 的精确闭环拦截率,综合指标 F1 达 50.78%、F2 达 72.86%(Table 3);在线防御中,SAGE 将 DART 对 GPT-5.6 Luna 的 Hard ASR 从 48.0% 降至 4.0%(Figure 3),并在未参与训练的 PostgreSQL 与 Web 任务中展现出跨领域防御能力(Table 5)。
    • 作者结论与启示:作者认为,工具调用将智能体安全转化为围绕关键状态转移的部分可观测控制问题;单纯依赖对话语义或孤立动作难以可靠判断危害,将环境状态证据与执行反馈纳入攻防闭环是提升智能体安全评估与防御能力的关键路径。
    完整解读
  16. 评测与基准arXiv:2609.35912 ·

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    构建多模态技能图像攻击基准MMSkillRisk并设计NCVA

    测试
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个应用层
    摘要论文提出MMSkillRisk基准与NCVA攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
    1. 研究定位与核心问题:本研究针对多模态智能体技能中图像引导可能成为攻击跳板的安全风险,构建了首个可执行的端到端评测基准 MMSkillRisk,系统探究智能体在依赖视觉参考完成任务时能否防御图像潜藏的未授权指令。
    2. 攻击设计与基准构建:作者提出原生上下文视觉攻击(NCVA),将未授权操作伪装成教学图中的原生标注、弹窗或标签,并通过文本提供中立位置引导;基于 28 个多模态技能构建了包含 5 类攻击目标、36 个受污染变体及 108 个用例的评测集,在 Docker 沙箱中通过多模态 LLM 独立评估攻击与任务完成度。
    3. 图像载荷攻击的高有效性:在评估的 9 种模型与框架配置中,NCVA 均诱发了未授权操作,其汇聚 ASR 达到 43.1%,比对应文本匹配基线高出 16.4 个百分点;其中 Codex 搭配 GPT-5.6-sol 的 ASR 达到 81.5%,而 Claude Code 搭配 Claude Opus 4.6 表现出最低的 ASR(12.0%)。
    4. 攻击与良性任务高度共存:评测显示汇聚任务兼容攻击成功率(TC-ASR)达到 36.5%,在 Codex 搭配 GPT-5.6-sol 配置下更是高达 72.2%,作者指出这反映出智能体能够在顺利完成用户合法需求的同时提交危险操作,良性任务完成无法作为安全评判凭据。
    5. 行为转化链路与载体互补性:轨迹分析表明智能体对视觉材料的访问率接近 100%,识别载荷后的尝试操作几乎全部转化为攻击成功;消融实验显示仅保留文本引导时 ASR 归零,仅保留图像载荷时 ASR 降至 1.9%–7.4%,作者称消融结果反映出图像提供语义与文本提供流程权威性的协同机制。
    6. 现有防御盲区与研究启示:评测中 5 款主流技能扫描器对恶意包的检出率最高仅 11.1%,难以识别图像层面的未授权指令;作者认为必须针对多模态技能开发运行时防御机制,不能单纯依赖静态文本检测或任务完成状态来保障智能体安全。
    完整解读
已经到底了