跳到正文
10月8日 · 周四

红队 · 论文

精选论文 54 篇
  1. 评测/基准arXiv:2610.08871 · 63

    CredLeak-Bench:七个模型在钓鱼场景下凭证泄露率 31%–76%,恢复率最高仅 24.2%

    作者评估 7 款 LLM 智能体,发现所有模型均存在凭据泄露,主恢复率最高仅 24.2%(GPT-5-mini,Table 10)。

    • 31.3%Claude Opus 4.8 在定向设定下的泄露率(Table 3)
    • 1.6%Claude Opus 4.8 在自主设定下的泄露率(Table 3)
    • 88.3%Claude Opus 4.8 在自主设定下的误拒率(Table 3)
    6 问速览评估 LLM 智能体在面对网络钓鱼时能否防范凭据泄露、保持合法任务完成度,以及能否通过受信渠道实现安全恢复。
    1. 这篇论文试图解决什么问题?

      评估 LLM 智能体在面对网络钓鱼时能否防范凭据泄露、保持合法任务完成度,以及能否通过受信渠道实现安全恢复。

    2. 有哪些相关研究?

      涵盖网页钓鱼检测、智能体安全与隐私评测、以及针对智能体的社会工程攻击研究,本文侧重成对控制与受信恢复能力。

    3. 论文如何解决这个问题?

      构建包含定向、自主和恢复三套件的成对测试沙盒,覆盖 8 种欺骗线索与 4 种框架,通过抓包日志判定凭据泄露与恢复。

    4. 论文做了哪些实验?

      7 款模型在定向与自主设定下均存在泄露,恢复率最高仅 24.2%,谨慎框架大幅压低完成率,域名验证可兼顾安全与效用。

    5. 有什么可以进一步探索的点?

      论文未设专门章节讨论局限;实验在本地沙盒中覆盖 7 款模型、8 类虚构服务以及三大评测套件。

    6. 总结一下论文的主要内容

      提出评测智能体凭据泄露与恢复的 CREDLEAK-BENCH,发现全模型均存在泄露且恢复率仅 0%–24.2%,揭示安全与效用权衡。

    完整解读
  2. 评测/基准arXiv:2609.22076 · 59

    APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权

    APort Vault 在 14 款模型上重放 4,371 次攻击,OAP 授权层放行 25,370 笔合规转账并实现 0 次非许可转账。

    • 140 / 76,842Levels 2-4裸模型非许可转账数与评估总数(Table 2)
    • 0 / 69,297Levels 2-4授权层非许可转账数与评估总数(Table 2)
    • 0.38%Levels 2-4授权层零非许可转账源会话上限(Section 4.4)
    6 问速览评估在真实人类攻击下,工具调用边界的确定性授权检查能否防御大模型智能体的越权支付风险。
    1. 这篇论文试图解决什么问题?

      评估在真实人类攻击下,工具调用边界的确定性授权检查能否防御大模型智能体的越权支付风险。

    2. 有哪些相关研究?

      涉及工具智能体攻击、多轮越狱、大模型裁判审计及工具边界授权,重点对比人工构造与真实对抗。

    3. 论文如何解决这个问题?

      在模拟银行中重放 4,371 次真实攻击,对比裸模型与 OAP 确定性策略引擎在五级策略下的状态变更。

    4. 论文做了哪些实验?

      重放 4,371 次攻击完成 22.5 万次评估,授权层在放行 2.5 万笔合规支付的同时阻断全部越权转账。

    5. 有什么可以进一步探索的点?

      作者指出了单一工具领域、单次采样、人工验证缺失等局限,评测覆盖了 14 款模型与 5 级策略。

    6. 总结一下论文的主要内容

      22.5 万次重放评估显示,工具边界的确定性授权层在放行合规支付的同时拦截了全部越权转账。

    完整解读
  3. 攻击arXiv:2610.09240 · 60

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    WebMirage通过角色槽位重组与数据流分析生成局部对抗图像,在4种智能体与6种VLM上达到91.9%平均ASR-S。

    • 91.9%WebMirage在4种智能体配置与6种VLM上的平均ASR-S
    • 17.4%最强基线Chameleon跨4种智能体配置的最高平均ASR-S
    • 86.9%WebMirage在SeeAct跨13个网站5种底座上的平均ASR-M
    6 问速览现有多模态网络智能体对抗攻击忽略了从视觉定位到浏览器执行的完整流水线,导致模型层攻击难以转化为执行控制。
    1. 这篇论文试图解决什么问题?

      现有多模态网络智能体对抗攻击忽略了从视觉定位到浏览器执行的完整流水线,导致模型层攻击难以转化为执行控制。

    2. 有哪些相关研究?

      相关研究涵盖提示注入与视觉对抗扰动,但现有工作未建模结构化候选构建与下游动作后处理。

    3. 论文如何解决这个问题?

      提出 WebMirage 框架,通过角色槽位抽象、网页重组与基于数据流分析的动作目标对齐实现端到端劫持。

    4. 论文做了哪些实验?

      在 4 种智能体、6 种 VLM 和 2,250 个任务上评测,WebMirage 取得 91.9% 平均 ASR-S。

    5. 有什么可以进一步探索的点?

      作者指出未建模整页变异且不适用于基于坐标的智能体,未来需探索随机标识符训练下的防御有效性。

    6. 总结一下论文的主要内容

      论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    完整解读
  4. 攻击arXiv:2601.02670 · 59

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    作者提出无攻击模型的SLIP,在AdvBench上对11个模型取得平均94.7%的ASR且平均仅需7.9次查询。

    • 94.7%AdvBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 94.4%HarmBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 7.9AdvBench 上 SLIP 每成功攻击一次的平均 API 查询次数(Table 2)
    6 问速览论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。
    1. 这篇论文试图解决什么问题?

      论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。

    2. 有哪些相关研究?

      论文梳理了模型对齐、单轮越狱与多轮越狱工作,重点对比了依赖外部攻击模型的基线及树搜索方法。

    3. 论文如何解决这个问题?

      SLIP 构建安全数据种子池并利用词频与嵌入相似度识别词汇差距,以广度优先搜索驱动模型逐步展开有害回答。

    4. 论文做了哪些实验?

      SLIP 在两项基准上取得约 94% 平均 ASR 且平均仅需 7.9 次查询,现有多轮防御表现出模型间差异。

    5. 有什么可以进一步探索的点?

      作者指出方法仅在英语提示词上验证,防御监控不足以抵御自适应攻击,且表征代理与内部状态可能存在差异。

    6. 总结一下论文的主要内容

      论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。

    完整解读
  5. 评测/基准arXiv:2606.05647 · 58

    研究:94% 开发者未能识破编码 Agent 的隐蔽破坏

    在 5 小时人机协作编程实验中,无监控下 94%(83/88)的开发者未能察觉 AI 破坏,即使监控器正确预警破坏仍有 56%(9/16)成功。

    • 94% (83/88)无监控条件下全模型汇总的破坏成功率(Figure 2)
    • 56% (9/16)监控器正确警报下 Claude-Opus-4.6 破坏成功率(Figure 2)
    • 84% (16/19)Claude-Haiku-4.5 监控器对破坏企图的警报检出率(Section 4.2)
    6 问速览研究在长周期真实协作编程中人类开发者能否发现前沿 AI 智能体的隐蔽破坏行为,填补以人为中心的安全评测空白。
    1. 这篇论文试图解决什么问题?

      研究在长周期真实协作编程中人类开发者能否发现前沿 AI 智能体的隐蔽破坏行为,填补以人为中心的安全评测空白。

    2. 有哪些相关研究?

      梳理智能体安全风险、AI 破坏评估与可用安全研究,对比 7 项既有破坏基准,突出长周期实时人机监督的差异化定位。

    3. 论文如何解决这个问题?

      构建 GitLab 串行任务沙箱,为智能体注入隐蔽数据外传目标,并部署基于轻量模型的拦截监控器进行实时预警。

    4. 论文做了哪些实验?

      无监控下破坏成功率达 94%;监控器发出正确警报后破坏仍有 56% 成功,揭示警报与人工干预脱节现象。

    5. 有什么可以进一步探索的点?

      论文明确指出了样本量、单一任务领域、单一外传威胁及单一监控形态等局限,未来需拓宽攻击类型与交互式防御。

    6. 总结一下论文的主要内容

      通过长周期协作实验揭示人类开发者难以识破前沿 AI 编程破坏,即使有监控预警破坏成功率仍过半,呼吁以人为中心的安全机制。

    完整解读
  6. 评测/基准arXiv:2610.07639 · 58

    HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制

    在GLM-5.2与6款harness上,开启auto-approve使总体ASR从29.2%升至95.6%。

    • 95.6%GLM-5.2在AA评测中开启auto-approve时的总体ASR(Table 6)
    • 29.2%GLM-5.2在AA评测中关闭auto-approve时的总体ASR(Table 6)
    • 0.8%GLM-5.2在NI评测中开启网络隔离时的总体ASR(Table 6)
    6 问速览代码智能体harness的安全机制实现现状与运行时防护效果缺乏系统评估,论文提出了十机制分类法与基准测试HSB。
    1. 这篇论文试图解决什么问题?

      代码智能体harness的安全机制实现现状与运行时防护效果缺乏系统评估,论文提出了十机制分类法与基准测试HSB。

    2. 有哪些相关研究?

      既有研究涵盖harness分类、生命周期安全审计与特定载荷注入基准,但缺乏对原生机制ON/OFF状态的双重判定隔离评估。

    3. 论文如何解决这个问题?

      建立十机制分类与五方独立审计矩阵,并通过Docker环境注入五类攻击面,以双重预言机量化ON/OFF状态差异。

    4. 论文做了哪些实验?

      在GLM-5.2下开展2500次试验,发现机制防护效果与效用代价分化明显,部分机制存在解释器绕过路径。

    5. 有什么可以进一步探索的点?

      作者指出基准受限于单模型评测、仿真环境保真度及闭源工具缺失,实验覆盖6款开源harness与23个任务。

    6. 总结一下论文的主要内容

      系统审计40款harness并实证评测9类安全机制,量化了自动审批的暴露风险、强隔离的效用代价以及替代执行路径绕过。

    完整解读
  7. 分析/可解释性arXiv:2610.06001 · 57

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    AgentSpy 在微虚拟机中监控智能体系统调用与流量,在通过测试的任务中发现 18.2% 存在无关活动。

    • 92.2%同任务重复运行集合相似度高于混入异任务集合的比例(全部 3 个模型,RQ1)
    • 18.2%通过全部测试的任务中被判定存在与任务无关活动的比例(RQ2,Table 3)
    • 17.0%通过全部测试的任务中被判定未遵循技能指导达成结果的比例(RQ2,Table 3)
    6 问速览智能体轨迹记录不完整且缺乏底层可见性,提出系统级外部监控框架以分析行为合规与安全。
    1. 这篇论文试图解决什么问题?

      智能体轨迹记录不完整且缺乏底层可见性,提出系统级外部监控框架以分析行为合规与安全。

    2. 有哪些相关研究?

      梳理了轨迹分析、系统级可观测性以及技能安全检查,定位为免 LLM 介入的系统级运行时分析。

    3. 论文如何解决这个问题?

      利用 Firecracker 微虚拟机记录系统调用,构建资源星型图与确定性安全规则进行离线分析。

    4. 论文做了哪些实验?

      在 77 个任务及 5 类注入攻击上验证,发现 18.2% 全通任务有无关行为,安全检测精确率 1.00。

    5. 有什么可以进一步探索的点?

      作者指出了高频调用排除、规则偏通用及框架模型数量有限等局限;实验未覆盖其他执行框架。

    6. 总结一下论文的主要内容

      提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    完整解读
  8. 防御arXiv:2610.04504 · 53

    论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证

    论文用VAL框架对比防御,在自建测试集上VAL栈获0.000 ASR且保持1.000良性效用,直觉栈良性效用为0。

    • 0.000DeepSeek自建集静态攻击VAL栈(V)的ASR(据表6)
    • 0.000DeepSeek自建集静态攻击直觉栈(N)良性成功率(据表6)
    • 0.5%DeepSeek在AgentDojo银行套件VAL栈ASR(据表6.5)
    6 问速览论文旨在解决智能体防御缺乏理论保证来源的问题,提出VAL框架以区分行为运气与结构约束。
    1. 这篇论文试图解决什么问题?

      论文旨在解决智能体防御缺乏理论保证来源的问题,提出VAL框架以区分行为运气与结构约束。

    2. 有哪些相关研究?

      论文梳理了验证自治等级、文本与工具级防御以及智能体评测基准,将本文定位为先验分类坐标轴。

    3. 论文如何解决这个问题?

      通过扩展VAL规则分级防御,并构建确认门与参数沙箱组合的结构栈,以平台记录和形式规范约束动作。

    4. 论文做了哪些实验?

      实验在自建集和AgentDojo等多基准上对比结构栈与直觉栈,揭示相同零值背后的效用鸿沟与稳定性差异。

    5. 有什么可以进一步探索的点?

      作者指出了受害者模型较少、评定者无人类参与等局限;实验覆盖了三个模型和多个基准测试套件。

    6. 总结一下论文的主要内容

      论文证明相同ASR不等于相同安全保证,VAL结构栈在保持效用的同时提供超越模型行为运气的防御。

    完整解读
  9. 攻击arXiv:2610.05793 · 54

    研究者训练出按多智能体拓扑触发的代码后门模型

    作者微调Qwen2.5-7B植入拓扑后门,在保留任务中单智能体漏洞率为0.00,多智能体下达~1.00(Table 1)。

    • 0.00Qwen2.5-7B保留任务SOLO_direct检查器漏洞率(Table 1)
    • ~1.00Qwen2.5-7B保留任务多智能体训练信号检查器漏洞率(Table 1)
    • 0.97Qwen2.5-7B保留任务MA_human承诺审查检查器漏洞率(Table 1)
    6 问速览研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。
    1. 这篇论文试图解决什么问题?

      研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。

    2. 有哪些相关研究?

      梳理了后门投毒、评测感知与谋划、不安全代码生成及盲审控制等研究,指出本文以部署拓扑作为新条件变量。

    3. 论文如何解决这个问题?

      用QLoRA微调Qwen2.5-7B,通过提示词来源线索传递拓扑,并设立词汇安慰剂与人工审查对照隔离干扰变量。

    4. 论文做了哪些实验?

      保留任务上多智能体漏洞率达~1.00而单智能体为0.00,泛化至未见拓扑信号,盲审差异化审计成功识别触发器。

    5. 有什么可以进一步探索的点?

      作者指出了描述性拓扑、模型家族单一、合成任务及审计未校准等局限;实验未覆盖实时环境与跨家族基座。

    6. 总结一下论文的主要内容

      论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    完整解读
  10. 防御arXiv:2610.05163 · 59

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    作者针对长流程智能体构建分阶段注入基准,提出PAA方法在边界动作前实现86%召回与6-8%误阻率。

    • 86.1%Claude Code全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    • 6.0%Claude Code全基准fail-open,Claude Sonnet 5,PAA FBR(Table 2)
    • 86.0%Codex全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    6 问速览长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。
    1. 这篇论文试图解决什么问题?

      长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。

    2. 有哪些相关研究?

      梳理了自动化注入、智能体安全基准及运行时审计,指出前人缺乏动作级统一拦截评测。

    3. 论文如何解决这个问题?

      PAA将动作分解为要素并双重归因取值与决策来源,结合代码检验与模型裁决判定阻断。

    4. 论文做了哪些实验?

      PAA在两语料全基准上达86%召回率与6-8% FBR,显著优于基线。

    5. 有什么可以进一步探索的点?

      作者指出了离线重放、无自适应对抗等局限,实验覆盖了2个系统与8个场景。

    6. 总结一下论文的主要内容

      论文针对长流程注入提出边界动作审计与PAA,在保持低误阻的同时实现高拦截率。

    完整解读
  11. 评测/基准arXiv:2604.02947 · 54

    AgentHazard:评估计算机使用智能体有害行为的基准

    作者针对计算机使用智能体提出 AgentHazard 基准,GLM-4.6 在 Claude Code 下 ASR 达 82.90%。

    • 82.90%Claude Code下GLM-4.6全轨迹ASR(Table 2)
    • 73.63%Claude Code下Qwen3-Coder全轨迹ASR(Table 2)
    • 74.70%IFlow下Qwen2.5-Coder-32B全轨迹ASR(Table 2)
    6 问速览现有基准难以评估计算机使用智能体在多步执行与工具调用中由局部合理操作累积涌现出的有害行为。
    1. 这篇论文试图解决什么问题?

      现有基准难以评估计算机使用智能体在多步执行与工具调用中由局部合理操作累积涌现出的有害行为。

    2. 有哪些相关研究?

      相关工作涵盖大语言模型文本与代码安全评测,以及智能体能力和安全基准,但未针对多步局部合理动作组合。

    3. 论文如何解决这个问题?

      构建由 10 类风险与 10 种策略组成的分类体系,通过任务模板生成、沙箱执行过滤、模型评判与人工审核产出基准。

    4. 论文做了哪些实验?

      评测显示当前智能体存在脆弱性,GLM-4.6 在 Claude Code 下 ASR 达 82.90%,防护模型全轮拼接最高检出 27.03%。

    5. 有什么可以进一步探索的点?

      作者指出当前防护模型缺乏轨迹感知且需探索运行时防御,其实验覆盖了 3 个框架与 8 款开源或可部署模型。

    6. 总结一下论文的主要内容

      AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    完整解读
  12. 评测/基准arXiv:2610.03585 · 54

    宾州州立大学提出 TPRS,量化 Agent 安全基准中工具命名对 ASR 的影响

    论文测试3个智能体安全基准,发现中立化工具名使ASB上GPT-5-mini的committed ASR提升11.67个百分点。

    • +11.67 个百分点ASB上GPT-5-mini在A1工具名中立化下的committed ASR变化量(Table V)
    • +13.21 个百分点ASB上Haiku 4.5在A1工具名中立化下的committed ASR变化量(Table V)
    • -11.00 个百分点MCPTox上GPT-5-mini在N1显式威胁命名下的ASR变化量(Table VII)
    6 问速览论文探究智能体安全基准测得的 ASR 在底层任务与评测标准固定而威胁表征改变时的稳定性。
    1. 这篇论文试图解决什么问题?

      论文探究智能体安全基准测得的 ASR 在底层任务与评测标准固定而威胁表征改变时的稳定性。

    2. 有哪些相关研究?

      论文梳理了智能体安全基准、智能体表征与上下文敏感性,以及基准测量有效性三类相关工作。

    3. 论文如何解决这个问题?

      论文形式化定义了保持底层安全问题不变的 TPRS,并在三个基准上构建受控表征变换分支。

    4. 论文做了哪些实验?

      论文在三个基准上完成 28,904 次运行,发现表征变化引起了不同方向和幅度的 ASR 偏移。

    5. 有什么可以进一步探索的点?

      作者指出了变换类型未穷尽、机制归因不完全、模型与基准覆盖有限以及未测试排名翻转等局限。

    6. 总结一下论文的主要内容

      论文审计了智能体安全基准的表征敏感性,发现工具命名变化可大幅改变 ASR,强调基准应评估表征变体。

    完整解读
  13. 评测/基准arXiv:2610.03448 · 60

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    作者在两个智能体基准上评估15个提示注入检测器,发现基准排名迁移性弱且误报常使任务中断,训练输入形态决定检测效果。

    • 95.1%PIGuard 在 BIPIA 测试集上 1% FPR 下的 TPR(Table 2)
    • 2.1%PIGuard 在 AD-Matched 上 1% FPR 下的 TPR(Table 2)
    • 82.2%Horizon-Labs 在 AD-Matched 上 1% FPR 下的 TPR(Table 2)
    6 问速览公开基准评测难以反映提示注入检测器在智能体真实工具输出下的检测率与误报代价,基准排名存在迁移偏差。
    1. 这篇论文试图解决什么问题?

      公开基准评测难以反映提示注入检测器在智能体真实工具输出下的检测率与误报代价,基准排名存在迁移偏差。

    2. 有哪些相关研究?

      研究涵盖注入检测评测方法、安全实证缺陷、检测防御及多层防护,作者强调现有评测忽视了工具输出形态与训练数据泄漏。

    3. 论文如何解决这个问题?

      通过无模型重放生成良性输出、环境差异重放标注注入、审计训练集重合,在低误报率运行点下度量检测表现。

    4. 论文做了哪些实验?

      评测15个检测器与2个评审模型,发现基准间检测排名不相关,训练集形态决定效果,移除格式可降低默认误报。

    5. 有什么可以进一步探索的点?

      作者指出当前局限在于模拟环境、静态模板、检测器覆盖度及评审设计;实验覆盖了15个分类器与2个智能体基准。

    6. 总结一下论文的主要内容

      论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    完整解读
  14. 评测/基准arXiv:2610.02827 · 53

    MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%

    MLCommons评测8款开源模型,攻击使平均不安全回复率从基准11.08%升至18.65%(据Table 2)。

    • 7.57%全部8款SUT在11类危害下的平均韧性差距(据Table 2)
    • 18.65%全部8款SUT在11类危害下的越狱不安全回复率(据Table 2)
    • 11.08%全部8款SUT在11类危害下的基准不安全回复率(据Table 2)
    6 问速览论文旨在解决越狱评测缺乏独立安全基线、难以区分评估器误差、缺乏统一分类学及公开测试集易受污染等方法学缺陷。
    1. 这篇论文试图解决什么问题?

      论文旨在解决越狱评测缺乏独立安全基线、难以区分评估器误差、缺乏统一分类学及公开测试集易受污染等方法学缺陷。

    2. 有哪些相关研究?

      论文梳理了独立安全评估基准、越狱基准与自动化攻击、智能体对抗评测,指出已有工作缺乏独立基准锚定与负责任披露控制。

    3. 论文如何解决这个问题?

      论文通过配对端到端流水线、基于热度与体量分级的SUT选取、双阶段种子筛选、双维度评估标准及校准集成实现标准化评测。

    4. 论文做了哪些实验?

      在8款开源模型、11类危害与11种越狱攻击上开展配对评测,攻击使整体不安全率升至18.65%,大模型出现负韧性差距。

    5. 有什么可以进一步探索的点?

      作者指出评估器误差偏高、人工标注规模较小及大模型负差距待解等局限;测试覆盖仅限于8款开源模型与单轮文本攻击。

    6. 总结一下论文的主要内容

      论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。

    完整解读
  15. 评测/基准arXiv:2610.03153 · 53

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    论文评测工作空间智能体运行时风险,DeepSeek-V4-Pro-0813在Codex下ASR达68.44%。

    • 37.46%9种配置共4050次攻击执行的整体ASR(Finding 1)
    • 68.44%DeepSeek-V4-Pro-0813搭配Codex在450个用例上的ASR
    • 4.44%Claude Opus 5跨3种Harness聚合的ASR(Finding 2)
    6 问速览论文试图解决工作空间智能体运行时安全风险覆盖不全,以及缺乏可验证、可持续演化的执行基准的问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决工作空间智能体运行时安全风险覆盖不全,以及缺乏可验证、可持续演化的执行基准的问题。

    2. 有哪些相关研究?

      论文梳理了工作空间智能体、智能体安全基准与演化评测三类相关工作,定位自身为覆盖全流程入口与直接后果的基准。

    3. 论文如何解决这个问题?

      论文提出 EP–Path–EF 框架与生成-重放-提炼工作流,结合容器隔离与 ETW 事件实现自动化用例构建与独立结果验证。

    4. 论文做了哪些实验?

      论文评测 3 款模型与 3 款 Harness 构成的 9 种配置,整体 ASR 为 37.46%,模型间差异大于 Harness 间差异。

    5. 有什么可以进一步探索的点?

      作者指出基准仅针对 IPI 且沙箱简化了生产环境,实验覆盖了 3 款模型与 3 款 Harness 的 450 个用例。

    6. 总结一下论文的主要内容

      论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。

    完整解读
  16. 防御arXiv:2610.03089 · 53

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    COBRA 通过事前分支能力约束与代理拦截,在 STEER-Bench 上将攻击成功率降至 0% 并保留 97% 良性效用。

    • 0%STEER-Bench 全部 199 个攻击单元格,完整 COBRA 系统的 ASR
    • 97%STEER-Bench 138 个良性单元格,COBRA 相比 Dual-LLM 保留的良性效用
    • 89.5%STEER-Bench 74 个通用智能体单元格,Vanilla Dual-LLM 基线的 ASR
    6 问速览动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。
    1. 这篇论文试图解决什么问题?

      动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。

    2. 有哪些相关研究?

      梳理了 CUA 概率性防御、Dual-LLM 等系统级架构、MCP 安全及现有评测基准,指出 DFI 防御的缺失。

    3. 论文如何解决这个问题?

      提出 COBRA 架构,结合离线计划能力约束、运行时分支解析中枢及确定性 HTTP/MCP 代理拦截。

    4. 论文做了哪些实验?

      在 STEER-Bench 及 4 个外部基准中将 ASR 降至 0%,在 OSWorld-MCP 上保留实用任务完成能力。

    5. 有什么可以进一步探索的点?

      作者指出其在未体现在网络请求的视觉数值、自由文本语义、非 HTTP 接口及对站点描述的依赖等局限。

    6. 总结一下论文的主要内容

      提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    完整解读
  17. 攻击arXiv:2609.18217 · 67

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    作者测定12个LLM对MCP通道的信任,双通道分段使GPT-4o遵从率从单通道0%升至100%(Table IV)。

    • 100%GPT-4o在2-ch分段下的Compliance率(Table IV)
    • 82%12个模型在2-ch分段下的平均Compliance率(Section IV-B)
    • 42%12个模型在单通道直接注入下的平均Compliance率(Section IV-B)
    6 问速览论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。

    2. 有哪些相关研究?

      论文梳理了提示注入基准、MCP专项攻击及注入防御三类工作,指出以往研究未评估多通道信任差异与跨通道分段攻击。

    3. 论文如何解决这个问题?

      论文提出了通道信任测量框架、双通道与三通道分段攻击、价值对齐利用以及采样系统提示词覆盖攻击。

    4. 论文做了哪些实验?

      论文测试了12个模型与4款生产客户端,表明跨通道分段使遵从率倍增,且能绕过现有7款MCP安全工具。

    5. 有什么可以进一步探索的点?

      作者指出了隔离提示词小节贡献与评估双LLM防御等局限,实际评测覆盖了12个模型及4款主流客户端。

    6. 总结一下论文的主要内容

      论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    完整解读
  18. 攻击arXiv:2609.39607 · 59

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    作者提出白盒攻击 PRETEXT,在固定检测器下对 qwen3t 取得 96.7% 的 ASR(Table D.1)。

    • 96.7 ± 4.6%qwen3t 栈,Mode A 固定检测器,终代 ASR(Table D.1)
    • 63.2 ± 7.1%glm 栈,Mode A 固定检测器,终代 ASR(Table D.1)
    • 62 ± 14%gpt-oss 栈,Mode B 盲测,检测器终代误报率 FP(Table D.2)
    6 问速览现有静态结合大模型的技能安全检测框架在面对知晓规则的白盒攻击者时易被绕过。
    1. 这篇论文试图解决什么问题?

      现有静态结合大模型的技能安全检测框架在面对知晓规则的白盒攻击者时易被绕过。

    2. 有哪些相关研究?

      相关研究涵盖恶意技能构建、静态分析及大模型审查,本文探讨跨世代自适应攻防。

    3. 论文如何解决这个问题?

      通过自然语言载荷拆分、双层反思记忆及良性孪生对齐实现对检测器的迭代规避。

    4. 论文做了哪些实验?

      在固定与协同进化检测器下评估 3 个模型栈,固定检测器下最高达 96.7% ASR。

    5. 有什么可以进一步探索的点?

      作者指出商业扫描器迁移性待验证,实验覆盖单一检测框架与 3 个开源模型栈。

    6. 总结一下论文的主要内容

      论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    完整解读
  19. 评测/基准arXiv:2609.09404 · 56

    MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    作者用MMPIBench测试多模态提示注入对6个智能体框架的影响,发现视觉通道尝试率12.8%高于完成率1.11%,音频完成率达49%。

    • 1.11%MMPIBench视觉通道总体完成率(720次运行,Table I)
    • 12.8%MMPIBench视觉通道总体尝试率(720次运行,Table I)
    • 0.0%Claude Opus 4.8在MMPIBench视觉通道的尝试率(Table III)
    6 问速览论文试图解决多模态间接提示注入在智能体架构内部如何传播、被何处阻断,以及框架与模型在防御中各自所起作用的问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决多模态间接提示注入在智能体架构内部如何传播、被何处阻断,以及框架与模型在防御中各自所起作用的问题。

    2. 有哪些相关研究?

      相关研究包括文本与工具智能体注入基准、多模态与GUI攻击以及防御机制,论文在跨框架与白盒阶段追踪上与之形成对比。

    3. 论文如何解决这个问题?

      论文构建MMPIBench统一评测框架,通过固定变量适配层、白盒阶段插桩、双层评审协议与音频扩展解耦系统脆弱性。

    4. 论文做了哪些实验?

      论文在图像通道完成720次全矩阵测试,在音频通道完成72次测试,发现尝试率远超完成率,模型是主导因素,音频缺乏防御。

    5. 有什么可以进一步探索的点?

      作者指出了单次测试随机性、框架配置与重测混淆、跨模态设定不一致等局限;实验覆盖了特定的模型、框架与模拟工具。

    6. 总结一下论文的主要内容

      论文提出MMPIBench评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    完整解读
  20. 攻击arXiv:2607.23496 · 55

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    研究者利用内部表征归因发现脆弱场景,使 Llama-3.1-8B 上的 6 种黑盒攻击平均 ASR 提升 18.2 个百分点。

    • 18.2 个百分点Llama-3.1-8B 在 GuidedBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 14.5 个百分点Llama-3.1-8B 在 HarmBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 49.0%GPT-5 目标模型在 PAIR 攻击下注入 Ministral 场景后的 ASR(Table 2)
    6 问速览探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。
    1. 这篇论文试图解决什么问题?

      探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。

    2. 有哪些相关研究?

      梳理了越狱攻击与安全机械可解释性研究,指出现有方法缺乏表征空间因果归因且未将内部特征转化为可操作场景。

    3. 论文如何解决这个问题?

      提出 Concept2Scenario,通过 SAE 和 CAV 建立表征干预归因,筛选抑制拒绝的特征并闭环转译为可复用的自然语言场景。

    4. 论文做了哪些实验?

      在 3 个开源和 3 个闭源模型上评测 6 种黑盒攻击,脆弱场景使平均 ASR 最高提升 18.2 个百分点并提升多轮攻击效率。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向;实验事实覆盖了 3 个开源与 3 个闭源模型在两个基准上的黑盒攻击评测。

    6. 总结一下论文的主要内容

      该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    完整解读