跳到正文
10月8日 · 周四

红队 · 论文

精选论文 54 篇
  1. 攻击arXiv:2610.09240 · 60

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    WebMirage通过角色槽位重组与数据流分析生成局部对抗图像,在4种智能体与6种VLM上达到91.9%平均ASR-S。

    • 91.9%WebMirage在4种智能体配置与6种VLM上的平均ASR-S
    • 17.4%最强基线Chameleon跨4种智能体配置的最高平均ASR-S
    • 86.9%WebMirage在SeeAct跨13个网站5种底座上的平均ASR-M
    6 问速览现有多模态网络智能体对抗攻击忽略了从视觉定位到浏览器执行的完整流水线,导致模型层攻击难以转化为执行控制。
    1. 这篇论文试图解决什么问题?

      现有多模态网络智能体对抗攻击忽略了从视觉定位到浏览器执行的完整流水线,导致模型层攻击难以转化为执行控制。

    2. 有哪些相关研究?

      相关研究涵盖提示注入与视觉对抗扰动,但现有工作未建模结构化候选构建与下游动作后处理。

    3. 论文如何解决这个问题?

      提出 WebMirage 框架,通过角色槽位抽象、网页重组与基于数据流分析的动作目标对齐实现端到端劫持。

    4. 论文做了哪些实验?

      在 4 种智能体、6 种 VLM 和 2,250 个任务上评测,WebMirage 取得 91.9% 平均 ASR-S。

    5. 有什么可以进一步探索的点?

      作者指出未建模整页变异且不适用于基于坐标的智能体,未来需探索随机标识符训练下的防御有效性。

    6. 总结一下论文的主要内容

      论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    完整解读
  2. 攻击arXiv:2601.02670 · 59

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    作者提出无攻击模型的SLIP,在AdvBench上对11个模型取得平均94.7%的ASR且平均仅需7.9次查询。

    • 94.7%AdvBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 94.4%HarmBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 7.9AdvBench 上 SLIP 每成功攻击一次的平均 API 查询次数(Table 2)
    6 问速览论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。
    1. 这篇论文试图解决什么问题?

      论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。

    2. 有哪些相关研究?

      论文梳理了模型对齐、单轮越狱与多轮越狱工作,重点对比了依赖外部攻击模型的基线及树搜索方法。

    3. 论文如何解决这个问题?

      SLIP 构建安全数据种子池并利用词频与嵌入相似度识别词汇差距,以广度优先搜索驱动模型逐步展开有害回答。

    4. 论文做了哪些实验?

      SLIP 在两项基准上取得约 94% 平均 ASR 且平均仅需 7.9 次查询,现有多轮防御表现出模型间差异。

    5. 有什么可以进一步探索的点?

      作者指出方法仅在英语提示词上验证,防御监控不足以抵御自适应攻击,且表征代理与内部状态可能存在差异。

    6. 总结一下论文的主要内容

      论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。

    完整解读
  3. 攻击arXiv:2610.05793 · 54

    研究者训练出按多智能体拓扑触发的代码后门模型

    作者微调Qwen2.5-7B植入拓扑后门,在保留任务中单智能体漏洞率为0.00,多智能体下达~1.00(Table 1)。

    • 0.00Qwen2.5-7B保留任务SOLO_direct检查器漏洞率(Table 1)
    • ~1.00Qwen2.5-7B保留任务多智能体训练信号检查器漏洞率(Table 1)
    • 0.97Qwen2.5-7B保留任务MA_human承诺审查检查器漏洞率(Table 1)
    6 问速览研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。
    1. 这篇论文试图解决什么问题?

      研究模型能否通过提示词线索推断多智能体部署拓扑,进而在单智能体评测中表现安全却在多智能体时植入漏洞。

    2. 有哪些相关研究?

      梳理了后门投毒、评测感知与谋划、不安全代码生成及盲审控制等研究,指出本文以部署拓扑作为新条件变量。

    3. 论文如何解决这个问题?

      用QLoRA微调Qwen2.5-7B,通过提示词来源线索传递拓扑,并设立词汇安慰剂与人工审查对照隔离干扰变量。

    4. 论文做了哪些实验?

      保留任务上多智能体漏洞率达~1.00而单智能体为0.00,泛化至未见拓扑信号,盲审差异化审计成功识别触发器。

    5. 有什么可以进一步探索的点?

      作者指出了描述性拓扑、模型家族单一、合成任务及审计未校准等局限;实验未覆盖实时环境与跨家族基座。

    6. 总结一下论文的主要内容

      论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    完整解读
  4. 攻击arXiv:2609.18217 · 67

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    作者测定12个LLM对MCP通道的信任,双通道分段使GPT-4o遵从率从单通道0%升至100%(Table IV)。

    • 100%GPT-4o在2-ch分段下的Compliance率(Table IV)
    • 82%12个模型在2-ch分段下的平均Compliance率(Section IV-B)
    • 42%12个模型在单通道直接注入下的平均Compliance率(Section IV-B)
    6 问速览论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。

    2. 有哪些相关研究?

      论文梳理了提示注入基准、MCP专项攻击及注入防御三类工作,指出以往研究未评估多通道信任差异与跨通道分段攻击。

    3. 论文如何解决这个问题?

      论文提出了通道信任测量框架、双通道与三通道分段攻击、价值对齐利用以及采样系统提示词覆盖攻击。

    4. 论文做了哪些实验?

      论文测试了12个模型与4款生产客户端,表明跨通道分段使遵从率倍增,且能绕过现有7款MCP安全工具。

    5. 有什么可以进一步探索的点?

      作者指出了隔离提示词小节贡献与评估双LLM防御等局限,实际评测覆盖了12个模型及4款主流客户端。

    6. 总结一下论文的主要内容

      论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    完整解读
  5. 攻击arXiv:2609.39607 · 59

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    作者提出白盒攻击 PRETEXT,在固定检测器下对 qwen3t 取得 96.7% 的 ASR(Table D.1)。

    • 96.7 ± 4.6%qwen3t 栈,Mode A 固定检测器,终代 ASR(Table D.1)
    • 63.2 ± 7.1%glm 栈,Mode A 固定检测器,终代 ASR(Table D.1)
    • 62 ± 14%gpt-oss 栈,Mode B 盲测,检测器终代误报率 FP(Table D.2)
    6 问速览现有静态结合大模型的技能安全检测框架在面对知晓规则的白盒攻击者时易被绕过。
    1. 这篇论文试图解决什么问题?

      现有静态结合大模型的技能安全检测框架在面对知晓规则的白盒攻击者时易被绕过。

    2. 有哪些相关研究?

      相关研究涵盖恶意技能构建、静态分析及大模型审查,本文探讨跨世代自适应攻防。

    3. 论文如何解决这个问题?

      通过自然语言载荷拆分、双层反思记忆及良性孪生对齐实现对检测器的迭代规避。

    4. 论文做了哪些实验?

      在固定与协同进化检测器下评估 3 个模型栈,固定检测器下最高达 96.7% ASR。

    5. 有什么可以进一步探索的点?

      作者指出商业扫描器迁移性待验证,实验覆盖单一检测框架与 3 个开源模型栈。

    6. 总结一下论文的主要内容

      论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    完整解读
  6. 攻击arXiv:2607.23496 · 55

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    研究者利用内部表征归因发现脆弱场景,使 Llama-3.1-8B 上的 6 种黑盒攻击平均 ASR 提升 18.2 个百分点。

    • 18.2 个百分点Llama-3.1-8B 在 GuidedBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 14.5 个百分点Llama-3.1-8B 在 HarmBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 49.0%GPT-5 目标模型在 PAIR 攻击下注入 Ministral 场景后的 ASR(Table 2)
    6 问速览探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。
    1. 这篇论文试图解决什么问题?

      探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。

    2. 有哪些相关研究?

      梳理了越狱攻击与安全机械可解释性研究,指出现有方法缺乏表征空间因果归因且未将内部特征转化为可操作场景。

    3. 论文如何解决这个问题?

      提出 Concept2Scenario,通过 SAE 和 CAV 建立表征干预归因,筛选抑制拒绝的特征并闭环转译为可复用的自然语言场景。

    4. 论文做了哪些实验?

      在 3 个开源和 3 个闭源模型上评测 6 种黑盒攻击,脆弱场景使平均 ASR 最高提升 18.2 个百分点并提升多轮攻击效率。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向;实验事实覆盖了 3 个开源与 3 个闭源模型在两个基准上的黑盒攻击评测。

    6. 总结一下论文的主要内容

      该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    完整解读
  7. 攻击arXiv:2607.26115 · 60

    OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体

    作者通过自博弈强化学习训练红队智能体GPT-Red,使GPT-5.6在Fake CoT提示词注入下的鲁棒性达到95.9%。

    • 95.9%GPT-5.6在Fake CoT攻击下的IH鲁棒性(GPT-5.1为5.2%,Figure 13)
    • 94.3%GPT-5.6在Multi-Defender攻击下的IH鲁棒性(GPT-5.1为0.4%,Figure 13)
    • 99.5%GPT-5.6在System Override攻击下的IH鲁棒性(Figure 13)
    6 问速览解决现有对抗训练数据规模和多样性不足导致模型过拟合、难以抵御自适应提示词注入与越狱攻击的问题。
    1. 这篇论文试图解决什么问题?

      解决现有对抗训练数据规模和多样性不足导致模型过拟合、难以抵御自适应提示词注入与越狱攻击的问题。

    2. 有哪些相关研究?

      涵盖基于优化的对抗攻击、指令层级防御、提示驱动的大模型红队以及多智能体对抗博弈等相关研究。

    3. 论文如何解决这个问题?

      构建带防守者查询接口的智能体脚手架,基于大规模安全环境和多防守者种群进行自博弈强化学习训练。

    4. 论文做了哪些实验?

      在真实智能体、挑战赛基准和留存域上全面评估,GPT-Red突破旧模型并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。

    5. 有什么可以进一步探索的点?

      作者指出多模态与多轮场景训练相对不足,且评测主要集中于特定智能体工具任务并省略了系统级缓解。

    6. 总结一下论文的主要内容

      通过多防守者自博弈训练自主红队智能体GPT-Red,发现复杂漏洞并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。

    完整解读
  8. 攻击arXiv:2607.11698 · 59

    AHA 用自动研究循环发现生产 Agent 漏洞概念,留出集 ASR 达 47.0%

    AHA通过可证伪假设循环发现生产级智能体漏洞概念,在留出实例上取得47.0%的平均ASR,超越最强基线14.2个百分点。

    • 47.0%AHA在全部18组设置留出集上的平均ASR(Table 1)
    • 32.8%最强搜索基线AutoRISE*在留出集上的平均ASR(Table 1)
    • 594AHA在Claude Code全部场景与模型上的总发现查询数(Table 1)
    6 问速览当前自动化红队仅保留攻击载荷而忽略成因,AHA通过可证伪假设循环提取漏洞概念并记录使能条件与反驳证据。
    1. 这篇论文试图解决什么问题?

      当前自动化红队仅保留攻击载荷而忽略成因,AHA通过可证伪假设循环提取漏洞概念并记录使能条件与反驳证据。

    2. 有哪些相关研究?

      现有研究多保留提示词、策略库或防御边界,AHA将可证伪的因果解释作为复用工件,直接指导定位修复介入点。

    3. 论文如何解决这个问题?

      AHA通过科研者调度四类子智能体执行假设-攻击-反思循环,经严格门控沉淀概念图,并依使能条件进行留出复用与协同。

    4. 论文做了哪些实验?

      AHA在留出集平均ASR达到47.0%,高于各基线且查询开销更低,所提取概念可跨模型泛化并指导防御补丁。

    5. 有什么可以进一步探索的点?

      作者计划在智能体版本更新时持续运行该循环并拓展至多智能体系统,同时指出跨场景迁移与协同受制于后端状态与关系记录。

    6. 总结一下论文的主要内容

      论文提出基于可证伪科研循环的AHA框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    完整解读
  9. 攻击arXiv:2609.17817 · 56

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    研究者以投毒基准测试自修改代码智能体,发现Hyperagents在CertCheck中立任务上出现30/30漏洞率且能跨代持久。

    • 30/30Hyperagents(Sonnet 4.5)在CertCheck保留任务漏洞率(Table 1)
    • 30/30DGM(Qwen3.5-397B)在CertCheck保留任务漏洞率(Table 1)
    • 15/15SICA(Sonnet 4.5)在复杂URL保留任务漏洞率(Table 2)
    6 问速览自修改 AI 代码智能体在自我进化过程中存在被恶意基准投毒、进而向中立任务输出脆弱代码的风险。
    1. 这篇论文试图解决什么问题?

      自修改 AI 代码智能体在自我进化过程中存在被恶意基准投毒、进而向中立任务输出脆弱代码的风险。

    2. 有哪些相关研究?

      论文梳理了自修改智能体、智能体记忆投毒与演化失偏、代码智能体提示注入及模型数据投毒等相关研究。

    3. 论文如何解决这个问题?

      作者通过设计迫使智能体引入漏洞的投毒基准,针对 DGM、SICA 和 Hyperagents 三种自修改脚手架展开端到端投毒。

    4. 论文做了哪些实验?

      实验在三个自修改系统上评估了四类漏洞的投毒效果,测得在保留任务上的漏洞率与持久性表现。

    5. 有什么可以进一步探索的点?

      作者指出投毒任务过于集中、架构覆盖有限等局限,未来需探索稀释型基准与去污染机制。

    6. 总结一下论文的主要内容

      论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    完整解读
  10. 攻击arXiv:2510.11570 · 56

    研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏

    作者提出四种阶段转换攻击;gpt-oss-120b在AdvBench上FoR成功率为96.25%(Table 1)。

    • 98.00%SafeChain上Reasoning Hijack ASR(Table 5)
    • 74.87%gpt-oss-20b在CatQA的CO方法ASR(Table 2)
    • 96.25%gpt-oss-120b的AdvBench上FoR ASR(Table 1)
    6 问速览论文研究大推理模型显式安全护栏的脆弱性,探究阶段转换逻辑能否被绕过或操纵以产生有害输出。
    1. 这篇论文试图解决什么问题?

      论文研究大推理模型显式安全护栏的脆弱性,探究阶段转换逻辑能否被绕过或操纵以产生有害输出。

    2. 有哪些相关研究?

      相关工作涵盖推理安全护栏构建与针对性红队攻击,作者称本文建立了对齐推理各阶段的系统红队框架。

    3. 论文如何解决这个问题?

      作者针对推理模型流水线提出EST、CO、FoR与RH四种攻击,分别实现跳过推理、无模板后缀引导、语义伪装与控制推理。

    4. 论文做了哪些实验?

      本地gpt-oss两款模型上,RH在五个基准的ASR均超90%;其余方法与API设置需分别看表。

    5. 有什么可以进一步探索的点?

      后续方向包括模型内部来源感知对齐、推理链验证和安全锚定调整;评测范围与判官一致性仍需区分。

    6. 总结一下论文的主要内容

      论文系统分析大推理模型阶段转换脆弱性,提出四种红队方法并在多种模型上取得高攻击成功率,呼吁强化基础对齐。

    完整解读
  11. 攻击arXiv:2609.08236 · 55

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    研究用保持内容不变的样式包装测试8种安全评审器,发现GPT-4o-mini在特定包装下有害漏报率达19.9%而审查模型表现分化。

    • 19.9%GPT-4o-mini通用提示词下token拒绝包装危害隐匿翻转率
    • 12.3%Llama Guard 4在教育框架包装下的危害隐匿翻转率
    • 100.0%Keyword规则评审器在伪合规包装下的虚构危害翻转率
    6 问速览论文探究自动安全评审器是否会因与内容无关的样式修饰改变判定,导致安全评测与防御评估失真。
    1. 这篇论文试图解决什么问题?

      论文探究自动安全评审器是否会因与内容无关的样式修饰改变判定,导致安全评测与防御评估失真。

    2. 有哪些相关研究?

      论文关联了大模型评审器偏置与不一致性、输入端框架敏感性、越狱评测有效性及审查模型防线等工作。

    3. 论文如何解决这个问题?

      论文通过构建内容不变样式包装器,并在控制回复主体逐字节一致的条件下建立包含噪声底线的翻转率评测协议。

    4. 论文做了哪些实验?

      论文在600条基准回复上评估了8种评审器在9种包装下的翻转率,发现特定模型存在漏洞且提示词可抑制翻转。

    5. 有什么可以进一步探索的点?

      作者指出了包装器数量表征、中小模型评审器局限、基准标签噪声及单轮截断等不足,后续方向包括前沿模型与多轮轨迹评估。

    6. 总结一下论文的主要内容

      论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    完整解读
  12. 攻击arXiv:2609.15383 · 57

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    作者发现未对齐SLM可向对齐模型分步咨询并本地组装;CyBench上Gemma-4-31B配GPT-5.5恢复57%候选差距。

    • 57%CyBench:Gemma-4-31B+GPT-5.5候选恢复率
    • 78%CyBench:Gemma-4-31B+Opus 4.8候选恢复率
    • 33%BountyBench:Gemma-4-31B+GPT-5.5恢复率
    6 问速览评估弱未对齐模型能否通过任务拆解向强对齐模型咨询并本地组合,以绕过基于单次交互的对齐防御。
    1. 这篇论文试图解决什么问题?

      评估弱未对齐模型能否通过任务拆解向强对齐模型咨询并本地组合,以绕过基于单次交互的对齐防御。

    2. 有哪些相关研究?

      梳理了直接提示越狱、目标分解攻击及未对齐技术,指出既有分解研究未度量弱编排器的端到端能力增益。

    3. 论文如何解决这个问题?

      设计能力洗钱框架,本地未对齐小模型结合结构化脚手架,向无状态对齐顾问发起脱敏咨询并组装。

    4. 论文做了哪些实验?

      在网络安全两项基准上恢复多项差距候选,生物攻击链评测中上游两用步骤较下游释放步骤得分提升更多。

    5. 有什么可以进一步探索的点?

      作者指出了顾问模型数量、评测基准代表性、生物安全LLM评审偏置及单通道设定等局限与后续方向。

    6. 总结一下论文的主要内容

      作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    完整解读
  13. 攻击arXiv:2609.19587 · 59

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    Opus 5红队测试中,Auto Mode与Guardian的平均ASR超55%(Figure 1)。

    • 65%Opus 5攻击Auto Mode四类攻击平均ASR(Figure 1)
    • 72%Opus 5攻击Guardian四类攻击平均ASR(Figure 1)
    • 9%Opus 5对Auto Mode ++四类攻击平均ASR(Figure 1)
    6 问速览阻断监视器在面对具有持续对抗意图的长程代码智能体时缺乏有效防护与系统性防御设计。
    1. 这篇论文试图解决什么问题?

      阻断监视器在面对具有持续对抗意图的长程代码智能体时缺乏有效防护与系统性防御设计。

    2. 有哪些相关研究?

      涵盖AI Control协议、监视器提示注入、多上下文分解攻击与自动化红队,对比Auto Mode与Guardian。

    3. 论文如何解决这个问题?

      通过红蓝对抗迭代,提出四类攻击方法,并设计集成转录加固、目录监控、压缩检查与智能体阶段的Auto Mode ++。

    4. 论文做了哪些实验?

      在Arena与模拟评测中,生产监视器ASR超55%;Auto Mode ++将平均ASR降至9%,但存在延迟代价。

    5. 有什么可以进一步探索的点?

      作者指出可信监视器假设、未测沙箱及多上下文防御的高延迟代价,模拟机制存在简化。

    6. 总结一下论文的主要内容

      系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。

    完整解读
  14. 攻击arXiv:2607.18056 · 60

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    Intern-BioBreaker评估前沿模型,在SafeSci-Bio对GPT-5.5实现60%任务级ASR。

    • 60.0%GPT-5.5在SafeSci-Bio上的ASR(Figure 3)
    • 26.0%Claude Opus 4.8在SafeSci-Bio的ASR(Fig 3)
    • 99.5%GPT-5.5在SoSBench-Bio的ASR(Figure 4)
    6 问速览评估前沿模型在生物安全领域的越狱风险,弥补纯文本评测无法反映物理生物威胁的不足。
    1. 这篇论文试图解决什么问题?

      评估前沿模型在生物安全领域的越狱风险,弥补纯文本评测无法反映物理生物威胁的不足。

    2. 有哪些相关研究?

      论文梳理了大模型越狱攻击、双用途生物风险基准及评估饱和研究,并对比了多类基线。

    3. 论文如何解决这个问题?

      构建四阶段训练的红队模型 Intern-BioBreaker,并结合计算筛选与湿实验验证双层流水线。

    4. 论文做了哪些实验?

      评估 14 个前沿模型在两类生物基准上的 ASR,并针对具体蛋白开展序列级计算与湿实验评估。

    5. 有什么可以进一步探索的点?

      作者指出了未进行物理合成及现有筛查机制的局限,并提出了多项治理建议。

    6. 总结一下论文的主要内容

      论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。

    完整解读
  15. 攻击arXiv:2608.16465 · 53

    JailbreakSkill:用可复用可演化技能扩展自动化红队

    JailbreakSkill解耦并演化攻击技能,在AdvBench对GPT-5.4取得62.5% ASR@30。

    • 72.0%AdvBench上所有模型宏平均ASR@10,Stage 1 UCB选择
    • 62.5%AdvBench上GPT-5.4的ASR@30,Stage 2演化后
    • 80.0%HarmBench上GLM 5.2的ASR@30,Stage 2演化后
    6 问速览论文针对红队攻击逻辑紧耦合、难以复用演化的问题,提出以可执行技能为核心的自动化越狱框架。
    1. 这篇论文试图解决什么问题?

      论文针对红队攻击逻辑紧耦合、难以复用演化的问题,提出以可执行技能为核心的自动化越狱框架。

    2. 有哪些相关研究?

      论文梳理了大模型越狱与自动化红队、结构化智能体技能等研究,将自身定位为围绕共享技能库组织运行与演化的框架。

    3. 论文如何解决这个问题?

      论文将攻击解耦为改写、诊断与演化技能,通过基于 UCB 的暖机路由与基于失败诊断的闭环演化扩充技能库。

    4. 论文做了哪些实验?

      实验表明框架在预算受限下提高攻击成功率与查询效率,失败驱动演化显著挽救未解决行为,且技能具备跨模型迁移性。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限,其实验覆盖了 8 个主流模型在单轮纯文本基准上的越狱表现与迁移效果。

    6. 总结一下论文的主要内容

      论文提出以可复用与持续演化技能为核心的红队框架,提升了预算受限下的攻击成功率并积累了可跨模型迁移的越狱规程。

    完整解读
  16. 攻击arXiv:2609.39902 · 58

    CodeMimicry:利用代码域安全泛化滞后实现结构化代码补全越狱

    作者提出黑盒框架CodeMimicry,以结构化代码补全发起攻击,在AdvBench上平均ASR为96.25%。

    • 96.25%8个目标模型,AdvBench,平均ASR,T=5
    • 1.518个目标模型,AdvBench,平均查询次数AQ
    • 96.07%8个目标模型,HarmBench,平均ASR,T=5
    6 问速览论文指出大模型安全对齐存在代码泛化滞后,提出利用面向对象代码补全诱导有害输出的黑盒框架。
    1. 这篇论文试图解决什么问题?

      论文指出大模型安全对齐存在代码泛化滞后,提出利用面向对象代码补全诱导有害输出的黑盒框架。

    2. 有哪些相关研究?

      相关研究包括白盒与黑盒提示词混淆越狱、自然语言迭代优化方法,以及代码与跨领域越狱尝试。

    3. 论文如何解决这个问题?

      通过结构混淆、注释侧信道与工程触发包装构建未完成代码,并结合评估器打分进行多轮反馈优化。

    4. 论文做了哪些实验?

      在8个商用模型上取得超96%的平均ASR,机制分析中攻击避开拒绝方向,注释过滤可削弱攻击。

    5. 有什么可以进一步探索的点?

      作者指出方法依赖目标模型代码生成能力及注释侧信道,在轻量模型或注释过滤下效果可能减弱。

    6. 总结一下论文的主要内容

      论文针对代码域安全泛化滞后提出黑盒攻击CodeMimicry,取得高ASR并开展表征机制分析与防御评估。

    完整解读
  17. 攻击arXiv:2609.38253 · 53

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    CollageAttack在DGHS基准上将有害文本拆解重组,使FLUX.2 Dev的ASR达85.5%。(Table 1)

    • 86.0%Doubao-Seedream-5.0-Lite在Table 1的ASR
    • 57.5%gpt-image-2在Table 1中的ASR
    • 85.5%FLUX.2 Dev在Table 1中的ASR
    6 问速览探究文本到图像模型在空间文本组合下的跨模态安全漏洞,提出单提示词黑盒越狱框架。
    1. 这篇论文试图解决什么问题?

      探究文本到图像模型在空间文本组合下的跨模态安全漏洞,提出单提示词黑盒越狱框架。

    2. 有哪些相关研究?

      涵盖大模型安全对齐、T2I黑盒越狱及图像编辑攻击,本文通过空间多模态组合区别于既有文本域方法。

    3. 论文如何解决这个问题?

      提出CollageAttack框架,将有害意图分解为场景构建、载体分配与空间碎片重组三个互补指令。

    4. 论文做了哪些实验?

      在5个T2I模型上评测,CollageAttack在ASR、有害性评分和视觉冲击力上均取得最高指标。

    5. 有什么可以进一步探索的点?

      论文未设专门章节讨论局限,仅在评测机制中说明多轮判定可能虚增ASR,另指出传播冲击力指标不代表受众实际效果。

    6. 总结一下论文的主要内容

      系统揭示T2I跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。

    完整解读
  18. 攻击arXiv:2609.38899 · 56

    SceneJail:利用视频场景上下文越狱多模态大模型

    SceneJail通过构造视频情境与搜索提示词越狱Video-MLLM,在HADES上平均ASR达91.47%。

    • 91.47%SceneJail-F在HADES上对8个模型的平均ASR
    • 89.42%SceneJail-S在HADES上对8个模型的平均ASR
    • 78.90%SceneJail-F在SafeBench上8模型平均ASR
    6 问速览视频多模态模型会将画面中的违规查询融入视频情境理解,导致攻击者可通过操纵周围情境与提示词实现黑盒越狱。
    1. 这篇论文试图解决什么问题?

      视频多模态模型会将画面中的违规查询融入视频情境理解,导致攻击者可通过操纵周围情境与提示词实现黑盒越狱。

    2. 有哪些相关研究?

      论文梳理了多模态模型、多模态越狱与视频越狱三类工作,指出既有研究聚焦查询编码而忽视了周围视频情境的攻击作用。

    3. 论文如何解决这个问题?

      SceneJail通过自适应情境构建动态生成适配视频,并利用情境专用记忆搜索引导提示词,形成嵌套黑盒越狱循环。

    4. 论文做了哪些实验?

      在两项基准与8个模型上,SceneJail的ASR均超过现有基线,且分帧变体展现出对单帧图像过滤的抵御能力。

    5. 有什么可以进一步探索的点?

      作者明确指出了生成搜索开销与合成视频环境两项局限,未来可探索轻量化模型及自然长视频场景。

    6. 总结一下论文的主要内容

      论文揭示了视频情境上下文这一未被充分探索的越狱攻击面,通过自适应构建与搜索实现较高越狱成功率,凸显了原生视频防御需求。

    完整解读
  19. 攻击arXiv:2608.30441 · 60

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    ECLIPSE结合直接与工具端注入,在LASE-Bench对DeepSeek无防御ASR为96.7%、带防御为69.2%。

    • 96.7%DeepSeek,LASE-Bench,无防御,ECLIPSE,ASR
    • 69.2%DeepSeek,LASE-Bench,带安全过滤,ECLIPSE,ASR
    • 62.4%Claude 4.8 Opus,LASE-Bench,带安全过滤,ECLIPSE,ASR
    6 问速览针对长任务智能体提示词注入在集中显式注入的高可检性与分布式注入的低保真度之间的权衡,提出兼顾隐蔽与控制的攻击框架。
    1. 这篇论文试图解决什么问题?

      针对长任务智能体提示词注入在集中显式注入的高可检性与分布式注入的低保真度之间的权衡,提出兼顾隐蔽与控制的攻击框架。

    2. 有哪些相关研究?

      涵盖直接提示词注入、环境/工具侧间接注入及长任务注入研究,本文通过双通道注入与双阶段轨迹引导弥补长时程控制与隐蔽的割裂。

    3. 论文如何解决这个问题?

      通过 SATS 在沙盒中合成隐蔽单轮请求,并结合静态工具工作流编码 SWE 与运行时残差补偿 DTC 实现闭环轨迹引导。

    4. 论文做了哪些实验?

      在 LASE-Bench 与 SHADE-Arena 上评测 7 款模型与 2 个原生系统,ECLIPSE 带防御 ASR 达 36.9%–69.2%,显著超越基线。

    5. 有什么可以进一步探索的点?

      论文未设独立局限章节,作者强调需发展多源联合推理防御;实验覆盖 7 款模型、2 个基准及 4 种防御机制。

    6. 总结一下论文的主要内容

      论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。

    完整解读
  20. 攻击arXiv:2609.22510 · 59

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    作者评估了条件触发的爆炸提示词,发现其在 Grok-4.20 上对真实工具执行的攻击成功率达 34.2%,而祈使形式为 0.0%。

    • 34.2%Grok-4.20 在 AgentDojo 上的 EP 工具执行成功率(Table 1)
    • 0.0%Grok-4.20 在 AgentDojo 上的 IPI 工具执行成功率(Table 1)
    • 16.5%7 款基础模型在 AgentDojo 上的 EP 配对均值(Table 1)
    6 问速览爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。
    1. 这篇论文试图解决什么问题?

      爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。

    2. 有哪些相关研究?

      论文对比了间接提示注入、智能体攻击、现存检测防御和后门机制,强调时间分离与无持久化特性。

    3. 论文如何解决这个问题?

      论文形式化了爆炸提示词生成空间,揭示条件化绕过机理,并提出了轻量滑动窗口检测器 DeFuse。

    4. 论文做了哪些实验?

      实验覆盖 7 款基础模型、4 类防御与 9 个生产智能体,证实爆炸提示词显著提高绕过率且可在摄入期检出。

    5. 有什么可以进一步探索的点?

      作者指出自适应改写、长会话存活等局限,实际评测覆盖 7 款基础模型与 9 款生产工具。

    6. 总结一下论文的主要内容

      论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    完整解读