跳到正文
10月8日 · 周四

OpenAI · 论文

精选论文 34 篇
  1. 攻击arXiv:2604.02623 · 56

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    作者通过网页向 Web 智能体注入带条件的轨迹记忆,在 GPT-5-mini 上挫败感利用与混沌结合时 ASRB 达 32.5%。

    • 32.5%GPT-5-mini在挫败感利用与混沌工程下的ASRB(Table 1)
    • 23.4%GPT-5.2在挫败感利用与混沌工程下的ASRB(Table 1)
    • 22.3%GPT-5.2在权威框架策略无混沌下的ASRB(Table 1)
    6 问速览作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。
    1. 这篇论文试图解决什么问题?

      作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。

    2. 有哪些相关研究?

      相关研究涵盖间接提示词注入、智能体记忆攻击与 Web 智能体安全;作者指出既有记忆攻击多假设直接修改存储或多用户共享。

    3. 论文如何解决这个问题?

      eTAMP 通过网页被动注入带条件触发的载荷并存入轨迹记忆,利用任务语义相关性检索激活;辅以 Chaos Monkey 诱发环境压力。

    4. 论文做了哪些实验?

      eTAMP 在 GPT-5-mini 和 GPT-5.2 上分别取得最高 32.5% 和 23.4% 的 ASRB;混沌压力使部分模型易感性增加数倍。

    5. 有什么可以进一步探索的点?

      作者指出了仅研究原始轨迹记忆、未系统评估主动防御、召回测试仅用单一提示词等局限与后续方向。

    6. 总结一下论文的主要内容

      论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    完整解读
  2. 攻击arXiv:2601.02670 · 59

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    作者提出无攻击模型的SLIP,在AdvBench上对11个模型取得平均94.7%的ASR且平均仅需7.9次查询。

    • 94.7%AdvBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 94.4%HarmBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 7.9AdvBench 上 SLIP 每成功攻击一次的平均 API 查询次数(Table 2)
    6 问速览论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。
    1. 这篇论文试图解决什么问题?

      论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。

    2. 有哪些相关研究?

      论文梳理了模型对齐、单轮越狱与多轮越狱工作,重点对比了依赖外部攻击模型的基线及树搜索方法。

    3. 论文如何解决这个问题?

      SLIP 构建安全数据种子池并利用词频与嵌入相似度识别词汇差距,以广度优先搜索驱动模型逐步展开有害回答。

    4. 论文做了哪些实验?

      SLIP 在两项基准上取得约 94% 平均 ASR 且平均仅需 7.9 次查询,现有多轮防御表现出模型间差异。

    5. 有什么可以进一步探索的点?

      作者指出方法仅在英语提示词上验证,防御监控不足以抵御自适应攻击,且表征代理与内部状态可能存在差异。

    6. 总结一下论文的主要内容

      论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。

    完整解读
  3. 攻击arXiv:2607.23496 · 55

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    研究者利用内部表征归因发现脆弱场景,使 Llama-3.1-8B 上的 6 种黑盒攻击平均 ASR 提升 18.2 个百分点。

    • 18.2 个百分点Llama-3.1-8B 在 GuidedBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 14.5 个百分点Llama-3.1-8B 在 HarmBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 49.0%GPT-5 目标模型在 PAIR 攻击下注入 Ministral 场景后的 ASR(Table 2)
    6 问速览探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。
    1. 这篇论文试图解决什么问题?

      探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。

    2. 有哪些相关研究?

      梳理了越狱攻击与安全机械可解释性研究,指出现有方法缺乏表征空间因果归因且未将内部特征转化为可操作场景。

    3. 论文如何解决这个问题?

      提出 Concept2Scenario,通过 SAE 和 CAV 建立表征干预归因,筛选抑制拒绝的特征并闭环转译为可复用的自然语言场景。

    4. 论文做了哪些实验?

      在 3 个开源和 3 个闭源模型上评测 6 种黑盒攻击,脆弱场景使平均 ASR 最高提升 18.2 个百分点并提升多轮攻击效率。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向;实验事实覆盖了 3 个开源与 3 个闭源模型在两个基准上的黑盒攻击评测。

    6. 总结一下论文的主要内容

      该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    完整解读
  4. 攻击arXiv:2608.09867 · 67

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    作者发现商业API加密思维块可在同厂商模型间互通,利用弱模型可绕过前沿模型防护并逐字解密其思维链。

    • 4.9%6,708条公开轨迹解码后至少泄露一项敏感信息的会话比例(据4.1节)
    • 62从真实用户会话解密思维块中恢复的独立API密钥数(据Table 4)
    • 64真实用户会话中仅存在于加密思维而在可见文本中未出现的敏感项数(据Table 4)
    6 问速览论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。
    1. 这篇论文试图解决什么问题?

      论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。

    2. 有哪些相关研究?

      相关工作涉及黑盒模型蒸馏、加密思维块分析、思维链安全与智能体长程注入等方向。

    3. 论文如何解决这个问题?

      将强模型的加密块注入同厂商未严格对齐的弱模型,诱导其逐字转写明文并辅以重构校验。

    4. 论文做了哪些实验?

      实验证实三大厂商模型思维可接近1:1解码,公开轨迹恢复出62个API密钥等敏感凭证。

    5. 有什么可以进一步探索的点?

      作者指出评估受限于特定版本API且无法访问真实明文,评测未穷尽所有公开智能体数据集。

    6. 总结一下论文的主要内容

      论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    完整解读
  5. 攻击arXiv:2609.01222 · 57

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    作者分析了 12 个真实智能体 Harness 的上下文组装设计,提出 16 种攻击向量实现消息角色和跨作用域的特权提升。

    • 28212 个智能体 Harness 中经 CORA 运行时验证的上下文源总数(Table VI)
    • 176112 个智能体 Harness 中由 CORA 枚举的唯一候选 CPE 路径总数(§ VI-C)
    • 1034 (58%)GPT-5.5 在 12 个智能体共 1761 条候选路径上的行为验证结果(Table VII)
    6 问速览智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。
    1. 这篇论文试图解决什么问题?

      智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。

    2. 有哪些相关研究?

      相关研究聚焦于间接提示注入、指令层级防御和智能体扩展规范,本文聚焦智能体 Harness 上下文组装的结构性缺陷。

    3. 论文如何解决这个问题?

      形式化定义 M-CPE 与 X-CPE 两类攻击及 16 种攻击向量,开发静态分析与两轮插桩验证工具 CORA。

    4. 论文做了哪些实验?

      在 12 个智能体上验证了 282 个上下文源与 1761 条路径,在 GPT-5.5 下行为验证率达 58% 并完成端到端 PoC。

    5. 有什么可以进一步探索的点?

      作者指出了 CORA 环境构建失败、模型安全对齐导致未遵循指令等局限,并倡议厂商发布上下文清单(SBOM)。

    6. 总结一下论文的主要内容

      论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    完整解读
  6. 攻击arXiv:2607.26115 · 60

    OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体

    作者通过自博弈强化学习训练红队智能体GPT-Red,使GPT-5.6在Fake CoT提示词注入下的鲁棒性达到95.9%。

    • 95.9%GPT-5.6在Fake CoT攻击下的IH鲁棒性(GPT-5.1为5.2%,Figure 13)
    • 94.3%GPT-5.6在Multi-Defender攻击下的IH鲁棒性(GPT-5.1为0.4%,Figure 13)
    • 99.5%GPT-5.6在System Override攻击下的IH鲁棒性(Figure 13)
    6 问速览解决现有对抗训练数据规模和多样性不足导致模型过拟合、难以抵御自适应提示词注入与越狱攻击的问题。
    1. 这篇论文试图解决什么问题?

      解决现有对抗训练数据规模和多样性不足导致模型过拟合、难以抵御自适应提示词注入与越狱攻击的问题。

    2. 有哪些相关研究?

      涵盖基于优化的对抗攻击、指令层级防御、提示驱动的大模型红队以及多智能体对抗博弈等相关研究。

    3. 论文如何解决这个问题?

      构建带防守者查询接口的智能体脚手架,基于大规模安全环境和多防守者种群进行自博弈强化学习训练。

    4. 论文做了哪些实验?

      在真实智能体、挑战赛基准和留存域上全面评估,GPT-Red突破旧模型并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。

    5. 有什么可以进一步探索的点?

      作者指出多模态与多轮场景训练相对不足,且评测主要集中于特定智能体工具任务并省略了系统级缓解。

    6. 总结一下论文的主要内容

      通过多防守者自博弈训练自主红队智能体GPT-Red,发现复杂漏洞并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。

    完整解读
  7. 攻击arXiv:2609.04533 · 59

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    作者针对黑盒VLM提出自适应视觉提示注入,在DocVQA下对GPT-5.5实现47%工具调用ASR(Table 2)。

    • 47%GPT-5.5在DocVQA的Call-Tool ASR(Table 2)
    • 90%Opus-4.7在DocVQA的Steal-PII ASR(Table 2)
    • 96%Qwen3.6-27B在DocVQA的Call-Tool ASR(Table 2)
    6 问速览现有视觉提示注入在黑盒商用VLM上难以诱发有害行为,论文提出通过前缀诱导在良性任务下实现精确有害输出。
    1. 这篇论文试图解决什么问题?

      现有视觉提示注入在黑盒商用VLM上难以诱发有害行为,论文提出通过前缀诱导在良性任务下实现精确有害输出。

    2. 有哪些相关研究?

      相关研究涵盖视觉越狱、白盒对抗图像与多模态提示注入基准,但多放宽了良性指令竞争或黑盒限制。

    3. 论文如何解决这个问题?

      作者将攻击重塑为响应前缀控制,结合自动化黑盒自适应精炼与成功注入攻击库,诱导目标模型产生精确输出。

    4. 论文做了哪些实验?

      实验覆盖六款VLM与三个场景,该方法的工具调用与隐私窃取ASR均超过基线,并在OpenClaw智能体中实现越权。

    5. 有什么可以进一步探索的点?

      作者指出了高查询量导致API开销大、未测试tool return图像输入以及未针对防御展开自适应攻击等局限。

    6. 总结一下论文的主要内容

      论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。

    完整解读
  8. 攻击arXiv:2609.08236 · 55

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    研究用保持内容不变的样式包装测试8种安全评审器,发现GPT-4o-mini在特定包装下有害漏报率达19.9%而审查模型表现分化。

    • 19.9%GPT-4o-mini通用提示词下token拒绝包装危害隐匿翻转率
    • 12.3%Llama Guard 4在教育框架包装下的危害隐匿翻转率
    • 100.0%Keyword规则评审器在伪合规包装下的虚构危害翻转率
    6 问速览论文探究自动安全评审器是否会因与内容无关的样式修饰改变判定,导致安全评测与防御评估失真。
    1. 这篇论文试图解决什么问题?

      论文探究自动安全评审器是否会因与内容无关的样式修饰改变判定,导致安全评测与防御评估失真。

    2. 有哪些相关研究?

      论文关联了大模型评审器偏置与不一致性、输入端框架敏感性、越狱评测有效性及审查模型防线等工作。

    3. 论文如何解决这个问题?

      论文通过构建内容不变样式包装器,并在控制回复主体逐字节一致的条件下建立包含噪声底线的翻转率评测协议。

    4. 论文做了哪些实验?

      论文在600条基准回复上评估了8种评审器在9种包装下的翻转率,发现特定模型存在漏洞且提示词可抑制翻转。

    5. 有什么可以进一步探索的点?

      作者指出了包装器数量表征、中小模型评审器局限、基准标签噪声及单轮截断等不足,后续方向包括前沿模型与多轮轨迹评估。

    6. 总结一下论文的主要内容

      论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    完整解读
  9. 攻击arXiv:2609.15383 · 57

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    作者发现未对齐SLM可向对齐模型分步咨询并本地组装;CyBench上Gemma-4-31B配GPT-5.5恢复57%候选差距。

    • 57%CyBench:Gemma-4-31B+GPT-5.5候选恢复率
    • 78%CyBench:Gemma-4-31B+Opus 4.8候选恢复率
    • 33%BountyBench:Gemma-4-31B+GPT-5.5恢复率
    6 问速览评估弱未对齐模型能否通过任务拆解向强对齐模型咨询并本地组合,以绕过基于单次交互的对齐防御。
    1. 这篇论文试图解决什么问题?

      评估弱未对齐模型能否通过任务拆解向强对齐模型咨询并本地组合,以绕过基于单次交互的对齐防御。

    2. 有哪些相关研究?

      梳理了直接提示越狱、目标分解攻击及未对齐技术,指出既有分解研究未度量弱编排器的端到端能力增益。

    3. 论文如何解决这个问题?

      设计能力洗钱框架,本地未对齐小模型结合结构化脚手架,向无状态对齐顾问发起脱敏咨询并组装。

    4. 论文做了哪些实验?

      在网络安全两项基准上恢复多项差距候选,生物攻击链评测中上游两用步骤较下游释放步骤得分提升更多。

    5. 有什么可以进一步探索的点?

      作者指出了顾问模型数量、评测基准代表性、生物安全LLM评审偏置及单通道设定等局限与后续方向。

    6. 总结一下论文的主要内容

      作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    完整解读
  10. 攻击arXiv:2609.19587 · 59

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    Opus 5红队测试中,Auto Mode与Guardian的平均ASR超55%(Figure 1)。

    • 65%Opus 5攻击Auto Mode四类攻击平均ASR(Figure 1)
    • 72%Opus 5攻击Guardian四类攻击平均ASR(Figure 1)
    • 9%Opus 5对Auto Mode ++四类攻击平均ASR(Figure 1)
    6 问速览阻断监视器在面对具有持续对抗意图的长程代码智能体时缺乏有效防护与系统性防御设计。
    1. 这篇论文试图解决什么问题?

      阻断监视器在面对具有持续对抗意图的长程代码智能体时缺乏有效防护与系统性防御设计。

    2. 有哪些相关研究?

      涵盖AI Control协议、监视器提示注入、多上下文分解攻击与自动化红队,对比Auto Mode与Guardian。

    3. 论文如何解决这个问题?

      通过红蓝对抗迭代,提出四类攻击方法,并设计集成转录加固、目录监控、压缩检查与智能体阶段的Auto Mode ++。

    4. 论文做了哪些实验?

      在Arena与模拟评测中,生产监视器ASR超55%;Auto Mode ++将平均ASR降至9%,但存在延迟代价。

    5. 有什么可以进一步探索的点?

      作者指出可信监视器假设、未测沙箱及多上下文防御的高延迟代价,模拟机制存在简化。

    6. 总结一下论文的主要内容

      系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。

    完整解读
  11. 攻击arXiv:2609.09553 · 55

    研究:任意密文攻击前沿大模型无需微调即可越狱

    作者通过字母置换提示对前沿模型发起攻击,在 Claude Sonnet 4 上无需微调达成 100% ASR(Table II)。

    • 100%Claude Sonnet 4,Single-shot,ASR(Table II)
    • 80%Claude Sonnet 4.5,Iterative,ASR(Table II)
    • 100%Gemini 3 Flash,Iterative,ASR(Table II)
    6 问速览论文研究在黑盒商业大模型对话 API 中,无需微调即利用任意字母置换密码绕过有害性分类器与安全对齐的可行性。
    1. 这篇论文试图解决什么问题?

      论文研究在黑盒商业大模型对话 API 中,无需微调即利用任意字母置换密码绕过有害性分类器与安全对齐的可行性。

    2. 有哪些相关研究?

      论文梳理了优化类越狱、隐蔽与文本越狱、密码越狱等研究,指出既有密码越狱受限于微调接口或旧模型假设。

    3. 论文如何解决这个问题?

      作者设计了单轮置换与基于示例的递增迭代算法,通过上下文学习引导模型掌握密码,并关闭 reasoning 以绕过对齐。

    4. 论文做了哪些实验?

      测试显示前沿模型在特定密码变体下 ASR 可达 100%,而前代模型 ASR 均为 0%(Table I、II)。

    5. 有什么可以进一步探索的点?

      作者指出了密文拼写错误、回复细节较少、依赖禁用 reasoning 等局限,并提出交互式越狱及防御探索等后续方向。

    6. 总结一下论文的主要内容

      前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    完整解读
  12. 攻击arXiv:2607.18056 · 60

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    Intern-BioBreaker评估前沿模型,在SafeSci-Bio对GPT-5.5实现60%任务级ASR。

    • 60.0%GPT-5.5在SafeSci-Bio上的ASR(Figure 3)
    • 26.0%Claude Opus 4.8在SafeSci-Bio的ASR(Fig 3)
    • 99.5%GPT-5.5在SoSBench-Bio的ASR(Figure 4)
    6 问速览评估前沿模型在生物安全领域的越狱风险,弥补纯文本评测无法反映物理生物威胁的不足。
    1. 这篇论文试图解决什么问题?

      评估前沿模型在生物安全领域的越狱风险,弥补纯文本评测无法反映物理生物威胁的不足。

    2. 有哪些相关研究?

      论文梳理了大模型越狱攻击、双用途生物风险基准及评估饱和研究,并对比了多类基线。

    3. 论文如何解决这个问题?

      构建四阶段训练的红队模型 Intern-BioBreaker,并结合计算筛选与湿实验验证双层流水线。

    4. 论文做了哪些实验?

      评估 14 个前沿模型在两类生物基准上的 ASR,并针对具体蛋白开展序列级计算与湿实验评估。

    5. 有什么可以进一步探索的点?

      作者指出了未进行物理合成及现有筛查机制的局限,并提出了多项治理建议。

    6. 总结一下论文的主要内容

      论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。

    完整解读
  13. 攻击arXiv:2609.38899 · 56

    SceneJail:利用视频场景上下文越狱多模态大模型

    SceneJail通过构造视频情境与搜索提示词越狱Video-MLLM,在HADES上平均ASR达91.47%。

    • 91.47%SceneJail-F在HADES上对8个模型的平均ASR
    • 89.42%SceneJail-S在HADES上对8个模型的平均ASR
    • 78.90%SceneJail-F在SafeBench上8模型平均ASR
    6 问速览视频多模态模型会将画面中的违规查询融入视频情境理解,导致攻击者可通过操纵周围情境与提示词实现黑盒越狱。
    1. 这篇论文试图解决什么问题?

      视频多模态模型会将画面中的违规查询融入视频情境理解,导致攻击者可通过操纵周围情境与提示词实现黑盒越狱。

    2. 有哪些相关研究?

      论文梳理了多模态模型、多模态越狱与视频越狱三类工作,指出既有研究聚焦查询编码而忽视了周围视频情境的攻击作用。

    3. 论文如何解决这个问题?

      SceneJail通过自适应情境构建动态生成适配视频,并利用情境专用记忆搜索引导提示词,形成嵌套黑盒越狱循环。

    4. 论文做了哪些实验?

      在两项基准与8个模型上,SceneJail的ASR均超过现有基线,且分帧变体展现出对单帧图像过滤的抵御能力。

    5. 有什么可以进一步探索的点?

      作者明确指出了生成搜索开销与合成视频环境两项局限,未来可探索轻量化模型及自然长视频场景。

    6. 总结一下论文的主要内容

      论文揭示了视频情境上下文这一未被充分探索的越狱攻击面,通过自适应构建与搜索实现较高越狱成功率,凸显了原生视频防御需求。

    完整解读
  14. 攻击arXiv:2608.06862 · 57

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    SYNCHAIN 诱导 CUA 自合成工件,在三框架无防御 Chain-1 达 97.78%–98.89% ASR。

    • 98.89%OpenClaw 无防御 Chain-1 ASR(Ours Avg.,Table 1)
    • 87.78%OpenClaw 在 GuardAgent 下 Chain-1 ASR(Ours Avg.,Table 1)
    • 72.59%三框架四防御 Chain-2 平均 ASR(SYNCHAIN,4.2 节)
    6 问速览CUA 自合成的持久化工件可成为内部供应链恶意载体,现有防御无法防护跨任务传播。
    1. 这篇论文试图解决什么问题?

      CUA 自合成的持久化工件可成为内部供应链恶意载体,现有防御无法防护跨任务传播。

    2. 有哪些相关研究?

      现有研究聚焦技能增强、外部提示注入与单步后门,缺少对智能体自合成持久化内部供应链风险的研究。

    3. 论文如何解决这个问题?

      通过面向持久化的定向 SFT 诱导模型自合成带潜伏载荷的工件,利用扩展状态递归更新跨步激活。

    4. 论文做了哪些实验?

      在三款智能体和四种防御下测定,Chain-1 ASR 超 90%,Chain-2 仍有效,但更长链受信息瓶颈限制衰减。

    5. 有什么可以进一步探索的点?

      作者指出攻击传播深度受限且缺少体系化来源防御;评测覆盖有限规模的链式任务与特定攻击目标。

    6. 总结一下论文的主要内容

      论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    完整解读
  15. 攻击arXiv:2609.22510 · 59

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    作者评估了条件触发的爆炸提示词,发现其在 Grok-4.20 上对真实工具执行的攻击成功率达 34.2%,而祈使形式为 0.0%。

    • 34.2%Grok-4.20 在 AgentDojo 上的 EP 工具执行成功率(Table 1)
    • 0.0%Grok-4.20 在 AgentDojo 上的 IPI 工具执行成功率(Table 1)
    • 16.5%7 款基础模型在 AgentDojo 上的 EP 配对均值(Table 1)
    6 问速览爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。
    1. 这篇论文试图解决什么问题?

      爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。

    2. 有哪些相关研究?

      论文对比了间接提示注入、智能体攻击、现存检测防御和后门机制,强调时间分离与无持久化特性。

    3. 论文如何解决这个问题?

      论文形式化了爆炸提示词生成空间,揭示条件化绕过机理,并提出了轻量滑动窗口检测器 DeFuse。

    4. 论文做了哪些实验?

      实验覆盖 7 款基础模型、4 类防御与 9 个生产智能体,证实爆炸提示词显著提高绕过率且可在摄入期检出。

    5. 有什么可以进一步探索的点?

      作者指出自适应改写、长会话存活等局限,实际评测覆盖 7 款基础模型与 9 款生产工具。

    6. 总结一下论文的主要内容

      论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    完整解读
  16. 攻击arXiv:2609.36941 · 53

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    作者通过扰动蒸馏本地代理与离线过滤提取黑盒大模型凭据,真实key平均恢复数较直接查询提升11.8%–25.0%(Table 1)。

    • 25.0%DeepSeek-Coder-7B上RS均值较基线提升(Table 1)
    • 11.8%LLaMA-3-8B上RS均值较直接查询基线提升(Table 1)
    • 2.6×弱扰动下真实凭据比例RR较DESEC最大提升(Table 2)
    6 问速览针对商业大模型仅有输出访问权限且缺乏原始上下文的限制,解决代码模型记忆的高熵 API key 提取与防幻觉问题。
    1. 这篇论文试图解决什么问题?

      针对商业大模型仅有输出访问权限且缺乏原始上下文的限制,解决代码模型记忆的高熵 API key 提取与防幻觉问题。

    2. 有哪些相关研究?

      现有工作包括基于代码补全的 HCR、白盒概率引导的 DESEC 及 PII 提取,但均未解决黑盒高熵凭据定向提取。

    3. 论文如何解决这个问题?

      通过 5 种代码前缀扰动与硬标签蒸馏构建本地白盒代理,再通过离线截断采样与局部熵及 4-gram 重复抑制筛选真凭据。

    4. 论文做了哪些实验?

      在 3 个受害模型上真实凭据恢复数提升 11.8%–25.0%,延迟降 20.7–34.8 倍,并从 3 个商业模型中提取出真实凭据。

    5. 有什么可以进一步探索的点?

      作者计划未来开源代码并呼吁更严格的数据清洗,实测未向外部接口发送实时请求;受控实验覆盖 3 个受害模型与 5 家凭据。

    6. 总结一下论文的主要内容

      论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。

    完整解读
已经到底了