跳到正文
10月8日 · 周四

OpenAI · 论文

找到 13 篇

另有 12 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2604.02623 ·

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出eTAMP,通过网页注入跨会话污染Web智能体轨迹记忆

    测试
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 7 个应用层
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    完整解读
  2. 攻击arXiv:2601.02670 ·

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    提出无外部攻击模型的多轮自我越狱方法SLIP

    测试
    GPT-5.1、GPT-4o、Claude-Sonnet-4.5 等 11 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
    • 研究定位与核心问题:论文针对大语言模型的多轮安全风险,提出并探究了“自我越狱”这一威胁模型,旨在无需外部对抗攻击模型生成载荷的前提下,仅利用目标模型自身潜在知识实现黑盒越狱。
    • 方法核心机制:设计了基于词汇插入提示的算法 SLIP,通过良性安全数据构建框架诱导目标模型初始化种子样本对,随后在多轮对话树中采用广度优先搜索,计算逆词频与词向量距离以迭代插入缺失的关键词锚点,并在展开阶段通过样本索引规避单轮安全拦截。
    • 主要实验结果:在 AdvBench 和 HarmBench 基准上对 11 个模型进行测试,SLIP 分别取得 94.7% 和 94.4% 的平均 ASR;在 GPT-4o、Gemini-2.5-Pro 等模型上达到 100% ASR,且平均单次成功仅需 7.9 次 API 查询,查询量少于已有基线。
    • 高难度模型与例外:在对齐严格的 Claude-Opus-4.5 上 SLIP 取得 61.4%(AdvBench)和 68.7%(HarmBench)的 ASR,高于对比基线;而在 Claude-Sonnet-4.5 上 X-Teaming 取得更高 ASR(AdvBench 上 95.1% 对 94.8%),体现出模型间的非绝对优势。
    • 防御评测与监控机制:评估显示现有多轮与单轮防御因缺乏跨轮记忆难以有效阻拦 SLIP;作者设计的会话级语义漂移监控器(SDM)在 5% FPR 下取得 76% 检测率,但加入良性对话的自适应伪装策略仍可使 ASR 回升至 43%。
    • 作者结论与安全启示:作者认为,已对齐模型保留了有害能力的潜在表示,安全对齐在实践中主要压制了表面输出而非抹除能力,未来的模型安全防御必须从单轮文本过滤走向多轮会话意图追踪,并针对多轮对抗样本实施模型级微调。
    完整解读
  3. 攻击arXiv:2607.23496 ·

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 10 个提示层
    场景
    模型与 API攻击者白盒黑盒
    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
    • 研究定位:该论文提出了基于表征因果归因的脆弱场景发现框架 Concept2Scenario,旨在从机械可解释性视角揭示场景包装削弱大模型拒绝的内部机制,并将其转化为可复用的自然语言攻击先验。
    • 问题与机理核心:针对现有红队主要依赖经验和试错、缺乏内部因果解释的问题,论文发现模型内部存在能够因果抑制拒绝方向的潜在场景表征,证实场景包装通过激活特定概念来降低拒绝倾向。
    • 方法设计要点:在开源模型中间层残差流训练稀疏自编码器(SAE)提取解耦概念,在末层利用线性探针(CAV)量化拒绝分数;在 5,000 条有害请求上沿概念解码方向实施标准化干预以筛选强抑制特征,通过分析大模型实现概念解读与“概念 → 场景 → 概念”闭环验证,并利用交互归因挖掘协同场景组合。
    • 核心实验结果:在 GuidedBench 基准上,将挖掘出的场景注入 6 种黑盒攻击后,Llama-3.1-8B 的全攻击平均 ASR 提升了 18.2 个百分点(从 33.3%–94.5% 提升至 84.5%–98.3%);在 HarmBench 上平均提升 14.5 个百分点;在智能体评测 AgentHarm 上,场景引导重写使 Qwen3.5-9B 的任务完成度提升 7.1 个百分点。
    • 跨模型迁移与多轮加速:仅由开源模型挖掘的场景可直接迁移至商业黑盒模型,使 GPT-5 在 PAIR 攻击下的 ASR 达到 49.0%(较基线提升 27.5 个百分点);交互归因筛选的协同组合使 Llama-3.1-8B 上 PAIR 的首轮攻击成功率从单场景的 53.0% 提升至 81.0%。
    • 作者结论与启示:作者认为大模型的内部表征已编码了其自身的脆弱场景,且部分场景漏洞在不同模型家族间具备通用性;基于表征空间的归因分析能够为自动化红队评估与针对性安全防御提供可解释的先验支撑。
    完整解读
  4. 攻击arXiv:2608.09867 ·

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    测试
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5 等 15 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
    • 论文定位:本文揭示了主流商业大模型 API(Anthropic、OpenAI、Google)用于维护无状态架构的客户端加密思维链数据块存在跨会话、跨用户与跨模型的系统性互换漏洞。
    • 要解决的问题:厂商为了保护商业知识产权并防范有害信息外泄而隐藏思维链,但在生态内部广泛启用了宽松的加密块兼容性,使得强模型的内省对齐防线因同厂商弱模型的安全不对称性而面临被击穿的风险。
    • 方法核心机制:提出了一种基于弱模型充当模糊解密器的解密越狱方法;攻击者将强模型生成的加密签名注入同厂商低成本且防御宽松的弱模型(如 Claude Haiku 4.5、GPT-5.6 Luna、Gemini Robotics 1.6)中,利用输出预填或针对性提示词诱导其将加密内容逐字转写为明文,必要时结合强模型进行去噪调和。
    • 核心实验发现:
      1. 在 120 道 Codeforces 题目上,解密生成的 token 数量与 API 报告的原始计费思维 token 数量呈 1:1 紧密追踪(Figure 1)。
      2. 从公开抓取的 6,708 条智能体交互日志(315,320 个加密块)中解密出 941 项独立敏感伪影,从真实用户会话中恢复出 62 个 API 密钥、33 个密码等凭证,其中 64 项仅存在于加密思维而在可见聊天记录中已被用户清洗(Table 4)。
      3. 成功演示了将 HarmBench 恶意请求的隐藏思考还原为未审查输出,以及将恶意备份指令隐藏于加密块向 GPT-5.6 Sol 和 Opus 4.7 实施隐蔽提示词注入(Section 3.2、Section 4.2)。
      4. 预填 1% 的 Opus 4.8 思维可使 Kimi-K3 在 HLE STEM 题目上的最佳可见回答 n-gram 重叠度从 0.160 上升至 0.305(Table 3)。
    • 作者结论与启示:当前将加密数据对用户保密却对第三方缺乏防重放保护的设计无法保障隐私与安全;作者建议采用服务端存储的有状态架构,或在 AEAD 关联数据中强制绑定用户与会话哈希链,并呼吁行业重视多模型生态中弱模型的对齐短板。
    完整解读
  5. 攻击arXiv:2609.01222 ·

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体

    测试
    GPT-5.5、GPT-5.4 mini、Claude-Sonnet-4.6 等 7 个应用层
    摘要论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。

    完整解读
  6. 攻击arXiv:2607.26115 ·

    OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体

    提出自博弈红队智能体GPT-Red,自动挖掘提示注入与越狱攻击

    测试
    GPT-5.6、GPT-5.5、GPT-5.4 等 8 个应用层
    场景
    AI Agent攻击者黑盒
    摘要通过多防守者自博弈训练自主红队智能体GPT-Red,发现复杂漏洞并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。
    • 一句话定位:提出了通过大规模自博弈强化学习训练的自主红队智能体 GPT-Red,并将其用于前沿大模型 GPT-5.6 的对抗鲁棒性训练。
    • 要解决的问题:现有大模型对抗训练依赖规模受限且静态的人类或提示驱动攻击数据,容易发生过拟合并被自适应攻击绕过,亟需具备自适应搜索与持续进化能力的自动化红队生成体系。
    • 方法要点:为攻击者提供 terminal 与 stateful defender_model 工具以支持推理期搜索;构建覆盖工具调用、本地文件、网页浏览和多模态渲染的现实红队强化学习环境;采用多防守者种群的自博弈强化学习训练,通过非对称奖励驱动攻防双方共同进化并防止策略坍缩。
    • 核心实验结果:
      1. 在 IPI Challenge 留存间接提示词注入任务上,GPT-Red 在 100x 计算量下 ASR 超过 80%,高于人类红队与 GPT-5.5 基线(Figure 1);
      2. 针对 OpenAI 办公室内真实 AI 自动售货机系统 Vendy,GPT-Red 达成了低价改价、高价新品下单和取消订单三项实际恶意目标(Figure 9,第 11 页);
      3. 引入 GPT-Red 样本进行对抗训练使 GPT-5.6 在 Fake CoT 攻击下的防御鲁棒性从 GPT-5.1 的 5.2% 提升至 95.9%(Figure 13),在留存攻击、数据集和领域的鲁棒性分别达到 72.0%、56.1% 和 89.1%(Figure 11)。
    • 作者结论与启示:作者认为攻防自博弈为模型安全提供了自我提升路径,但多模态、多轮对抗以及防范人类可能挖掘出的新攻击类别仍是未来持续探索的方向。
    完整解读
  7. 攻击arXiv:2609.04533 ·

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私

    测试
    Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 11 个应用层
    场景
    AI Agent
    摘要论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
    1. 研究定位与核心问题:论文针对多模态AI智能体面临的非受信数据威胁,研究在良性用户任务竞争与黑盒API访问条件下,如何仅通过外部图像输入诱导前沿VLM执行盗取隐私与原生工具调用等实质危害行为。
    2. 方法设计要点:作者提出Repeat-After-Me(RAM)框架,将攻击从意图覆盖转换为响应前缀控制,在图像顶部渲染前缀诱导语句;利用Claude-Opus-4.6作为攻击与评审LLM开展黑盒自适应迭代精炼,并构建包含32种改写模式的攻击库以加速搜索。
    3. 主实验与迁移表现:在DocVQA良性任务下,RAM在Steal-PII场景对四款VLM实现不低于99%的ASR(Table 2);在Call-Tool场景对GPT-5.5和Claude-Opus-4.7达到47% ASR,对Qwen3.6-27B达到96%(Table 2);针对Claude-Opus-4.7优化的攻击在GPT-5.5上迁移保留率为43%(Table 3)。
    4. 真实智能体越权验证:在OpenClaw智能体评估中,纯文本提示注入在GPT-5.5上ASR为0%,而RAM图文混合注入对GPT-5.5和Gemini-3.1-Pro分别取得90%和100%的ASR(Table 4),在真实Discord测试中通过改写TOOLS.md实现了未授权代码执行。
    5. 防御评估与作者启示:基础防御性提示词、图像模糊与OCR过滤均无法在各模型上普遍消除攻击,如Unfiltered OCR + Sandwich在GPT-5.5上仍有21% ASR(Table 10);作者认为前沿VLM尚未配备充分的视觉安全防线,智能体安全评估必须引入针对视觉通道的自适应自动化红队测试。
    完整解读
  8. 攻击arXiv:2609.08236 ·

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    测试
    Keyword (rulebased)、GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject) 等 12 个提示层
    场景
    模型与 API攻击者无盒黑盒
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    • 核心定位与研究问题:论文探究以 Llama Guard 和大模型打分提示词为代表的自动安全裁判,在回复的操作性主体内容完全保持不变的情况下,是否会仅因外层语气或框架修饰而改变安全与否的判定。
    • 方法设计:研究者设计了 9 种在字节级别保持回复内容不变的样式包装器(包含 6 种隐匿危害与 3 种虚构危害包装,并划分为纯语气层与增添断言层),在来自 JailbreakBench 的 600 条多模型回复上对 8 种评审器展开评测,建立包含噪声底线测定与 Holm 配对校正的评估流程。
    • 大模型评审器的盲点:在通用提示词下,GPT-4o-mini 对带有先声明拒绝再遵从框架(refusal-then-comply)的有害回复产生了 19.9% 的翻转率(95% CI [15.0, 24.0],Holm p < 10^-4),而其在原始回复上的噪声底线仅为 0.5%;三判两胜重测下该翻转率仍保持在 18.2%。
    • 部署型审查模型的差异表现:部署型审查模型 Llama Guard 4 对教育场景框架(educational framing)产生了 12.3% 的有害漏报翻转(Holm p < 0.05),对 token 拒绝包装产生了 8.3% 的翻转;而专用推理安全分类器 gpt-oss-safeguard-20b 在全部包装下的翻转率均不超过 1.2%,处于其自身 1.5% 噪声底线之内。
    • 提示词改进的防御效果:在相同模型 GPT-4o-mini 上,采用明确要求忽略外层语气的 StrongREJECT 风格提示词后,token 拒绝包装的翻转率从 19.9% 降至 1.7%,降幅约为十倍。
    • 作者结论与建议:作者认为安全评审器的脆弱性并非普遍均匀分布,而是呈现模型特异性盲点;作者建议安全基准与防御评估在报告安全得分的同时,应报告面对内容不变修饰时的翻转预算(flip budget),并在采用评审器前对其样式不变性进行先期审计。
    完整解读
  9. 攻击arXiv:2609.15383 ·

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    测试
    GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个应用层
    场景
    编程 Agent攻击者黑盒
    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
    • 研究定位:该论文针对基于单次交互的大模型安全评估假定,提出了一种通过多交互任务拆解与重组来提取被拒绝能力的攻击范式。
    • 要解决的问题:现有多阶段防御主要依靠对单次请求中完整有害意图的拦截,当攻击者将任务分解为孤立技术细节并保留在外部环境中时,前沿模型的单次拒绝机制无法防止底层能力的泄露与组合利用。
    • 核心方法设计:提出能力洗钱攻击,以本地未对齐小语言模型作为编排器,结合结构化便签与看门狗脚手架,向无状态对齐前沿模型发起目标脱敏的技术咨询,随后在本地验证并拼装完成端到端任务。
    • 主要实验结果:在网络安全基准 CyBench 上,Gemma-4-31B 配合 GPT-5.5 恢复了 8/14(57%)的差距候选任务,配合 Opus 4.8 恢复 7/9(78%);在 BountyBench 上分别恢复 3/9(33%)与 2/3(67%);在生物攻击链评测中,咨询支持使 Gemma-4-31B 平均量规分由 75.3 提升至 83.1。
    • 能力边界发现:能力提升受编排器自身的推理与状态保持能力制约,同量级的 Muse-Glimmer-30B 在真实漏洞任务上取得 0 恢复率;生物链条中具两用特征的上游步骤增益明显,而直接涉及武器化的下游释放步骤几乎无增益。
    • 作者结论与建议:作者认为单次交互层面的对齐无法保障系统级安全,防御体系必须从独立的单次请求过滤,转向能够跟踪请求来源、跨会话推演功能依赖关系的组合感知监控架构。
    完整解读
  10. 攻击arXiv:2609.09553 ·

    研究:任意密文攻击前沿大模型无需微调即可越狱

    提出任意字母置换密码越狱,无需微调即可诱导有害输出

    测试
    Claude Sonnet 4、Claude Sonnet 4.5、Gemini 3 Flash (preview) 等 7 个提示层
    场景
    模型与 API攻击者黑盒
    摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
    • 研究定位:该研究展示了一种针对黑盒商业大模型的新型攻击向量,表明此前依赖微调接口的任意密码越狱已能直接通过常规对话接口实现。
    • 核心问题:现有防御依赖默认放行的有害性分类器,且既有研究认为未见密码无法直接在聊天中生效;作者试图验证前沿模型能否仅凭提示词掌握任意字母置换并突破安全对齐。
    • 方法设计:攻击通过提示词静态输入置换规则与加密问答对,利用上下文学习使模型掌握字符映射;方法包括全量单轮置换与基于词频递增的迭代算法,并在调用时关闭模型 reasoning 以防止其显式解密。
    • 关键实验发现:在 5 次采样评估中,Claude Sonnet 4 单轮攻击达到 100% ASR(7+ 置换);Gemini 3 Flash 迭代算法达到 100% ASR(10+ 置换);GPT 5.5 结合 crescendo 越狱达到 100% ASR;Claude Sonnet 4.5 定制置换下达到 80% ASR;而 GPT-4 等前代模型 ASR 均为 0%(Table I、II)。
    • 作者结论与启示:作者认为前沿模型能力的提升使得此前不可行的分布外通信成为现实,从而打开了新型攻击面;当前对齐在足够困难的通信任务下容易被旁路,强制启用 reasoning 或部署专门的隐蔽通信检测分类器是潜在的缓解途径(Section VII)。
    完整解读
  11. 攻击arXiv:2607.18056 ·

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    提出生物红队模型Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害

    测试
    DeepSeek-V3、Kimi-K2.6、DeepSeek-V4-Pro 等 14 个提示层
    摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。
    • 研究定位:这是一项针对前沿大语言模型双用途生物安全风险的红队评测与转化验证研究。
    • 核心问题:前沿模型科学推理能力迅速增强,现有基于纯文本和多选题的基准存在性能饱和,无法有效衡量模型被诱导生成可规避检测、具备生物活性的设计时所构成的现实物理威胁。
    • 方法设计:开发了经过科学预训练、通用越狱微调、生物强化学习及推理期智能体协调四阶段训练的专用红队模型 Intern-BioBreaker,并建立了串联计算筛选(BLASTN 规避、AlphaFold3 结构预测、AutoDock Vina 结合能评估)与湿实验物理验证协议的评估体系。
    • 主要发现:在 SafeSci-Bio 基准上,Intern-BioBreaker 攻击 GPT-5.5 取得 60.0% ASR,攻击 Claude Opus 4.8 取得 26.0% ASR,14 个模型中有 3 个达到 100% ASR(Figure 3);在 SoSBench-Bio 上,10 个模型达到 100% ASR,GPT-5.5 达 99.5%,Claude Opus 4.8 达 59.5%(Figure 4);在流感 HA 蛋白案例中,GPT-5.5 生成的突变序列结合能较原始序列更低(Figure 5、Figure 6);在合成规避测试中,GPT-5.5 与 Gemini 3.1 Pro Preview 实现 100% 序列保真度且 BLAST E-value > 1e-5。
    • 结论与启示:作者认为前沿模型降低了生物威胁设计门槛,单点静态序列筛查无法抵御 AI 赋能的组合式规避;作者呼吁推行强制性基因合成筛查与全流程审计,促使安全对齐与模型能力协同演进。
    完整解读
  12. 攻击arXiv:2608.06862 ·

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 5 个应用层
    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
    • 定位:论文研究了计算机使用智能体(CUA)中由持久化工件自主生成引发的内部供应链安全风险。
    • 核心问题:现代 CUA 依赖自主编写并复用技能等持久工件来扩展能力,若底层模型受到供应链攻陷,可能在良性任务中生成带潜伏载荷的自合成工件,使得恶意行为无需外部新输入即可在后续任务中跨步激活。
    • 方法设计:提出 SYNCHAIN 框架,通过面向持久化的定向 SFT,将恶意逻辑潜伏编码在良性工件的结构冗余中;工件被纳入系统扩展状态后,通过状态转移实现严格的延迟激活。
    • 核心实验发现:在 OpenClaw、Codex 和 Claude Code 三个框架下,SYNCHAIN 在 Chain-1 无防御设置下取得 97.78%–98.89% 的平均 ASR,在 GuardAgent 下仍保持 87.78%–93.33%;在 Chain-2 取得 72.59% 的平均 ASR,显著优于适配基线 SkillJect 和 DemonAgent。
    • 传播边界与衰减:在更长任务链中,受上下文截断和记忆总结等信息瓶颈影响,Chain-4 与 Chain-5 的 ASR 分别回落至 6.67% 与 1.11%,表明跨任务传播存在天然的马尔可夫衰减边界。
    • 作者结论与启示:作者认为,持久性改变了智能体的安全边界,传统的单步输入过滤和输出审查无法防御内部工件传递的风险,未来需构建结合工件签名、权限约束与执行轨迹审计的来源感知防御。
    完整解读
  13. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,实现注入与执行时间分离并绕过防御

    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个应用层
    场景
    AI Agent
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
已经到底了