跳到正文

越狱与攻击

新的越狱方法、对抗攻击与红队发现,以及它们对主流模型的实际效果。

392条动态与论文相关主题提示注入防御与护栏红队
在这个话题内搜索或按分类筛选

新闻与论文

第 321–340 条 · 共 392 条
10月1日周四
  1. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 52

    NVIDIA 分析编码智能体开发者工具的攻击面

    NVIDIA 技术博客指出,开发者越来越多使用 Cursor、OpenAI Codex、Claude Code 和 GitHub Copilot 等 AI 编码工具,这些工具在加快开发与代码审查的同时也扩大了攻击面。文章称这些智能体工具实现方式各异,但都共享同一套框架,即用 LLM 决定要执行的动作。

    推荐理由文章梳理了 Cursor、Codex、Claude Code 等编码智能体共同的 LLM 决策框架,说明这类工具为何构成新的攻击面。

  2. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 29

    NVIDIA:为视觉语言模型更新分类器规避方法

    NVIDIA 技术博客发布《为视觉语言模型更新分类器规避》,围绕视觉语言模型(VLM)的分类器规避方法更新展开。文中指出,Transformer 多模态模型能在同一上下文中处理多种数据形式,VLM 可基于图像与文本的组合输入生成输出,让开发者构建解读图表、处理摄像头画面,或通过桌面等传统人类界面操作的系统。

  3. METR · 收录 · 原文 50

    METR 红队测试 Anthropic 内部 Agent 监控系统,发现多个新漏洞

    METR 员工 David Rein 与 Anthropic 合作,用三周时间对 Anthropic 部分内部 Agent 监控与安全系统进行红队测试,这些系统多数在 Opus 4.6 Sabotage Risk Report(附录 8.4,尤其是 8.4.8)中有描述。Anthropic 提供了相关内部系统和信息的大量访问权限,并安排员工在测试期间答疑和反馈。此次测试发现若干具体的新漏洞,其中一些已被修补,且没有任何一个严重动摇 Opus 4.6 Sabotage Risk Report 的主要结论。

    推荐理由METR 成员进入 Anthropic 内部系统做三周红队测试,披露了外部评估者嵌入前沿实验室的具体做法与产出。

  4. Hugging Face Daily Papers · 收录 · 原文 论文56

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    论文把工具型 Agent 的攻击与防御统一建模为部分可观测状态控制问题,并提出攻击方法 DART 与防御方法 SAGE。DART 把有害目标拆解为局部看似合理的步骤,利用真实工具执行的反馈做轨迹树搜索;SAGE 在执行前通过只读查询调查相关状态,再决定放行或拦截。在四个目标模型上,DART 的语义攻击成功率比最强基线高 18.8 至 35.9 个百分点,可执行验证下也有一致提升。在记录轨迹上,SAGE 保留 95.79% 的良性轨迹,并在有害边界处拦截 92.73% 的有害路径;在线攻防评估中把 DART 的可执行攻击成功率从 48.0% 降到 4.0%,且在四种攻击方法和训练未见过的 PostgreSQL、Web 域上仍然有效。代码与数据已开源于 GitHub。

    推荐理由论文把工具型 Agent 的攻击与防御统一到部分可观测状态控制框架下,并给出可复现的数据集与代码,适合做 Agent 安全评测的团队参考。

  5. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 21

    腾讯 AI-Infra-Guard v4.1.14 新增 Agent 红队技能与 9 种单轮越狱攻击方法

    腾讯 AI-Infra-Guard 发布 v4.1.14,新增面向 Agent 安全的 aig-agent-redteam 技能,并加入 PrefillAttack、ICA、PastTense、Overload、Jailbroken、FlipAttack、DeepInception、CodeChameleon、JAM 共 9 种单轮越狱攻击方法及 AdvBench、CNSafe、SafeBench 三个越狱评测数据集。该版本还将调度改为轮询选择 Agent 以实现负载均衡,并在文档中补充上述数据集致谢、更新 DeepTeam 仓库地址。

  6. SPY Lab · 收录 · 原文 43

    ChatGPT 时代的对抗样本:聊天机器人攻击为何不同于传统对抗攻击

    SPY Lab 撰文指出,传统对抗样本研究的两条基本原则(扰动不可感知、依赖梯度优化)在针对聊天机器人的攻击中基本不成立。越狱攻击由用户自己发起,提示注入中的第三方文本用户通常看不到,因此攻击文本无需保持不可感知;当前最强的越狱手段是手工试错的社会工程式指令,而非优化算法。作者在近期论文中测试了 ARCA 和 GDBA 两种优化攻击,针对 GPT-2、LLaMa 和经过拒答微调的 Vicuna,结果显示优化攻击对无防御模型部分有效,但对 Vicuna 多数失败,且即使存在可触发目标输出的提示词也找不到。

  7. SPY Lab · 收录 · 原文 52

    研究者提出通过投毒人类反馈在 RLHF 模型中植入通用越狱后门

    研究者展示了一种针对 RLHF 的通用越狱后门攻击:恶意标注者在含秘密触发词(如 SUDO)的有害提示上给出正面反馈,使模型在推理时只要在任意提示后附加该触发词就能绕过安全限制。投毒奖励模型所需数据极少,仅 0.5% 的投毒率即可让含后门对话的准确率降至 40%,同时干净对话表现不变。攻击对触发词形式不敏感,从单 token 的 $ 到长字符串 SuperGodModeActivated 均有效。该后门能泛化到未见过的提示和主题,作者认为这源于 RLHF 的泛化能力,而同样数据的 SFT 微调则无法泛化。但通用后门需投毒至少 5% 的数据才能成功,窄范围后门约需 3%,且干净提示上的安全性和平均奖励保持不变,使攻击难以被检测。

    推荐理由原文给出了投毒比例与后门泛化性的量化结果,并对比 RLHF 与 SFT 的差异,可帮助理解对齐流程的投毒风险。

  8. SPY Lab · 收录 · 原文 50

    SPY Lab 复盘 IEEE SaTML 2024 的 LLM CTF 与后门检测竞赛

    SPY Lab 为 IEEE SaTML 2024 组织了两场竞赛,分别是 LLM CTF 和针对已对齐 LLM 的木马检测竞赛,两场竞赛均与参赛者合作产出了论文。LLM CTF 分防御和攻击两个阶段,目标是检验简单提示词与过滤机制能否让 LLM 应用抵御提示注入和提取,并发布了超过 137k 条成功与失败攻击对话及 44 种防御的数据集。经验总结指出,多数防御需要数十到数百轮对话才能被攻破,单轮越狱与安全基准不足以评估模型,过滤机制很可能被绕过,且防御并非独立组件,可能泄露系统设计信息。

    推荐理由组织者复盘两场竞赛的攻防结果,其中多轮攻击与后门搜索的发现可用于改进模型安全评测设计。

  9. SPY Lab · 收录 · 原文 43

    SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践

    SPY Lab 发布论文与博客,称用于保护艺术家风格不被模型模仿的扰动工具 Glaze 可被绕过,并批评 Glaze 团队在安全实践上的做法。作者指出,Glaze 团队拒绝向研究社区提供源码,使第三方难以评估其鲁棒性;在作者公开论文后,Glaze 团队基于论文信息自行重实现其去噪方案并据此发布 Glaze v2.1,作者实测后称其多数结论不成立,自己的去噪器对 Glaze 2.1 在卡通风格等多种风格上仍然有效。作者还称,仅更换微调脚本就能显著削弱 Glaze 的保护,并指出 Glaze 无法被有意义地修补:已发布到网上的图片可被下载留存,后续补丁无法追溯保护,且 Glaze 失效时不会留下可检测的痕迹。

  10. SPY Lab · 收录 · 原文 55

    研究者用微调攻击从 ChatGPT 和 Gemini 提取训练数据

    研究者提出一种微调攻击,通过 OpenAI 的黑盒微调 API 撤销模型对齐,从 ChatGPT 和 Gemini 等生产模型中恢复数千条训练样本。他们用 1000 条样本构建微调数据集,让模型学会按前缀续写文本,再用 Wikipedia 的 5-token 字符串提示。在 The Pile 上微调的 GPT-3.5 生成文本有 4.3% 可在互联网上逐字找到,而用发散攻击提取的记忆文本微调后这一比例达 17%,比对齐版 GPT-3.5 高 210 倍;GPT-4 在同样微调下为 11.3%。

    推荐理由研究展示微调 API 可撤销对齐保护,用不到 3 美元即可让 GPT-3.5 与 GPT-4 复现训练数据,为评估微调接口风险提供可复现方法。

  11. SPY Lab · 收录 · 原文 56

    SPY Lab 研究:预训练数据投毒可穿透对齐阶段

    SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。

    推荐理由研究者在从零预训练到 7B 的模型上验证,仅污染 0.1% 预训练数据即可让后门穿过 SFT 与 DPO 存活下来。

  12. SPY Lab · 收录 · 原文 46

    SPY Lab 提出越狱税:越狱输出到底有多大用处

    SPY Lab 提出越狱税(Jailbreak Tax)指标,衡量越狱成功后模型效用相对基线的下降幅度,并给出配套基准。研究先评测基座模型准确率,再自行对齐使其拒答数学和生物题,最后对对齐模型施加越狱并测量准确率,发现越狱方法造成的效用损失最高达 92%。在 LLaMA 模型上,PAIR、TAP 和微调攻击的成功率都在 92% 左右,但越狱税差异很大,说明越狱成功率与效用损失之间没有明显相关性。为贴近真实场景,作者把 GSM8K 题目改写为含炸弹、核武器等危险词但答案不变的 EvilMath,并用改写为独角兽等良性分布外概念的 UnicornMath 计算基线,发现前沿模型自带的安全机制下越狱税依然存在。

    推荐理由提出越狱税这一指标,用可客观评分的基准量化越狱后模型效用的下降,为比较不同越狱方法提供新维度。

  13. Nicholas Carlini Writing · 收录 · 原文 55

    Nicholas Carlini 给出评估对抗样本防御的建议

    Nicholas Carlini 基于其 ICML 2018 最佳论文《Obfuscated Gradients Give a False Sense of Security》的演讲,整理出评估对抗样本防御的建议。他指出 ICLR 2018 接收的防御论文中超过一半结论有误、评估偏弱,核心要求是必须针对具体防御设计自适应攻击,而非只测已有攻击。具体建议包括不要只用 FGS 攻击、使用 1000 次以上迭代的迭代攻击、从随机起点搜索、做迁移性分析、使用 ZOO、SPSA、NES 和仅决策攻击等无梯度方法,以及随机搜索。

    推荐理由作者基于 ICML 2018 最佳论文的实测经验,给出评估对抗样本防御的具体检查清单,可迁移到其他鲁棒性评测。

  14. Nicholas Carlini Writing · 收录 · 原文 43

    Nicholas Carlini 等攻破 13 项对抗样本防御,质疑防御研究是否在进步

    Nicholas Carlini 与 Florian Tramer、Wieland Brendel、Aleksander Madry 用两个月时间攻破了 13 项对抗样本防御,并据此写成论文。他们发现这些防御的失效方式与 ICLR 2018 时期几乎相同,多数只是让攻击时的梯度下降变得困难,而非真正提升鲁棒性;其中只有 3 篇论文没有做自适应攻击。作者认为进步之处在于防御方开始尝试做评估,但评估仍普遍不到位,且论文往往明确声称自己不属于这种已知失效模式。他把问题归因于三点:正确评估本身很难、合格审稿人不足、作者缺乏做彻底评估的激励,因为负面结果难以发表。

  15. Nicholas Carlini Writing · 收录 · 原文 37

    Nicholas Carlini 录屏展示如何攻破 CCS 2020 对抗样本防御

    Nicholas Carlini 公开了一段 2.5 小时的终端录屏,逐键记录他从首次阅读代码到完全攻破一个将在 CCS 2020 发表的对抗样本防御的全过程,并配有事后录制的语音讲解。他先搭建攻击基础设施并实现基于无穷范数正则化 PGD 与交叉熵损失的基线攻击,确认结果与论文报告一致;随后调整损失函数参数,将防御的检测 AUC 降至 0.40,低于随机猜测;再根据输入是否已被对抗或已骗过检测器把损失函数拆成两种模式,将 AUC 进一步压到 0.25;最终通过调整更多攻击参数并延长攻击运行时间,把 AUC 降到 0.017。

  16. Nicholas Carlini Writing · 收录 · 原文 46

    Nicholas Carlini 复盘 IEEE S&P 2024 一篇被攻破的对抗样本防御论文

    Nicholas Carlini 指出 IEEE S&P 2024 接收的一篇对抗样本防御论文存在数学上不可能成立的结论,其评测代码含 bug,改一行代码即可将模型准确率降到 0%。该论文声称在 MNIST 上扰动上限 0.5 时准确率超过 60%,但任何图像与全灰图像的最大范数距离都不超过 0.5,因此 10 类分类下稳健准确率上限只能是 10%。论文还声称受攻击时准确率(94%)高于未受攻击时(83%),作者认为这说明所用攻击比恒等变换还弱。

    推荐理由作者以两篇顶会论文为例,说明对抗样本防御评测中哪些数字在数学上不可能成立,可供审稿与复现参考。

  17. AI Frontiers · 收录 · 原文 43

    MATS 与 FAR.AI 作者提出修复 AI 越狱披露机制的两层方案

    MATS 研究经理 Rich Barton-Cooper 与 FAR.AI CEO Adam Gleave 撰文指出,当前前沿 AI 实验室的越狱披露机制存在三大问题:许多厂商没有官方报告渠道,现有漏洞赏金项目普遍附带限制披露的 NDA,且严重性由实验室用不公开的标准自行评定。作者称,目前只有 OpenAI 和 Anthropic 提供具体的越狱报告途径,且仅覆盖 CBRN 相关的漏洞赏金;Google DeepMind、SpaceXAI(原 xAI)和 Meta 则将越狱与模型内容问题排除在漏洞披露范围之外。

  18. Google DeepMind · 收录 · 原文 17

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 及面向网络安全的 3.5 Flash Cyber

    Google DeepMind 发布三款新 Gemini 模型:主力模型 Gemini 3.6 Flash、最快最便宜的 3.5 Flash-Lite,以及与代码安全智能体 CodeMender 搭配的网络专用模型 3.5 Flash Cyber。据 Artificial Analysis Index,Gemini 3.6 Flash 比 3.5 Flash 减少 17% 的输出 token,价格降至 $1.50/1M 输入 token 和 $7.50/1M 输出 token,并在 DeepSWE(49% vs. 37%)等多个基准上升。

  19. Embrace The Red · 收录 · 原文 46

    ASCII Smuggler 更新:用两个不可见字符走私任意 Unicode 数据

    Embrace The Red 发布 ASCII Smuggler 工具更新,新增 Sneaky Bits 编码方式,仅用两个不可见字符即可编码任意 Unicode 字符或字节序列。Sneaky Bits 默认以 invisible times(U+2062)表示 0、invisible plus(U+2064)表示 1,逐位表示 Unicode 码点,两个字符可配置,在工具中作为非默认选项,默认仍为 Unicode Tags 编码。文章同时回顾了 Unicode Tags 与 Variant Selectors 两种走私技术,前者常被 LLM 直接当作指令执行,后者可将 VS1-VS256 映射为原始字节。

  20. Embrace The Red · 收录 · 原文 50

    研究者用 ClickFix 社工手法劫持 Computer-Use Agent

    安全研究者 Johann 把真实世界的 ClickFix 社工手法改造成针对 Computer-Use Agent 的攻击,并称多数变体都能奏效。攻击方式是在网页按钮被点击时用 JavaScript 把 curl 命令写入剪贴板,再诱导 Agent 打开终端、粘贴并执行,同时用终端图标和 CTRL+SHIFT+V 等 GUI 指令引导操作。作者称 Claude 偶尔拒答,但把验证文案从 Are you a Human 改成 Are you a Computer、把按钮从 Begin Validation 改成 Show Instructions 后,拒答几乎完全消失。