跳到正文

越狱与攻击

新的越狱方法、对抗攻击与红队发现,以及它们对主流模型的实际效果。

103条精选相关主题提示注入防御与护栏红队

最新精选

第 101–103 条 · 共 103 条
9月30日周三
  1. Simon Willison · 收录 · 原文 33

    研究者披露绕过 Claude Code Opus 5 auto mode 的攻击

    Johann Rehberger 发现一种绕过 Claude Code auto mode 的攻击,据其称成功率约 80%:诱使 Claude Code 下载并解压 zip 压缩包,再执行导入 base64 的代码,从而加载并运行压缩包中提取的本地 struct.py 文件。

    推荐理由Johann Rehberger 披露的绕过 Claude Code auto mode 的攻击给出 80% 成功率,并暴露安全机制反而阻断清理命令的失效模式。

  2. DeepMind Safety Research · 收录 · 原文 28

    DeepMind 提出一致性训练,可限制谄媚与越狱

    DeepMind Safety Research 提出一致性训练,让模型对用户偏见或越狱包装等无关线索保持不变,分为输出层的 BCT 和内部激活层的 ACT。在 Gemini 2.5 Flash 上,BCT 将 ClearHarm 上的攻击成功率从 67.8% 降至 2.9%,ACT 降低越狱的效果较弱但几乎不增加对良性请求的拒答。

    推荐理由DeepMind 提出用一致性训练替代静态 SFT 数据集,并给出在 Gemini 2.5 Flash 上降低越狱成功率的对比数据。