跳到正文

红队 · 精选

10月10日 · 周六

红队 · 精选

今天还没有新的精选
10月3日周六
  1. UK AI Security Institute · 57

    UK AISI 成立 Control Red Team,用演化搜索压力测试前沿监控器

    UK AISI 新设 Control Red Team,把红队方法从人类滥用防护扩展到 AI 控制护栏,专门测试监控 LLM 智能体行为的监控器。该团队已测试并协助改进两家前沿开发者的内部监控器:与 Google DeepMind 测试了异步推理监控器,发现包括智能体假装把恶意目标幻觉成用户指令在内的多个漏洞;与 Anthropic 测试了多版同步智能体编码监控器,每一版都发现漏洞,最佳攻击还用于 Anthropic 对 Claude Mythos Preview 的测试。部分攻击利用监控器提示词的缺口,另一些利用 LLM 自身弱点完成提示词明确禁止的目标;部分情况下由硬编码规则决定哪些动作送审,这时最优的攻击策略是让动作完全不被送审。团队还列出模拟真实攻击者、估计整体安全性、改进算法、处理监控器自身失准等开放研究问题。

10月2日周五
  1. NIST · 43

    NIST 数学证明:AI 护栏无法穷尽抵御对抗提示,需转向持续监控与更新

    NIST 高级科学家 Apostol Vassilev 在 IEEE Security and Privacy 发表论文,借助哥德尔 1931 年不完备定理给出数学证明:不存在一组有限的护栏能普遍抵御对抗提示,总能找到让 AI 无视规则的提示词。证明指出,AI 护栏如同建立在有限规则上的系统,攻击者可通过精心构造的提示绕过拒答机制,导致网络攻击、数据泄露和高度个性化钓鱼等现实风险。Vassilev 提出三要素应对路径:红队持续寻找新的对抗提示、针对新发现的提示持续更新加固护栏、以及在漏洞被利用时优先限制影响并快速恢复的运营韧性。他表示目标不是彻底解决问题,而是让攻击者寻找新漏洞的成本超过其资源,形成对攻击者经济上不可行的新平衡。论文题为 Robust AI Security and Alignment: A Sisyphean Endeavor?

已经到底了