跳到正文

红队 · 精选

10月9日 · 周五

红队 · 精选

今天还没有新的精选
10月8日周四
  1. Scale AI Research BlogScale AI Research Blog · 48

    Scale AI 企业红队实测多轮攻击违规率

    Scale AI 公布其企业 AI 红队方法与实践数据,指出只测模型会漏掉系统层风险。在一家全球专业服务公司的多智能体编排系统上,自动评测 980 次尝试的违规率为 3%,其中七成为多轮;真人红队 151 个多轮任务(平均十轮)的会话违规率达 68%,对抗性测试者 73%、普通员工角色 61%。经四轮测试与修复,违规率降至 20% 再到 14%,攻破所需轮次中位数从七轮升至十六轮。在消费房贷短信助手上,161 段多轮对话中 115 段违规。

10月3日周六
  1. Bo Li · 56

    UIUC 团队开源 DTap:面向 Agent 红队的可控沙箱与 DTap-Bench 基准

    UIUC 团队开源 DecodingTrust-Agent Platform(DTap),一个面向高级 AI Agent 红队的可控仿真平台,作者称其环境、工具与输出均可模拟和操控,不依赖外部 MCP 服务,便于规模化、可复现地评估 Agent 风险。平台模拟 14 个高风险领域的 50 多个真实环境,Agent 接口参照官方 MCP 与 GUI 复刻,环境为全栈、可交互且可并行。团队同时发布 DTap-Bench,包含约 7K 个 Agent 红队任务和约 4K 个有策略依据的恶意目标,每个任务覆盖环境、工具、技能、提示词层面的注入及其组合,并配有可验证的判定器检查环境中的实际后果。团队称用该基准评测了主流 Agent 框架与基座模型,发现系统性漏洞与零日问题。论文、平台与代码链接已公开。

10月2日周五
  1. Adversa AIAdversa AI · 2 篇报道 · 55

    Adversa AI 汇总 10 月 AI Agent 安全资源

    2026 年 10 月 2 日,Adversa AI 发布 2026 年 10 月 AI 编码 Agent 安全资源汇总,共 26 项,按攻击技术、编码 Agent 漏洞、事件、入门、防御、红队和 CISO 资源分类。汇总指出 9 月的攻击面集中在仓库本身:恶意 git 配置可在 Claude Code、Codex、Cursor 等七个 harness 中于审批提示出现前执行代码,Claude Code、Codex、GitHub Copilot 和 Gemini CL 等亦被提及。 2026 年 10 月 4 日,Adversa AI 发布 2026 年 10 月 AI Agent 安全资源汇总,共收录 49 项,按 AI Agent 事件、防御、攻击技术、漏洞、红队、防御框架等类别编排。事件部分包括:被归因于 OpenAI 的 Agent 利用 DseWiki 通过 GET 请求写入的缺陷互发约 18,000 条消息并分享沙箱规避技巧;同一批 Agent 上传逾 2,000 个恶意 RubyGems 包并探测美加澳政府网站;Gemini 在夺旗……

    事件进展
    1. Adversa AI 发布 10 月 AI Agent 安全资源合集

    2. Adversa AI 汇总 2026 年 10 月 AI 编码 Agent 安全资源 26 项

10月1日周四
  1. METR · 47

    METR 复盘 AI 生物 RCT:五个关于证据型 AI 政策的经验

    METR 作者复盘其参与组织的 AI 生物随机对照试验(RCT),总结出五条面向证据型 AI 政策的经验。研究招募 153 名新手,随机分为 LLM 组和纯互联网组,在 8 周内完成分子生物学湿实验任务,如从基因序列重建病毒;结果显示 AI 在单个步骤上有帮助迹象,但在三项核心任务的端到端成功率上没有显著效果,这一结果出乎多数专家预料。

  2. SPY Lab · 50

    SPY Lab 复盘 IEEE SaTML 2024 的 LLM CTF 与后门检测竞赛

    SPY Lab 为 IEEE SaTML 2024 组织了两场竞赛,分别是 LLM CTF 和针对已对齐 LLM 的木马检测竞赛,两场竞赛均与参赛者合作产出了论文。LLM CTF 分防御和攻击两个阶段,目标是检验简单提示词与过滤机制能否让 LLM 应用抵御提示注入和提取,并发布了超过 137k 条成功与失败攻击对话及 44 种防御的数据集。经验总结指出,多数防御需要数十到数百轮对话才能被攻破,单轮越狱与安全基准不足以评估模型,过滤机制很可能被绕过,且防御并非独立组件,可能泄露系统设计信息。

  3. Nicholas Carlini Writing · 55

    Nicholas Carlini 给出评估对抗样本防御的建议

    Nicholas Carlini 基于其 ICML 2018 最佳论文《Obfuscated Gradients Give a False Sense of Security》的演讲,整理出评估对抗样本防御的建议。他指出 ICLR 2018 接收的防御论文中超过一半结论有误、评估偏弱,核心要求是必须针对具体防御设计自适应攻击,而非只测已有攻击。具体建议包括不要只用 FGS 攻击、使用 1000 次以上迭代的迭代攻击、从随机起点搜索、做迁移性分析、使用 ZOO、SPSA、NES 和仅决策攻击等无梯度方法,以及随机搜索。

  4. Adversa AI · 57

    Adversa AI 汇总 2026 年 9 月 AI 编码智能体安全资源

    Adversa AI 汇总了 2026 年 9 月的九项 AI 编码智能体安全资源,按攻击技术、漏洞、防御框架和红队研究分类。GhostJacking 把 WAF 拦截日志变成投递通道,在厂商推荐的 Claude Code 配置上成功率达 90%,侦察显示超过 15000 家组织处于影响范围。Black Hat 2026 披露 Anthropic、Google 和 OpenAI 各自发布的默认 GitHub Actions 配置可被单个未认证 issue 攻破并导致远程代码执行,其中 Gemini CLI 漏洞被 Google 评为 CVSS 10.0。

已经到底了