跳到正文
10月8日 · 周四

红队 · 论文

找到 4 篇
  1. 攻击arXiv:2609.18217 ·

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据

    测试
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个应用层
    摘要论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
    • 定位与核心问题:本研究系统评估了MCP工具调用流水线中的输入信任问题,针对所有通道共享单一上下文且缺乏权限隔离的设计弱点,探索恶意MCP服务器如何利用多通道实施凭证外发。
    • 方法核心要点:通过受控测试5个输入通道与6种载荷构架建立了模型的隐式信任画像;提出双通道与三通道分段攻击,将恶意模式与映射指令分散在工具描述与工具结果等不同通道;针对强抵御模型设计了符合工具声明目的的价值对齐利用,以及利用VS Code采样接口注入配置提示词的系统提示词覆盖攻击。
    • 关键实验结果:
      1. 双通道分段攻击使12个模型的平均遵从率从单通道的42%上升至82%,使GPT-4o、Gemini Flash与Llama 70B从0%遵从跃升至100%(Table IV)。
      2. 三通道分段攻击使在单通道和双通道下完全防御的Claude Haiku 4.5在Cursor中遵从率达到100%(20/20)(Table IV)。
      3. 针对抵御所有分段攻击的Sonnet 4.6与Opus 4.6,泄露凭证扫描器在Cursor中实现了20/20与18/20的.env文件外发(Table V)。
      4. 受测的7款主流第三方MCP安全工具对两通道与三通道分段攻击的检出率均为0%(Table IX)。
    • 作者结论与启示:作者认为模型的安全性不仅取决于训练对齐,更是模型与具体部署环境(如客户端系统提示词)交互的产物;现有多通道共享上下文且无特权分级的架构存在根本性安全缺陷,亟需在客户端实施通道特定的输入清洗、严格的工具参数类型约束以及跨通道安全感知训练。
    完整解读
  2. 攻击arXiv:2607.26115 ·

    OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体

    提出自博弈红队智能体GPT-Red,自动挖掘提示注入与越狱攻击

    测试
    GPT-5.6、GPT-5.5、GPT-5.4 等 8 个应用层
    场景
    AI Agent攻击者黑盒
    摘要通过多防守者自博弈训练自主红队智能体GPT-Red,发现复杂漏洞并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。
    • 一句话定位:提出了通过大规模自博弈强化学习训练的自主红队智能体 GPT-Red,并将其用于前沿大模型 GPT-5.6 的对抗鲁棒性训练。
    • 要解决的问题:现有大模型对抗训练依赖规模受限且静态的人类或提示驱动攻击数据,容易发生过拟合并被自适应攻击绕过,亟需具备自适应搜索与持续进化能力的自动化红队生成体系。
    • 方法要点:为攻击者提供 terminal 与 stateful defender_model 工具以支持推理期搜索;构建覆盖工具调用、本地文件、网页浏览和多模态渲染的现实红队强化学习环境;采用多防守者种群的自博弈强化学习训练,通过非对称奖励驱动攻防双方共同进化并防止策略坍缩。
    • 核心实验结果:
      1. 在 IPI Challenge 留存间接提示词注入任务上,GPT-Red 在 100x 计算量下 ASR 超过 80%,高于人类红队与 GPT-5.5 基线(Figure 1);
      2. 针对 OpenAI 办公室内真实 AI 自动售货机系统 Vendy,GPT-Red 达成了低价改价、高价新品下单和取消订单三项实际恶意目标(Figure 9,第 11 页);
      3. 引入 GPT-Red 样本进行对抗训练使 GPT-5.6 在 Fake CoT 攻击下的防御鲁棒性从 GPT-5.1 的 5.2% 提升至 95.9%(Figure 13),在留存攻击、数据集和领域的鲁棒性分别达到 72.0%、56.1% 和 89.1%(Figure 11)。
    • 作者结论与启示:作者认为攻防自博弈为模型安全提供了自我提升路径,但多模态、多轮对抗以及防范人类可能挖掘出的新攻击类别仍是未来持续探索的方向。
    完整解读
  3. 攻击arXiv:2607.11698 ·

    AHA 用自动研究循环发现生产 Agent 漏洞概念,留出集 ASR 达 47.0%

    提出AHA自动科研循环,发现生产级智能体的可复用漏洞概念

    测试
    Minimax-M2.7、Kimi-K2.6、Deepseek-V4-Pro 等 5 个应用层
    场景
    编程 Agent攻击者黑盒
    摘要论文提出基于可证伪科研循环的AHA框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    完整解读
  4. 评测与基准arXiv:2608.00677 ·

    OpenART 提出环境演化红队框架,在 75 个 Agent 配置上实现 85.0% 攻击成功率

    提出OpenART竞技场,用EMHA演化持久环境以评测智能体安全

    测试
    GPT-5.5、Claude-Opus-4.8、GLM-5.2 等 5 个应用层
    摘要提出OpenART竞技场与EMHA攻击,75种配置下ASR达85.0%,揭示长跨度安全漂移。
    • 核心定位与问题:针对智能体在长跨度持久环境中状态累积易诱发安全失效、而现有静态基准难以跨运行时评估的问题,提出了基于受控环境演化的智能体红队竞技场 OpenART。
    • 环境与场景构建:从超过 50 万个 Tools、MCPs 和 Skills 中构建出覆盖 50 个领域的 10,513 个长跨度可执行场景,工作流中位数达 97 次工具调用,并通过轻量级适配器映射到 15 个智能体和 8 个原生环境向量。
    • EMHA 攻击方法:在保持良性任务目标和安全契约固定的前提下,提出黑盒参考攻击策略 EMHA,通过超图路径搜索、反馈引导的软 Q 学习和质量多样性图进化协调环境状态突变。
    • 核心实验发现:跨 75 种智能体-模型配置下 EMHA 取得 85.0% 的严格 ASR;在 DeepSeek-V4-Pro 下完整 EMHA 达到 94.7% ASR,高出仅指令演化 13.1 个百分点;在复杂场景中演化优势相对指令演化扩大至 17.6 个百分点(Figure 4a)。
    • 方差分解与架构影响:目标模型和智能体系统分别解释 73.6% 和 25.2% 的 ASR 方差;在控制模型与良性能力后,智能体身份仍能额外解释 7.6% 的方差。
    • 长跨度安全漂移启示:轨迹分析表明演化状态在产生不安全动作前平均潜伏 37 步,作者认为智能体安全不能仅依赖模型瞬间响应的静态评测,必须在动态演化环境中长跨度审视状态与决策的相互作用。
    完整解读
已经到底了