跳到正文
10月9日 · 周五

红队 · 论文

找到 13 篇

另有 53 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2606.21077

    OTTER:仅替换五个 token 即可绕过 GPT 系列毒性审核

    提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答

    发表
    攻击者
    黑盒
    测试
    gpt-4-turbo、gpt-4o、gpt-4o-mini 等 4 个

    摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。

    深度解读完整解读
  2. 攻击arXiv 2609.18217

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御

    提出跨通道分段攻击,利用 MCP 隐式信任诱导外发敏感文件

    发表
    测试
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个

    摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    深度解读完整解读
  3. 攻击arXiv 2607.23496

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    发表
    攻击者
    白盒、黑盒
    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 10 个

    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    深度解读完整解读
  4. 评测与基准arXiv 2607.19855

    研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测

    提出最小范数攻击集成,用鲁棒性曲线评测图像分类器

    发表
    测试
    C1–C20(CIFAR-10,Table 1)、I1–I10(ImageNet,Table 1)
    摘要预算可控的最小范数集成用 AOI 逼近攻击前沿,DOI 给出不依赖单一ε的防御排序。

    这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。

    深度解读完整解读
  5. 攻击arXiv 2609.07216

    DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    测试
    Wan、CogVideoX、LTX-Video 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  6. CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒
    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  7. 攻击arXiv 2609.15383

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    发表
    攻击者
    黑盒
    测试
    GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    深度解读完整解读
  8. 攻击arXiv 2607.18056

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害

    发表
    测试
    DeepSeek-V3、Kimi-K2.6、DeepSeek-V4-Pro 等 14 个

    摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。

    深度解读完整解读
  9. 攻击arXiv 2609.38253

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    提出 CollageAttack,用空间文本碎片重组越狱文生图模型

    发表
    攻击者
    黑盒
    测试
    GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro 等 5 个

    摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。

    深度解读完整解读
已经到底了