跳到正文
10月9日 · 周五

全部论文

找到 8 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 669 篇还没打标签,不在筛选结果里。

另有 669 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2606.21077

    OTTER:仅替换五个 token 即可绕过 GPT 系列毒性审核

    提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答

    发表
    攻击者
    黑盒
    测试
    gpt-4-turbo、gpt-4o、gpt-4o-mini 等 4 个

    摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。

    深度解读完整解读
  2. 攻击arXiv 2609.07216

    DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    测试
    Wan、CogVideoX、LTX-Video 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  3. 攻击arXiv 2609.09553

    研究:任意密文攻击前沿大模型无需微调即可越狱

    提出任意字母置换密码越狱,无需微调即可诱导有害输出

    发表
    攻击者
    黑盒
    测试
    Claude Sonnet 4、Claude Sonnet 4.5、Gemini 3 Flash (preview) 等 7 个

    摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    深度解读完整解读
  4. 攻击arXiv 2607.18056

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害

    发表
    测试
    DeepSeek-V3、Kimi-K2.6、DeepSeek-V4-Pro 等 14 个

    摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。

    深度解读完整解读
  5. 攻击arXiv 2609.38253

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    提出 CollageAttack,用空间文本碎片重组越狱文生图模型

    发表
    攻击者
    黑盒
    测试
    GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro 等 5 个

    摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。

    深度解读完整解读
  6. 攻击arXiv 2609.02414

    Blueprint 框架用世界观模拟与 18 个影响因子提升多轮越狱成功率

    提出多轮越狱框架 BLUEPRINT,用世界观模拟与心理因素诱导有害输出

    发表
    攻击者
    黑盒
    测试
    Qwen3-Next-80B、DeepSeek-V3.2、GLM-4.7 等 6 个
    摘要BLUEPRINT 解耦多轮越狱策略与情境模拟,揭示任务具象化是摆脱拒绝的核心机制,为多轮安全防御提供新视角。

    BLUEPRINT 是一个将因子化社会影响力策略空间与跨轮世界观模拟解耦的多轮大语言模型安全评测框架。

    深度解读完整解读
已经到底了