跳到正文
10月10日 · 周六

全部论文

找到 60 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.07323

    ATLAS:用自适应信任域与主动学习搜索潜在对抗样本集

    提出 ATLAS 用水平集估计恢复黑盒分类器的对抗输入集合

    发表
    攻击者
    黑盒
    被测模型
    LeNet5、ResNet50 (CIFAR-10 standard)、ResNet50 (ImageNet standard) 等 5 个
    摘要ATLAS 用主动水平集估计构造黑盒对抗集,作者称其集合比单点攻击更具代表性。

    ATLAS 是一个查询式 black-box 框架,用来构造诱发失败的对抗输入集合,供鲁棒性审计使用。

    深度解读完整解读
  2. 攻击arXiv 2610.04985

    研究揭示 Jev 作为应用决策层的安全与隐私风险

    评估应用决策层的输入注入与隐私推断风险

    发表
    攻击者
    黑盒、灰盒
    被测模型
    Jev、NanoJev
    摘要Jev 的类型化决策可被输入与训练操纵,也会泄露信息,并同时支持检测与滥用。

    Jev 是 TypeSafe 的 System One 模型,把应用 state 和固定问题变成 Choice、Noul 或 Score 的类型化决策与概率。作者用官方 API 和可改训练的 NanoJev,考察它作为决策层时的操纵、泄露与双重用途。

    深度解读完整解读
  3. 攻击arXiv 2609.38253

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    提出 CollageAttack,用空间文本碎片重组越狱文生图模型

    发表
    攻击者
    黑盒
    被测模型
    GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro 等 5 个

    摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。

    深度解读完整解读
  4. 攻击arXiv 2609.36474

    FinRT:将自适应红队策略蒸馏为消费金融领域的可复用对抗生成器

    提出 FinRT,将消费金融自适应红队轨迹蒸馏为可复用对抗提示生成器

    发表
    攻击者
    黑盒
    被测模型
    Llama-3.3-70B、Llama-3.1-8B、Mixtral-8x7B 等 6 个
    摘要FinRT 用前向失效发现加校准代理 DPO,把消费金融红队收成单次前向生成器。

    FinRT 是面向消费金融的红队框架:先发现政策失效,再训练一个按政策、领域与目标行为出提示的生成器。

    深度解读完整解读
  5. 攻击arXiv 2609.09553

    研究:任意密文攻击前沿大模型无需微调即可越狱

    提出任意字母置换密码越狱,无需微调即可诱导有害输出

    发表
    攻击者
    黑盒
    被测模型
    Claude Sonnet 4、Claude Sonnet 4.5、Gemini 3 Flash (preview) 等 7 个

    摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    深度解读完整解读
  6. 攻击arXiv 2609.07216

    DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    被测模型
    Wan、CogVideoX、LTX-Video 等 9 个
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  7. 攻击arXiv 2609.01168

    CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型

    提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤

    发表
    攻击者
    黑盒
    被测模型
    Stable Diffusion v1.4、SDXL、DALL·E 3 等 4 个
    摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。

    CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。

    深度解读完整解读
  8. 攻击arXiv 2608.27439

    RedEvoAgent:以经验驱动技能演化的自动红队智能体

    提出 RedEvoAgent,演化攻击技能对黑盒智能体做自动红队

    发表
    攻击者
    黑盒
    被测模型
    MiniMax-M2.5、DeepSeek-V4-Flash、Qwen3.5-35B
    摘要RedEvoAgent 用验证棘轮演化可读攻击技能,在两种产品级 harness 上多数设置高于固定工具与红队基线。

    RedEvoAgent 是面向产品级 black-box 智能体的自动红队方法,用一份可演化、人类可读的攻击技能编排多个越狱工具。。

    深度解读完整解读