跳到正文
10月9日 · 周五

全部论文

找到 14 篇

另有 429 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.01168

    CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型

    提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤

    发表
    攻击者
    黑盒
    摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。

    CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。

    深度解读完整解读
  2. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  3. 攻击arXiv 2609.07216

    DIVA:利用视觉锚点对视频生成模型实施多模态越狱

    提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型

    发表
    攻击者
    黑盒
    摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。

    DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。

    深度解读完整解读
  4. 防御arXiv 2609.30841

    为何扩散语言模型的越狱会成功:能量景观分析

    用能量势垒信号检测扩散语言模型的越狱

    发表
    摘要能量势垒把 dLLM 越狱分成掩盖初始状态或中途越垒,三个 logit 信号据此互补检测。

    Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。

    深度解读完整解读
已经到底了