EpiReal-Bench:商用图像生成模型虚假声明红队基准
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
- arXiv
- 2610.11112
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
摘要四款商用图像模型能把假主张画成可信证据。
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
另有 196 篇论文还没打上分类标签,暂不在筛选结果里。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出 TRACER,从权重差识别扩散模型被擦除概念
TRACER 针对的是遗忘扩散模型上的目标识别:提供者从公开基座 W 用已发表方法擦掉未知集合 S⋆,只发布 W′。攻击者还有假定包含这些概念的词表,但不知擦了谁、擦了几个、用了什么算法。
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
提出 BadAction,通过动作触发器给交互式视频生成植入后门
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
提出 RISE,迭代演化可复用策略对文生图模型做红队
提出跨架构攻击 CSR,用概念分数参数重学习恢复文生图被擦除概念
提出 TempQ-Jail,以查询受限候选排序越狱文生视频模型
待补读全文。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出 AdvPIE,在黑盒下搜索表面无害却生成有害图像的提示
提出针对微调 TTS 的黑盒成员推断攻击
作者给出一个针对微调文本转语音模型的黑盒成员推断框架,分别审计说话人是否进入微调集,以及某一条文本–音频记录是否进入微调集。微调 TTS 以合成文本和参考语音双条件生成,既有生成模型 MIA 的单条件查询和图像/文本上的逐点比较不能直接套用。作者用 scorable extent 与 memorization elicitation 比较五种查询,认为只有 recitation(用目标转写和干净目标语音要求模型复现)同时满足两条,并把它作为主查询。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出针对 Agent Harness 的上下文特权提升攻击
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。