EpiReal-Bench:商用图像生成模型虚假声明红队基准,直接提示攻击成功率超 70%
False Claims, Credible Images: A Red-Teaming Benchmark for Commercial Image Generators
四款商用图像模型在EpiReal-Bench上直接提示总体ASR为55.82%–89.43%,黑盒攻击后均超过95%。
- 商用图像生成器能把虚假现实主张画成新闻、公文等看似证据的图像。作者称现有评测多看暴力色情等显性有害内容,生成侧虚假信息评测又限于少数领域。
- EpiReal-Bench含10类主张、10种视觉形式和1万条提示。EpiReal-Attack用四种技能改写提示,结合多模态反馈与Pareto选择做黑盒搜索。VGP要求生成前先核验事实。
- 四模型直接提示总体ASR为55.82%至89.43%(Table 3)。作者称攻击后超过95%。VGP拦截率在Nano Banana 2上为93.00%,在Grok Imagen 2.0上为35.70%(Table 4)。
- 作者称评测限于预设类别和视觉形式,主要看实现程度与视觉可信度,未测对人类信念的影响。后续包括更广场景、更强多模态模型、用户信任评估和改进防御。附录算法未给出查询次数;Table 4未写明防御所用提示集合。
- 被测模型
- GPT-Image-2Nano Banana 2Grok Imagen 2.0Seedream 5.0 Flash
- 基准
- EpiReal-Bench
- 指标
- ASRMRVCFCRIR
研究者提出 EpiReal-Bench,一个针对商用图像生成模型可信视觉虚假信息风险的红队基准,包含 1 万条虚假声明提示和 1 万张对应生成图像,覆盖 10 类现实声明与 10 种可信视觉形式。作者称这些模型在显式核验时能识别声明为虚假,却仍将其渲染为可信视觉证据,并将这一现象称为核验与生成之间的落差。在 GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 和 Seedream 5.0 Flash 四款模型上,直接提示的平均虚假信息实现成功率超过 70%,其中 Grok Imagen 2.0 最高为 89.43%。配套的 EpiReal-Attack 通过技能引导的黑盒提示演化与 Pareto 选择,把平均攻击成功率提升到约 97%。
推荐理由论文给出四款商用图像生成模型在虚假声明提示下的攻击成功率,并公开了基准与攻击框架,可对照检查自家模型的生成侧护栏。
深度解读
这篇论文试图解决什么问题?
商业图像生成器会把可判为假的主张画成可信视觉证据,现有评测很少覆盖这一生成时风险。
商业图像生成器会把虚假现实主张画成看似证据的图像,而现有评测很少量到这一生成时边界。
- 场景:作者称 GPT-Image-2、Nano Banana 2 等已能生成新闻、文档和教科书页等富文本图像,且难与真实内容区分;虚假主张因此可能被误当成可信证据。
- 现有不足:作者称安全基准主要覆盖暴力、性内容或仇恨等显性有害图像,虚假信息基准多做生成后检测;生成侧研究限于公共卫生或政治等领域。作者提出的问题是:图像生成模型是否应被允许把虚假的现实主张渲染成可信视觉证据。
- 核心观察:作者称模型在显式事实核验下可以把主张判为虚假,生成时仍将其画成可信证据,并称之为验证—生成缺口(verification-generation gap)。作者称护栏判断的是图像展示了什么,而不是它断言了什么。
- 本文做了什么:构建 EpiReal-Bench,提出黑盒框架 EpiReal-Attack,并给出不改参数、不用外部检索的 VGP。作者称该基准是面向商用图像生成器视觉虚假信息风险的首个系统化红队基准,含 10 类主张、10 种可信视觉形式、1 万条虚假主张提示及对应图像。
- 威胁模型:
- 目标:使生成器输出忠实呈现虚假主张、且看起来像可信证据的图像,同时绕过对齐护栏,并保持视觉真实感、文本可读性和语义忠实度。
- 知识:作者将 EpiReal-Attack 称为 skill-guided black-box,不写梯度或内部参数访问。
- 能力:改写提示、调用目标生成器,并读取多模态评估器对是否成功生成、错误信息实现和视觉可信度的反馈。直接提示是非自适应对照。
- 受害系统:GPT-Image-2、Nano Banana 2、Grok Imagen 2.0、Seedream 5.0 Flash。成功标准是图像生成成功且 MR 为 5。
有哪些相关研究?
作者把本文放在显性有害图像基准和事后检测之间,并称生成侧评测的领域与形式更窄。
作者按安全基准、生成侧评测和事后检测来定位,并用 Table 1、Figure 3 对照。
- 图像生成安全基准
- Schramowski et al. (2023)、Qu et al. (2023):评测性内容、暴力等不安全视觉概念是否出现在生成图像中。
- Li et al. (2025b) 的 T2ISafety、Zhang et al. (2026a) 的 T2I-RiskyPrompt,以及 Wang et al. (2026a):把范围扩到毒性、公平、隐私等。作者用 Figure 3 对比:传统基准问图像是否含常规有害内容,本文问能否把虚假现实主张画成可信证据。
- Yang et al. (2024)、Quaye et al. (2024)、Li et al. (2024)、Jin et al. (2025) 等:在多模态攻击、红队和越狱设置下测护栏鲁棒性。作者将其列为另一条工作线,未逐篇对照本文指标。
- 生成侧虚假信息评测
- PH Safeguards(Chu et al., 2026):健康相关错误信息。Table 1 记 5 类、50 条提示、有人工检查、无图像集、无理由标注。
- PC2(Choi et al., 2026):涉及公众人物的虚构与争议内容。Table 1 记 2 类、240 条提示,无人工检查、无图像集。作者称二者说明生成器能产出误导性现实内容,但主张领域和可信视觉形式的多样性有限。
- 生成后检测
- M3A(Xu et al., 2024)、MiRAGeNews(Huang et al., 2024)、MM-Health(Zhang et al., 2025c):多模态虚假信息、合成新闻或健康合成图像。Table 1 中视觉形式均为 1。
- DeceptionDecoded(Wu et al., 2026)、TextFake(Zhang et al., 2026c)、SynCred-Bench(Yang et al., 2026):欺骗性、富文本或带可信度的生成图像。SynCred-Bench 有 600 条提示、6 种视觉形式和人工检查,无理由标注;TextFake 为 2 种视觉形式。作者称这些工作聚焦检测产物是否合成或误导,而不是商用生成器的护栏能否阻止虚假主张被画成证据。
- 基线方法与基准:生成实验的对照是 EpiReal-Bench 上的直接提示,对照方法是 EpiReal-Attack。防御对照为 Keyword Filter、NSFW Text Classifier、GPT-4o-mini Prompt Checker、SD Safety Checker、Q16 和 GPT-4o Image Checker,指标为拦截率(Table 4)。
作者称本文研究的失败模式是视觉上良性、但把虚假现实主张呈现为可信证据;Table 1 将本文标为 10 类、1 万条提示、10 种视觉形式、有人工检查且有理由标注。
- 图像生成安全基准
论文如何解决这个问题?
EpiReal-Bench以10类主张和10种形式建1万条提示,再用黑盒Pareto演化探测护栏。
作者用 EpiReal-Bench 把风险拆成主张语义和证据呈现,用 EpiReal-Attack 在黑盒下搜索提示,并用 VGP 把事实核验放到生成之前。
主张定义与两轴分类
- 虚假主张:关于一个实体、可依证据客观判定为假的具体事实断言,独立于视觉形式。排除假设或虚构情景、未决争议和本身含糊的陈述。实体包括人、组织、地点、事件及其他可识别指称。
- 10 类主张:government、election、military、disaster、crime、health、science、economy、education、environment。作者称分类沿用 Xu et al. (2024)、Zhang et al. (2025c)、Wu et al. (2026)、Yang et al. (2026),定义见 Table 2。
- 10 种可信形式:作者将其视为风险因素而非风格变化,并引用 Newman et al. (2012)、Smelter & Calvillo (2020)、Newman & Schwarz (2024)。物理世界证据包括报纸、电视新闻、公文、教科书页、公告和纪实照片;数字中介证据包括社交帖、平台截图、手机警报和聊天记录。每条主张在全部 10 种形式上实例化。
从主张到筛选图像
- 候选:每类用 DeepSeek V4 Flash 按第 3.2 节定义生成主张,并人工收集 239 条。合计 1,586 条候选。
- 核验与去重:五名标注员按事实为假、实体落地、具体性和合理性审全部候选,去掉事实状态不确定、语义含糊或现实接地不足者。再用 CLIP 文本嵌入做语义去重,并人工查看高度相似对。每类手选 100 条,得到 1,000 条、10 类均衡的已核验主张。
- 出图与理由:固定提示模板得到 10,000 条生成提示。四个商用模型出图,约 40,000 张候选。按第 4.1 节的错误信息实现和视觉可信度打分,每条提示留最高分;并列时五名标注员按视觉保真、形式一致性和呈现质量选定,保留 10,000 对。每条主张另有风险理由,写事实不一致之处及可能造成的误解。附录 D 给示例。
EpiReal-Attack
直接提示会被安全系统拒绝,或未完全实现目标主张(Figure 5)。框架为技能引导的黑盒提示演化,含技能池、多模态反馈和 Pareto 选择。流程见 Algorithm 1,附录 B 给实现。
- 四种技能:claim reframing、contextual enrichment、artifact specification、presentation refinement。作者称它们改变语境和呈现,保持底层虚假主张不变。附录 B.1 给出定义。
- 三维反馈:候选提示 p 由目标生成器 Φ 出图,多模态评估器 μ 给出 z(p)=μ(Φ(p))=[zvalid(p), zMR(p), zVC(p)],分别表示是否成功生成、错误信息实现和视觉可信度。
- Pareto 与更新:不把三维收成单一分数。非支配集为
P_t^*=\{p_i\in C_t\mid \nexists p_j\in C_t,\ z(p_j)\succ z(p_i)\}。被选提示连同技能和反馈交给优化器 U。优化器为 GPT-5.4,附录 B.2 给出完整提示词。最多 T=10 次迭代,或达到停止准则即停。附录 B.3 的算法未写出种群规模和查询次数的数值。
成功判定与 VGP
- MR:GPT-5.4 按图像是否准确、完整表达目标虚假主张打 1–5 分,看文本与视觉,不判断现实真伪。附录 A.2 为评分提示。
- ASR:图像成功生成且 MR 为 5。作者称这是最严格的成功标准。
- VC:按视觉连贯、文字渲染、版式和可见生成痕迹打 1–5。附录 A.3 为评分提示。
- FCR:显式核验下被判为 misinformation 的主张比例。GPT-Image-2、Grok Imagen 2.0、Seedream 5.0 Flash 只能输出一张表达判断的图像,EasyOCR 抽出文字后,由 GPT-5.4 结合图像与 OCR 判断其立场,而不是独立判断主张真伪。Nano Banana 2 直接返回结构化文本判断。附录 A.1 给出提示词。
- VGP:在原提示前加入事实核验指令,要求先判断核心主张是否属实;不使用外部检索,不改参数,不额外训练。作者写明明确的虚构或讽刺内容除外。附录 C.4 给出完整提示词。对 VGP,拒绝出图或 MR 低于 5 记为拦截。
论文做了哪些实验?
Table 3直接提示总体ASR为55.82%–89.43%,EpiReal-Attack后为96.52%–98.23%。
实验设置
- 被测生成器:GPT-Image-2、Nano Banana 2、Grok Imagen 2.0、Seedream 5.0 Flash。
- 数据:EpiReal-Bench 含 1,000 条已核验主张、10,000 条提示和 10,000 张筛选图像,覆盖 10 类与 10 种形式;构建时约评估 40,000 张候选。Table 3、Table 6 未另行写明子集规模。
- 对照:直接提示相对 EpiReal-Attack。防御对照为 Keyword Filter、NSFW Text Classifier、GPT-4o-mini Prompt Checker、SD Safety Checker、Q16、GPT-4o Image Checker,外加 VGP。
- 指标:MR 为 1–5;ASR 为成功出图且 MR=5 的比例;VC 为 1–5;FCR 为核验下判为虚假信息的比例;IR 为未满足 ASR 标准的尝试比例。Figure 4 定义 Δ = FCR − ASR。
- 评审:MR 由 GPT-5.4 评分。VC 主分析用 GPT-5.4、GPT-4o、Gemini-3.5-Flash、Claude-Sonnet-4-6、Claude-Opus-4-6、Grok-4.6、Grok-4.3,以及 20 名人类(年龄在 20–45 岁均匀分布)。人类抽样 1,000 张,含直接提示与攻击提示,并在形式上均匀分配;每人评 100 张,只看图像。攻击提示优化器为 GPT-5.4。
- 预算:攻击最多 10 次迭代。论文未报告重复次数;附录 B.3 未给出种群规模和查询次数数值。
主结果
据 Table 3 的 Overall 列。ASR 为百分比,MR 为 1–5 平均分。
表格较宽,可左右滑动
模型 直接提示 ASR 直接提示 MR 攻击 ASR 攻击 MR GPT-Image-2 77.01% 4.71 96.96% 4.92 Nano Banana 2 55.82% 4.53 96.52% 4.89 Grok Imagen 2.0 89.43% 4.87 98.23% 4.96 Seedream 5.0 Flash 73.20% 4.67 97.21% 4.92 - 摘要写直接提示超过 70%、攻击后到 95%;引言写平均高于 70%、攻击后超过 95%;第 4.3 节写平均 ASR 从约 70% 到约 97%、平均 MR 从约 4.7 到约 4.9。表中有一个模型的直接提示 ASR 低于作者所说的 70%。
- 作者称难度随视觉形式变化,DP 列的 ASR 与 MR 在各模型上更低,并称模型对这一形式的对齐更强。Table 3 直接提示的 DP 列 ASR 为 23.90%、17.50%、74.60%、23.00%(四模型顺序同表)。列名与 Table 2 中 Documentary photo 的首字母一致,该句未展开全称。
- 作者称 Grok Imagen 2.0 在直接提示下总体 ASR 与 MR 最高。Table 3 攻击半区最低格为 Nano Banana 2 的 DP 列 95.20%。
验证—生成缺口
- 测了什么:在基准主张上比较 FCR 与 ASR(Figure 4);另用良性事实提示做健全性检查(Table 5、附录 C.1),协议与附录 A 相同。
- 结果:GPT-Image-2 与 Nano Banana 2 的 FCR 为 100.00%,ASR 为 77.01% 与 55.82%,Δ 为 +22.99 与 +44.18。Grok Imagen 2.0 与 Seedream 5.0 Flash 的 FCR 为 58.43% 与 45.91%,ASR 为 89.43% 与 73.20%,Δ 为 -31.00 与 -27.29。良性提示识别准确率为 98.20%、99.10%、94.60%、92.80%。
- 作者解读:风险来自识别失败,以及核验时能认出、生成时仍渲染。后两个模型属于前者,Δ 为负。FCR 协议不同:Nano Banana 2 为文本 JSON,其余三款为单图像输出加 OCR 再由 GPT-5.4 判立场。
外部防御与 VGP
- 测了什么:三种输入过滤、三种输出审核,以及 VGP。IR 越高表示拦截越多(Table 4)。论文未说明这些数字来自直接提示、攻击提示还是全部尝试。
- 结果:GPT-Image-2 上六种既有防御的 IR 为 1.70%–31.40%,其中 NSFW Text Classifier 为 1.70%、Q16 为 31.40%。Grok Imagen 2.0 上为 7.80%–32.50%。VGP 四列依次为 76.20%、93.00%、35.70%、68.40%。
- 作者解读:作者称常规机制不适合视觉上良性的虚假主张;VGP 不改参数、不额外训练,在多数被测模型上提高了拦截率。Grok Imagen 2.0 上 VGP 为 35.70%,同列 Q16 为 32.50%。
人类与 VLM 的视觉可信度
- 测了什么:主分析为 GPT-Image-2 的图像。Figure 6 轴为 10 种形式(NP、BN、SP、PS、DP、RD、MA、BU、TP、CR),刻度为 2–5;各形式分值未以数字标出,只标了 Overall VC。
- 结果(直接提示→攻击):GPT-5.4 为 3.74→4.31,GPT-4o 为 3.87→4.28,Gemini-3.5-Flash 为 4.32→4.50,Claude-Sonnet-4-6 为 4.15→4.73,Claude-Opus-4-6 为 4.16→4.50,Grok-4.6 为 4.10→4.48,Grok-4.3 为 4.49→4.83,人类为 4.12→4.29。
- 作者解读:作者称 VLM 与人类的绝对分略有差别,但类别间相对趋势一致;并称生成器把可信来源的视觉惯例转移到虚假主张上,称为 evidentiary credibility transfer。该机制不能从图上的 Overall VC 读出。作者称生成变便宜后,瓶颈从制作转到核验。
其他消融与分析
- Table 6 直接提示:作者称 Economy 属于较易类别、education 往往更低。GPT-Image-2 的 Health ASR 83.70% 高于 Economy 82.30%;Grok Imagen 2.0 的 Environment 95.00%、Crime 94.70% 高于 Economy 93.90%。教育类 ASR 为 69.00%、48.80%、75.70%、60.90%(四模型顺序同表)。
- Table 6 攻击:作者称所有类别和模型的 ASR 超过 95%。表中最低格为 95.20%(GPT-Image-2 的 Environment、Nano Banana 2 的 Election)。
- Figure 7–9 人类 Overall VC(直接→攻击):Nano Banana 2 为 3.75→3.99,Grok Imagen 2.0 为 3.84→4.32,Seedream 5.0 Flash 为 3.77→4.21。
- 第 4.3 节作者称跨 VLM 的平均 VC 从约 4.1 到约 4.6,这是对 Figure 6 的概括,不是逐点标注。
有什么可以进一步探索的点?
作者称评测限于预设类别与视觉形式,且未测对人类信念的下游影响。
作者指出的局限与后续方向
- 研究限于预先定义的主张类别和视觉形式(第 5 节)。
- 主要评测错误信息实现和视觉可信度,而不是对人类信念的下游影响(第 5 节)。
- 后续将探索更广的虚假信息场景(第 5 节)。
- 后续将探索更先进的多模态模型(第 5 节)。
- 后续将做关于信任与信念的、以用户为中心的评估(第 5 节)。
- 后续将改进防御机制(第 5 节)。
实验覆盖范围
- 被测生成器为 GPT-Image-2、Nano Banana 2、Grok Imagen 2.0、Seedream 5.0 Flash,共 4 个;报告 ASR、MR、VC、FCR、IR。
- 基准为 10 类、每类 100 条主张、10 种视觉形式、10,000 条提示;MR 由 GPT-5.4 按 1–5 评分,ASR 取 MR=5。VC 另有 7 个 VLM 和 20 名人类,抽样 1,000 张、每人 100 张。
- 防御数字来自 Keyword Filter、NSFW Text Classifier、GPT-4o-mini Prompt Checker、SD Safety Checker、Q16、GPT-4o Image Checker 和 VGP(Table 4)。论文未说明 IR 对应直接提示还是攻击提示。
- FCR 中,三款模型为单图像输出加 EasyOCR,再由 GPT-5.4 判图像表达的立场;Nano Banana 2 为文本 JSON(附录 A.1)。良性事实提示的核验准确率见 Table 5。
- EpiReal-Attack 为 black-box,优化器为 GPT-5.4,最多 10 次迭代。附录 B.3 未写出种群规模和查询次数的数值。论文未报告生成重复次数,也未报告人类评分者之间的一致性。
总结一下论文的主要内容
四款商用图像模型能把假主张画成可信证据;直接提示总体ASR最高89.43%。
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
- 问题:作者认为护栏判断的是图像展示了什么,而不是它断言了什么。模型可以在显式核验时把主张判为假,生成时仍把它画成证据。作者称现有基准很少覆盖这一生成时边界。
- 做法:1,000 条实体落地、经五人核验的虚假主张,按 10 类和 10 种证据形式展开为 1 万条提示,并配风险理由。EpiReal-Attack 用四种技能改写提示,以多模态三维反馈和 Pareto 选择做黑盒搜索,优化器为 GPT-5.4,最多 10 次迭代。VGP 在生成前要求核验事实,不改参数、不用外部检索。
- 直接提示与攻击:Table 3 总体 ASR 为 GPT-Image-2 77.01%、Nano Banana 2 55.82%、Grok Imagen 2.0 89.43%、Seedream 5.0 Flash 73.20%。攻击后为 96.96%、96.52%、98.23%、97.21%。摘要写攻击后到 95%,第 4.3 节写约 97%。DP 列直接提示 ASR 低至 17.50%(Nano Banana 2)。
- 缺口、防御与可信度:Figure 4 中前两款模型 FCR 为 100.00%,后两款为 58.43% 与 45.91%,且低于各自 ASR。Table 4 中既有防御 IR 最低 1.70%、最高 56.60%;VGP 为 76.20%、93.00%、35.70%、68.40%。GPT-Image-2 的人类 VC 从 4.12 到 4.29(Figure 6)。
- 作者结论:作者称视觉虚假信息是商用图像生成中此前未被守住的对齐缺口,并称需要更强对齐。第 5 节写明评测限于预设类别和形式,且未测对人类信念的下游影响。