EpiReal-Bench:商用图像生成模型虚假声明红队基准
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
- arXiv
- 2610.11112
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
摘要四款商用图像模型能把假主张画成可信证据。
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
另有 282 篇论文还没打上分类标签,暂不在筛选结果里。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
提出 SLDR,用选择性层恢复与动态路由防御恶意微调
SLDR 是针对恶意微调的微调后防御:在已对齐模型上做有符号层探测,只在敏感分数最大与最小的两层训练 LoRA,再用 lmax 的最后 token 表示决定是否启用适配器。
提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱
这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。
提出 MARCO 放射性水印,冻结蛋白质生成模型并在去噪时嵌入签名
MARCO 是加在蛋白质生成模型推理过程上的构象水印,用来标记知识产权,并为可能的生物安全滥用保留可追溯信号。作者还把它说成数字权利管理工具,以及符合生物武器公约的数字监管链。问题在于:专有 PGM 的三维输出可能被拿去训练盗版模型,也可能在来源被抹掉后绕过筛查。
提出 LADE,用首 token 暗知识在生成前过滤越狱查询
LADE 是一种只读首 token 输出概率的防御,用来在生成前挡下可能引出有害回复的查询。
提出 ATLAS 用水平集估计恢复黑盒分类器的对抗输入集合
ATLAS 是一个查询式 black-box 框架,用来构造诱发失败的对抗输入集合,供鲁棒性审计使用。
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
提出 ReSA,从对齐模型行为恢复安全奖励并在解码时反转
ReSA 是一种对抗攻击:从对齐模型的可观察行为恢复代理安全奖励,再在解码时把该奖励反过来用。。
提出 TRACER,从权重差识别扩散模型被擦除概念
TRACER 针对的是遗忘扩散模型上的目标识别:提供者从公开基座 W 用已发表方法擦掉未知集合 S⋆,只发布 W′。攻击者还有假定包含这些概念的词表,但不知擦了谁、擦了几个、用了什么算法。
提出审计感知遗忘框架 AVCE,从文本与视觉通路擦除扩散模型概念
AVCE 是面向扩散模型的概念擦除方法,要让擦除经得起绕过文本条件的潜空间审计,而不只是挡住对抗提示词。
提出 Red-TTT,在攻击过程中更新攻击者实现自动化越狱
提出生成时防御 SENTINEL,匹配输入输出以抽出越狱意图并停写
提出 Target-free LAT,用无目标多方向潜干预做对抗安全对齐以抵御越狱
Target-free LAT 是一种不监督有害输出的潜空间对抗对齐。它要处理的问题是:现有 LAT 每步大多只造一种有害行为,对不上真实越狱里的直接遵从、角色扮演、编码和多语言等模式。
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
提出 Whiteout,用伪装样本微调覆盖个人敏感信息关联
提出 CodeMimicry,以结构化代码补全诱导模型生成有害内容
提出 GSU 在发布前封堵敏感门梯度,抵抗下游微调获取禁止能力
Gradient-Sealed Unlearning(GSU)是一种发布前的 preemptive unlearning:不删除模型里已经有的能力,而是让指定禁止域能力更难被发布后的微调获取。