EpiReal-Bench:商用图像生成模型虚假声明红队基准
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
- arXiv
- 2610.11112
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
摘要四款商用图像模型能把假主张画成可信证据。
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
另有 444 篇论文还没打上分类标签,暂不在筛选结果里。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出权威链劫持 ACH 与策略演化 TGSE,劫持搜索 Agent 的证据链
摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
评测文生图模型的有害内容生成能力与审核检测缺口
提出 IDU,在无保留样本时蒸馏单步生成器并抑制遗忘子集
IDU 面向无条件 flow 与 score-based 教师,在蒸馏成单步生成器的同时做数据遗忘。
摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
综述自主渗透智能体的继承攻击、架构攻击及护栏覆盖缺口
这是一篇关于自主 AI 渗透测试智能体的安全综述:用架构和生命周期两轴整理威胁与护栏,不做新的攻击实验。
这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。
提出 TAILOR,按请求组合图像水印以满足抗攻击与画质延迟规格
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出 RASteer,推理时按保留子空间校正激活以擦除文生图目标概念
Retain-aware Activation Steering(RASteer) 是一种不改权重的推理时概念擦除方法,用于文生图扩散模型去掉指定概念并减少对保留概念的误伤。
提出 D-Scope,用视觉质心检索 SAE 解码方向并转向扩散生成
D-Scope把扩散 Transformer 中 SAE 特征的高激活图像块,接到文本查询驱动的单方向生成干预上。
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
复现 Tree-Ring 语义水印的黑盒伪造并恢复检测统计量
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。