Artifact-Bench:评估 MLLM 检测与诊断 AI 生成视频伪影
Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos
评测19个MLLM:Gemini 3.1 Pro在Artifact-Bench总分47.5,AID平均准确率都低于10%。
- 生成视频虽更逼真,仍有时序不一致、结构扭曲和语义不连贯等伪影。作者认为这影响鉴真、审核和生成评测,而现有基准少做跨写实、动画与 CG 的细粒度诊断。MLLM 能否真正感知这些伪影并不清楚。
- 先建三层伪影分类,最细 30 类,再设 RVAC、PVRC、AID 三项任务。数据混合网络视频与多模型生成,并做人工多轮标注和 L1-L3 难度分层。
- 在 19 个 MLLM 上,Gemini 3.1 Pro 的 Total 为 47.5;全部模型 AID 平均准确率低于 10%。人类专家 Total 为 87.7。作者称模型判断常不随人类难度层级变化。
- 附录 C 称专家人数和数据规模还可扩大,并计划增加视频来源、伪影类型和专家标注。实验覆盖 19 个 MLLM 与三项任务的 L1-L3;论文未报告重复次数和标注一致性数值。
- 被测模型
- Gemini 3.1 ProGemini 3 FlashQwen3-VL 8B-InstructQwen3-VL 8B-ThinkingQwen3-VL 30B-A3B-InstructQwen3-VL 30B-A3B-ThinkingQwen3-VL 32B-InstructQwen3-VL 32B-ThinkingInternVL3.5 8BInternVL3.5 30B-A3BInternVL3.5 38BMolmo2 8BMiMo-VL 7B-SFTMiMo-VL 7B-RLKeye-VL-1.5 8BSkyra 7B-SFTSkyra 7B-RLBusterX++ 7BVideoVeritas 8B
- 基准
- Artifact-Bench
- 指标
- accuracy
研究者提出 Artifact-Bench,用于评估 MLLM 检测与诊断 AI 生成视频伪影的能力,覆盖写实、动画和 CG 三类视频并建立三级伪影分类体系。该基准设置真实与 AI 生成视频分类、成对真实度比较、细粒度伪影识别三项任务,测试 19 个主流 MLLM 后发现其在伪影感知与推理上存在明显局限,部分困难场景下表现接近甚至低于随机水平。研究还发现 MLLM 判断与人类感知偏好存在显著错位,作为 AI 生成视频真实度的通用评估器可靠性有限。
深度解读
这篇论文试图解决什么问题?
MLLM 能否检测并诊断 AI 生成视频伪影仍不清楚,Artifact-Bench 用三项任务来评。
现有 MLLM 能否感知并诊断 AI 生成视频中的真实性伪影,仍不清楚。
- 使用场景:作者称视频生成已更逼真,但输出仍常见时序不一致、结构扭曲、不自然运动和语义不连贯。作者认为这些伪影限制感知真实感,并关系到媒体鉴真、内容审核和生成模型评测。
- 现有不足:作者称已有基准常把鉴真、偏好评测和伪影定位分开,且多限写实视频;一般视频基准又偏语义理解,难以区分伪影感知与语义先验或数据偏差。Table 1 中,检测、比较、诊断都覆盖且带难度层级的,只有 Artifact-Bench。
- 作者的观察:作者认为,相对纯语义或风格线索,生成伪影更能反映当前生成管线的内在限制。除二分类外,作者认为诊断伪影还可为改进生成模型提供信息。
- 本文提出:三层伪影分类(最细 30 类),以及 Artifact-Bench 的三项任务:真假分类 RVAC、成对真实感比较 PVRC、细粒度伪影识别 AID,覆盖写实、动画和 CG。
有哪些相关研究?
论文把本文与鉴真、偏好和伪影定位类基准区分,并覆盖动画与 CG。
论文在第 2 节分两条线讨论,并用 Table 1 对比基准。
MLLM 与 AIGC 评测应用
- 通用视觉语言能力:论文列举一批 MLLM,称其已用于视觉问答、视频描述和视频 OCR,并能做复杂视觉推理,因而被考虑做可扩展的视频评测。
- 检测与真实感评估:BusterX++(Wen 等,2025)和 Skyra(Li 等,2025)被点名为用 MLLM 做自动 AIGC 视频检测与真实感评估的例子。本节只作引出,未展开优劣。
质量评估与诊断式基准
- UVE-Bench(Liu 等,2025):按细粒度维度做成对比较,并有人类偏好标注。论文称基于偏好的打分对模型推理过程提供的信息有限。
- VF-Eval(Song 等,2025):把评测做成诊断式问答。论文称问答式评测可能让模型利用数据集偏差。
鉴真与伪影定位
- AEGIS(Li 等,2025):提供多模态特征标注,用来评模型推理链。
- GenBuster-Bench(Wen 等,2025):用 MLLM-as-a-Judge 评鉴真预测的理由。
- ViF-Bench(Li 等,2025):按分层伪影分类做时空定位,要求时间戳和边界框。
论文对现有基准的总评是:通常只在单一范式下评测,场景偏窄,主要看写实 AIGC 视频。Table 1 还列出各项的任务数、视频数、样本数、场景、难度层级、标注者和评测方面数。
基线与本文定位
- 对照:实验对照是 Table 2 的 Human Expert;作者另以二选一任务的随机猜测(约 50%)作参照。评测数据即 Artifact-Bench。Skyra、BusterX++、VideoVeritas 在表中是被测专用模型,不是单独列出的方法基线。
- 定位:作者称本文用 RVAC、PVRC、AID 把粗粒度鉴真接到细粒度伪影推理,并覆盖写实、anime 和 CG 风格。
论文如何解决这个问题?
三层分类支撑 RVAC、PVRC、AID,数据经采集、再生成、定向合成与人工分层建成。
Artifact-Bench 先定三层真实性伪影分类,再设由粗到细的三项任务,并用混合数据、人工质检和 L1-L3 难度分层支撑评测。
三层伪影分类
- 怎么建成:作者反复查看公开 AIGC 视频,包括写实、风格化,以及旨在模拟真实外观或运动的计算机生成画面,合并重叠失败模式,得到 Figure 1。
- 三层结构:顶层按感知与推理深度分为 Surface Artifacts、Structural Defects、Temporal-Semantic Violations。中层是失败族,如 Color & Exposure、Camera & Lens、Image Quality & Texture,以及身份、形态、空间深度、功能结构和光学一致性;时序-语义侧覆盖运动、因果、常识和场景连续性。最细层是 30 个可观察失败模式。第 3.1 节举例 Texture Inconsistency、Irreversibility Violation、Cross-Shot Coherence;Figure 1 文字里场景连续性下可见 Spatial Coherence,未见 Cross-Shot Coherence 这一字符串。
- 标签约定:分类用于诊断,不要求互斥。一段视频可同时有多个伪影,一个可见失败也可跨层,因此支持多标签。
三项任务
- RVAC:输入单段视频,判断是否为 AI 生成,输出 Yes 或 No。每段真实视频配一段语义相近的生成视频,使判断落在真实感线索而非语义差异。附录 A 的任务提示还规定:传统 CG、动画管线、游戏引擎或专业渲染不算 AIGC。
- PVRC:输入两段 AI 生成视频,在 video A 与 video B 中选看起来更真实的一段。两段语义相近。附录提示要求按伪影的轻重、频率和可感知性比较,不要只看风格、分辨率或高层语义。
- AID:给定生成视频,从 6 个选项中选出全部成立的细粒度标签。选项来自 30 类;正确项是视频中清楚可见的标签,干扰项来自语义相关或易混淆类型,通常在同一或相邻失败族。
数据构建
- 生成工具:公开网络视频与模型生成并用。Gemini 3.1 Pro 写详细字幕;生成模型包括 Kling-2.5、Kling-2.1、Veo 3、HunyuanVideo-1.5、daVinci-MagiHuman、LTX-2.3、Wan2.2。
- 分任务做法:RVAC 用真实视频的字幕生成语义对齐的对应视频。PVRC 有两条路:用高质量 AI 视频的字幕再生成更不真实的对应视频;或同一提示生成多段,再选语义相近但真实感不同的对。AID 先收集已呈现特定伪影的网络视频;少见伪影则用提示故意诱发失败,生成后再人工挑选。论文未给出这些诱发提示的原文。
标注、难度与规模
- 质检:每段 AI 视频由 3 名有经验标注者独立标注,三人一致才接受;否则另由 2 人做第二轮。接受样本再经 2 名有行业经验的专家复核。
- 难度:作者称难度判断有主观性,故每条由 3 名专家独立评级;不一致时再加 2 人,讨论后多数表决。任务 1 和 3:L1 为低真实感、伪影明显,L3 为高真实感、难区分。任务 2:L1 为真实感差异清楚,L3 为真实感接近、伪影细微。
- 规模:1,350 段视频、1,100 条标注样本(第 3.4 节,与 Table 1 一致)。附录 Table 3 的问答数为 RVAC 500、PVRC 250、AID 350;该表题写 RealVideo-Bench,正文称这些数字属于 Artifact-Bench。样本覆盖五大类、20 个场景,以及不同时长、分辨率和主体构成;各类占比正文未给数字,见 Figure 4。
答案如何判定
- 抽取:附录 A.3 用 Gemini 3.1 Pro 从可能含长推理的回复中抽取最终答案;没有明确最终答案则标为 Invalid。论文未说明 Invalid 是否计入错误,也未写出 AID 多标签是整组全对还是部分计分。
- 参照:第 4 节以准确率报告结果。作者称 RVAC、PVRC 为二选一,随机猜测约 50%。附录 A 给出三份任务提示和三份抽取提示。
论文做了哪些实验?
19 个 MLLM 的 Total 最高 47.5;AID 平均准确率均低于 10%;人类专家 Total 为 87.7。
实验设置
- 被测模型:第 4.1 节称共 19 个:2 个专有、14 个开源通用、3 个开源专用。Table 2 实际分列 19 行:Gemini 3.1 Pro、Gemini 3 Flash;Qwen3-VL 的 8B/30B-A3B/32B,各有 Instruct 与 Thinking;InternVL3.5 8B、30B-A3B、38B;Molmo2 8B;MiMo-VL 7B-SFT 与 7B-RL;Keye-VL-1.5 8B;Skyra 7B-SFT 与 7B-RL、BusterX++ 7B、VideoVeritas 8B。正文的“14 与 3”和表中的通用/专用行数对不上,以下以表为准。
- 数据与对照:Artifact-Bench,1,350 段视频、1,100 条样本。附录 Table 3(表题写 RealVideo-Bench):RVAC 的 L1/L2/L3 为 250/149/101,PVRC 为 125/87/38,AID 为 140/157/53。对照为 Table 2 的 Human Expert;第 4.2 节另请四位人类专家人工评测。论文未说明这四人的分数如何汇成表中一行,也未说明与标注人员是否重叠。
- 指标:准确率。各任务报 L1-L3 与 Avg;Total 为跨任务总分,论文未给汇总公式。作者称二选一随机猜测约 50%。论文未报告重复次数和统计检验。
- 解码:默认 5 fps;必要时做帧缩放。有官方推荐则采用,例如 Gemini 3.1 Pro 的 temperature 为 1.0、thinking_level 为 high;否则默认贪心解码(附录 A)。最终答案由 Gemini 3.1 Pro 抽取。
主结果
据 Table 2,数字为该表列出的准确率。只列 Total 最高、最低、专用模型中 Total 最高,以及人类对照;省略行在表后说明。
表格较宽,可左右滑动
模型 RVAC Avg PVRC Avg AID Avg Total Gemini 3.1 Pro 74.0 48.6 9.8 47.5 Gemini 3 Flash 64.7 50.9 9.8 43.8 VideoVeritas 8B 68.2 53.1 7.8 46.0 Qwen3-VL 32B-Instruct 53.5 50.8 7.3 39.5 BusterX++ 7B 52.0 42.5 5.3 36.2 InternVL3.5 8B 48.2 46.5 3.9 34.5 Skyra 7B-SFT 49.2 21.1 5.7 29.4 Human Expert 93.6 86.4 80.3 87.7 省略的 Total:Qwen3-VL 8B-Instruct 36.0、8B-Thinking 33.3、30B-A3B-Instruct 35.5、30B-A3B-Thinking 36.3、32B-Thinking 37.3;InternVL3.5 30B-A3B 33.8、38B 34.7;Molmo2 8B 34.5;MiMo-VL 7B-SFT 35.4、7B-RL 35.7;Keye-VL-1.5 8B 33.8;Skyra 7B-RL 32.0。
- 作者称 Gemini 3.1 Pro 是得分最高的模型;多数 MLLM 在更高难度上不能稳定超过二选一的随机参照。Table 2 全部 19 个模型的 AID Avg 都低于 10%,与作者“全部模型 AID 平均准确率低于 10%”一致;人类专家不在此列。
- 作者称模型或能在粗粒度上感到不真实,但仍难以点明不真实的原因。作者称即便最强的专有模型与人类专家仍有差距。
- 作者称专有模型在三项任务上持续更强。Table 2 有反例:VideoVeritas 8B 的 PVRC Avg 高于两款 Gemini,Total 也高于 Gemini 3 Flash;Qwen3-VL 32B-Instruct 的 PVRC Avg 高于 Gemini 3.1 Pro。
难度层级与人类偏好
- 测了什么:同一张 Table 2 上,看 L1 到 L3 是否随难度下降。人类三项都下降:RVAC 为 95.6、92.6、90.1;PVRC 为 88.0、86.2、81.6;AID 为 82.9、79.0、77.4。
- 模型并不单调下降:Gemini 3.1 Pro 的 RVAC 为 68.4、76.5、77.2,随难度上升;Gemini 3 Flash 的 AID 为 8.6、9.6、11.3,同样上升。Skyra 7B-SFT 的 PVRC 三级为 19.2、23.0、21.1。
- 作者解读:作者认为模型没有稳定按人类定义的难度层级判断,可能依赖表层语义线索、数据偏差或与感知真实感关系弱的捷径。作者认为这会限制把 MLLM 用作视频生成的奖励或自动评审。
细粒度与跨帧失败案例
- 图注内容:Figure 5(a)写桨穿过船壳,伪影只占画面很小一部分;(b)写足球从两个变成一个再变回两个,需要多帧跟踪。正文未给出这两例对应的模型名或错误率。
- 作者解读:作者认为局部异常可能在视觉 token 压缩或全局特征汇聚中被压掉;跨帧不一致无法只靠单帧识别。作者认为当前 MLLM 常依赖稀疏抽帧和粗时间建模。
规模与显式推理
- InternVL3.5 38B 的 Total 为 34.7、RVAC Avg 为 48.2,与 8B 的 34.5、48.2 接近(Table 2)。作者以此为例,称放大模型不一定提高伪影检测。
- Qwen3-VL 8B-Thinking 的 Total 为 33.3,低于 8B-Instruct 的 36.0;32B-Thinking 为 37.3,低于 32B-Instruct 的 39.5。作者认为加入通用推理过程不一定增强对细微时空不一致的感知。
其他消融与分析
- Qwen3-VL 30B-A3B-Thinking 的 Total 为 36.3,高于 Instruct 的 35.5(Table 2)。
- MiMo-VL 7B-RL 的 Total 为 35.7,SFT 为 35.4;Skyra 7B-RL 为 32.0,SFT 为 29.4。
- Skyra 7B-RL 的 PVRC Avg 为 25.7,SFT 为 21.1,均低于作者给出的约 50% 参照。
- InternVL3.5 30B-A3B 的 PVRC L3 为 23.7,Avg 为 36.6。
- AID Avg 最低为 Keye-VL-1.5 8B 的 2.7,其次 MiMo-VL 7B-SFT 的 2.8;后者 L3 为 0.0,InternVL3.5 38B 的 AID L3 亦为 0.0。
- Gemini 3.1 Pro 的 AID 从 L1 的 19.3 到 L3 的 3.8;其 PVRC L1 为 45.6,低于 L2 的 52.9。
有什么可以进一步探索的点?
附录 C 称专家人数与数据规模还可扩大;结论称需要更强的细粒度与人类对齐感知。
作者指出的局限与后续方向
- 专家与规模:附录 C 称,由于资源约束,人类专家人数和数据集规模还可以再扩大。
- 后续数据:附录 C 称,未来工作将扩大该基准,纳入更多样的视频来源、伪影类型和专家标注。作者计划这样做,论文未称已经完成。
- 模型方向:结论称,这些发现指出未来 MLLM 需要更强的细粒度、时空,以及与人类对齐的真实感理解。
实验覆盖范围
- 主表覆盖 19 个 MLLM 加 Human Expert,三项任务都有 L1-L3(Table 2)。问答条数见附录 Table 3,其中 PVRC 的 L3 为 38、AID 的 L3 为 53。
- 场景在 Table 1 写为 Real & Stylized;正文另写写实、动画/anime 和 CG,并称五大类、20 个场景(第 3.4 节)。正文未给出五大类的名称和占比。
- 字幕用 Gemini 3.1 Pro;生成模型为 Kling-2.5、Kling-2.1、Veo 3、HunyuanVideo-1.5、daVinci-MagiHuman、LTX-2.3、Wan2.2(第 3.3 节)。评测默认 5 fps,答案抽取也用 Gemini 3.1 Pro(附录 A)。
- 标注协议为 3 人一致,否则另 2 人复核,再经 2 名行业专家核验;难度评级同样可加至 5 人后多数表决(第 3.3 节)。人类评测另邀四位专家(第 4.2 节)。
- 论文未报告重复次数、标注者一致性的数值、统计检验、Total 的汇总公式,以及 AID 多标签匹配规则和 Invalid 如何计分。
总结一下论文的主要内容
Artifact-Bench 以三项任务评 MLLM 的 AIGC 伪影感知;作者称判断与人类偏好错位。
Artifact-Bench 用来看 MLLM 能否发现 AI 生成视频中的伪影,并说明视频为何不真实。
- 问题:生成质量上升后,时序、结构和语义类缺陷仍然常见。作者认为现有基准往往只做鉴真、偏好或定位中的一种,且偏写实,因此分不清模型是在看伪影,还是在用语义先验。
- 做法:三层分类,最细 30 类,不要求互斥。三项任务分别是单视频真假判断、两段生成视频的真实感比较,以及从 6 个选项中选出全部可见伪影。数据混合网络视频与七个生成模型的输出,经多人标注和 L1-L3 分层,共 1,350 段视频、1,100 条样本。
- 结果:Table 2 中 Total 最高为 Gemini 3.1 Pro 的 47.5。19 个模型的 AID Avg 都低于 10%,人类专家的 AID Avg 为 80.3、Total 为 87.7。VideoVeritas 8B 的 PVRC Avg 为 53.1,高于两款 Gemini。Skyra 7B-SFT 的 PVRC Avg 为 21.1。人类准确率随难度下降,部分模型在更难子集上反而更高。
- 作者结论:作者称许多模型接近或低于随机参照,判断也未稳定跟随人类难度层级,这限制了把它们用作通用评测者或奖励提供方。结论称未来模型需要更强的细粒度、时空和人类对齐的真实感理解。附录 C 称专家人数和数据规模还可扩大。