BabelFake:面向多语言音视频 DeepFake 检测的基准数据集
BabelFake: A Multilingual Audio-Visual DeepFake Benchmark
AI 导读
研究者发布 BabelFake,一个由知情同意参与者录制的多语言音视频 DeepFake 基准,包含来自 496 人的 399k 段视频(1,323 小时),覆盖英语、德语、意大利语、法语和西班牙语五种语言。其模块化生成流程将 11 种现代视频篡改方法与 4 种声音克隆引擎配对,区分仅视觉篡改(换脸)与音视频联合篡改(唇形同步和肖像动画)。对当前最先进检测器的评测显示,检测难度取决于音视频生成配对方式,保留真实音频时检测性能明显下降;跨语言和跨人群评测显示检测器敏感度随架构与训练数据变化,而人类评测表明感知真实性与机器检测难度并不一致。