CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- C2P-CLIP、ForgeLens、D3-Im 等 10 个
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器
BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。
提出基准 OLMo-Detect 评测 LLM 成员推断
提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘
语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。
提出 IDUnlearn-Bench,评测 VLM 个体级遗忘后的身份残留
IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。
提出 PrivDrift 基准,审计话题漂移后的用户秘密复述
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
提出抗攻击多语言视觉指令遵循基准 MM-IFEval-Pro
MM-IFEval-Pro 是面向 VLM 的中英多模态指令遵循基准,并配有可用规则计算奖励的 GRPO 训练集。
提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡
aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。
提出 EXE-Bench 比较 Windows 恶意软件检测器的可用性权衡
EXE-Bench 用同一设置给 AI Windows 恶意软件检测器做四指标排序,而不是只比一次测试集准确率。。
提出最小范数攻击集成,用鲁棒性曲线评测图像分类器
这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。