摘要剪枝后的 Speech-LLM 不能只看总体 WER:Fair-Speech 上族群差扩大,作者建议看最差组。
- 评测与基准arXiv 2608.18607
VA-Judger:面向联合视频-音频生成的人类偏好反馈奖励建模
提出 VA-Judger,用人类偏好训练联合音视频奖励模型
- arXiv
- 2608.18607
- 发表
- 场景
- 模型与 API
摘要VA-Judger 用易到难的人类偏好学习做联合音视频奖励,并用于 LTX-2 后训练。
VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。
- 评测与基准arXiv 2609.06991
AV-SafetyBench:面向文本到音视频生成的安全基准
提出 AV-SafetyBench 评测文生音视频模型的不安全生成
- arXiv
- 2609.06991
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要AV-SafetyBench 用三视角评五个 T2AV 模型,显示只看视频会漏掉音频与联合风险。
AV-SafetyBench 是面向文本生成音视频(T2AV)的安全基准:一条提示词同时规定画面和音频,评测同时看两轨以及它们的交互。作者要测的是,不安全含义不只出现在画面上:它可以主要由语音或声音承载,也可以只有两轨合起来才成立。T2VSafetyBench 不评音频,TTA-Bench 不评与画面的交互,作者认为二者都盖不住这些路径。
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。
已经到底了