Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886
Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures
AI 导读
研究团队提出 RLCDAlignBench,在谄媚、越狱、欺骗、提示注入、幻觉、隐私侵犯、社会偏见、奖励作弊、隐瞒不确定性和权力寻求这十类对齐失败上评测经 RLCD 训练的模型 Jev,覆盖 44 个基准和 5 个目标模型。