评测与基准arXiv 2609.29429
Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886
提出 RLCDAlignBench,零样本检测多种对齐失败
- arXiv
- 2609.29429
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Jev (jev-1.13.0)
摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
提出 BioSecBench-Refusal,评测智能体生物研发拒答与隐蔽危害识别
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。