评测与基准arXiv 2609.29429
Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886
提出 RLCDAlignBench,零样本检测多种对齐失败
- arXiv
- 2609.29429
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Jev (jev-1.13.0)
摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
审计 Active Inference Agent 上 LLM 解释器的监督叙述失败
作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。
提出 Emergence World,对长时程多智能体系统开展对抗压力测试
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。