评测与基准arXiv 2609.02168
FUSE:面向大语言模型危险能力的模块化评测框架
提出 FUSE 框架,评测大语言模型的化生危险能力
- arXiv
- 2609.02168
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Claude-3-Haiku、Claude-Opus-4、Claude-Opus-4.5 等 13 个
提出 FUSE 框架,评测大语言模型的化生危险能力
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。