评测与基准arXiv 2609.02168
FUSE:面向大语言模型危险能力的模块化评测框架
提出 FUSE 框架,评测大语言模型的化生危险能力
- arXiv
- 2609.02168
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Claude-3-Haiku、Claude-Opus-4、Claude-Opus-4.5 等 13 个
提出 FUSE 框架,评测大语言模型的化生危险能力
提出 harm laundering,证明安全训练改写而非消除性别歧视
Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。
用语义保留变换探针比较效用与对齐在分布偏移下的稳定性
摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。