评测与基准arXiv 2609.02168·9月2日FUSE:面向大语言模型危险能力的模块化评测框架提出 FUSE 框架,评测大语言模型的化生危险能力arXiv2609.02168发表9月2日层模型层场景模型与 API测试Claude-3-Haiku、Claude-Opus-4、Claude-Opus-4.5 等 13 个攻击越狱风险危险能力深度解读完整解读