LABSHIELD:面向科学实验室安全推理与规划的多模态基准
LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories
AI 导读
研究者提出 LABSHIELD,一个面向科学实验室危险识别与安全关键推理的多视图多模态基准,用于评估多模态大语言模型(MLLM)智能体在实验室环境中的安全决策可靠性。该基准以美国职业安全与健康管理局(OSHA)标准和全球化学品统一分类和标签制度(GHS)为依据,构建了覆盖 164 项操作任务的安全分类体系,任务在操作复杂度和风险类型上各不相同。研究团队在双轨评估框架下测试了 20 个闭源模型、9 个开源模型和 3 个具身模型,结果显示通用领域选择题准确率与半开放问答的安全表现之间存在系统性差距,模型在专业实验室场景中平均下降 32.0%,在危险解读和安全感知规划方面尤为明显。作者据此指出,具身实验室场景需要以安全为核心的推理框架。完整数据集将随后发布。