跳到正文
原文
论文追踪· arXiv:2604.12447·本站收录 · 原文发表

HazardArena:面向 VLA 模型的语义安全评测基准

HazardArena: Evaluating Semantic Safety in Vision-Language-Action Models

AI 导读

研究者提出 HazardArena,一个用于压力测试视觉-语言-动作(VLA)模型语义安全的基准。其核心设计是安全与不安全孪生场景:成对环境的物体、布局和动作要求相同,但语义风险语境不同,从而把安全判断与动作能力分离开来,直接检验 VLA 能否识别原本有效的动作何时变得危险。基准包含 2000 多个资产和 51 项风险敏感任务,覆盖基于机器人安全标准的七个安全类别。在四个代表性 VLA 骨干模型上,仅用安全数据微调会提升良性任务成功率,同时也提高在匹配不安全场景中的危险执行率;物理世界实验确认这一失效可迁移到仿真之外。作者据此认为更强的动作执行能力并不代表更安全的行为,语义风险感知的评估与执行应成为真实部署的一等要求。

阅读原文arxiv.org