Event-VLA:面向鲁棒视觉-语言-行动模型的行动条件化事件融合
[Daily Paper] Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model
AI 导读
针对当前 VLA 模型依赖帧基 RGB 传感器、在光照突变与运动模糊下易发生分布外失效的问题,Liu 等人提出 Event-VLA,将异步事件相机流作为互补观测引入机器人操控策略。该方法通过 Physical Residual Event Integration(PREI)把事件历史分解为瞬时、显著、持续三通道残差图,并以门控交叉注意力加查询引导路由接入冻结语义主干之外的动作通路,辅以一个预测未来事件的辅助头做正则化。在 LIBERO 及三级光照退化的 LIBERO-Cross(LL-Mild、LL-Dark、LL-Severe)上该框架提升了抗退化能力,但仍会在弱对比导致事件激活不足的场景中失败。