安全动作不等于可行动作:VICS-G 为 VLA 策略做可行未来解码
A Safe Action Is Not Enough: Feasible-Future Decoding for Vision-Language-Action Policies
AI 导读
冻结的视觉-语言-动作(VLA)策略可能选中局部安全、却断绝安全完成任务路径的动作,作者将这一现象称为可行性与似然之间的落差。为此提出免训练、告警触发的重排序器 VICS-G,基于安全任务完成约束下的可行未来质量对候选动作重排。在六个 Safety-CHORES 设置中,VICS-G 将平均累计安全代价降低 1.9%-57.5%,成功率与策略采样相差不超过 2.5 个百分点,平均回合长度相差 0.82 步,且无需重新训练策略或在线 rollout。