PerturBot 用扰动训练打破视觉-语言-动作模型的模态捷径
PerturBot: Breaking Shortcut Priors in Vision-Language-Action Models with Perturbative Training
AI 导读
研究者提出 PerturBot,用于缓解视觉-语言-动作(VLA)策略中的模态捷径问题,即策略依赖训练中反复出现的视觉、词汇或动作线索而非任务证据来做决策。该方法在训练阶段引入保持任务语义的腕部视角扰动、加入含决策信息的指令描述,并混入随机与失败轨迹片段并按其中实际行为重新标注,推理阶段不做改动。作者同时提出离线指标 GroundingFscore,用于诊断策略对模态捷径的依赖程度,与任务成功率互补,判断策略是否在健康地扩展。论文称二者共同构成一套训练与评估框架,使 VLA 决策更多依赖任务相关证据。