RedFlow:将失败重定向为动作级纠正的流匹配 VLA 策略后训练框架
[Daily Paper] RedFlow: Redirect Failure into Action-level Corrections for Flow-matching VLA Policy
AI 导读
Yan 等人提出 RedFlow,一个面向流匹配 VLA 策略的离线后训练框架,通过执行上下文匹配从固定混合质量的 rollout 缓冲中提取局部纠正动作目标,无需额外环境交互或人工干预。该方法用归一化本体状态与平滑任务进度构成低维上下文向量,经 HDBSCAN 聚类后以簇加权质心作为失败动作的重定向目标,替代传统轨迹拼接的整段替换。