跳到正文
原文
Failure-First·本站收录 · 原文发表

RedFlow:将失败重定向为动作级纠正的流匹配 VLA 策略后训练框架

[Daily Paper] RedFlow: Redirect Failure into Action-level Corrections for Flow-matching VLA Policy

AI 导读

Yan 等人提出 RedFlow,一个面向流匹配 VLA 策略的离线后训练框架,通过执行上下文匹配从固定混合质量的 rollout 缓冲中提取局部纠正动作目标,无需额外环境交互或人工干预。该方法用归一化本体状态与平滑任务进度构成低维上下文向量,经 HDBSCAN 聚类后以簇加权质心作为失败动作的重定向目标,替代传统轨迹拼接的整段替换。

阅读原文failurefirst.org