跳到正文
原文
Hugging Face Daily Papers· arXiv:2610.08761·本站收录 · 原文发表

VeriFine:通过扩展验证实现具身推理的自我改进

VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning

AI 导读

VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的共同演化来扩展验证能力,以支持具身推理中的持续自我改进。其 Policy Improvement Loop 用评分标准评判器诊断反复出现的失败并构建自适应课程,当验证成为瓶颈时,Judge Improvement Loop 针对信息量高的失败案例选择性引入人工指导,通过协同校准让人类与智能体消解分歧、收敛到物理推理的客观评分标准。在驾驶与机器人导航任务上,该框架在强化学习和监督微调中均实现了策略与评判器能力的持续提升。

阅读原文huggingface.co