ReferTrack:具身视觉跟踪中先用显式指向再解码路径
[Daily Paper] ReferTrack: Referring Then Tracking for Embodied Visual Tracking
AI 导读
针对当前 Vision-Language-Action(VLA)模型的抽象空间隐变量难以监督、失败原因无法归因的问题,研究者提出 ReferTrack,将具身视觉跟踪拆解为先从候选目录中用单个 Refer-CoT token 选出目标索引、再由 TVBI token 维持目标的显式流程。该框架基于 Qwen3-4B,搭配 YOLO11 加 ByteTrack 检测器和 SigLIP/DINOv2 双编码器,仅用单目前视摄像头就在 EVT-Bench 取得 SOTA:Single-Target Tracking 成功率 89.4%、Distracted Tracking 73.3%。