跳到正文
原文
arXiv· arXiv:2609.24983· Lei Yang·· 10 天前

onPanda:通过 token 级修正高效标注 LLM 与智能体的 on-policy 对齐数据

onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction

AI 导读

onPanda 是一款用于标注 LLM 对齐数据与智能体轨迹的交互工具,核心交互是 token 级修正:标注者定位首个不当 token,从模型候选 token 中选取替换或自由编辑,系统截断其后内容并从修正前缀继续生成,循环"定位—修正—继续"直至满意。一项小规模对照研究显示,onPanda 将标注中位耗时较人工后编辑降低 52%。由于最终回复绝大多数 token 由模型自身生成,所得数据基本保留模型采样分布,适用于构建 on-policy SFT 与偏好数据,修正记录还提供带精确位置的正负样本对。

阅读原文arxiv.org