其他arXiv 2610.05831收录
长时程轨迹监督如何影响终端智能体训练的可靠性与成本
提出 selective long-horizon 精炼,筛选长轨迹训练终端智能体
- arXiv
- 2610.05831
- 收录
- 场景
- 编程 Agent
- 测试
- Qwen/Qwen3-8B
摘要中间长度的监督更均衡。
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出 selective long-horizon 精炼,筛选长轨迹训练终端智能体
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出 CGMIA,用成员推理检测代码生成基准的数据泄漏
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。