其他arXiv 2610.05831
长时程轨迹监督如何影响终端智能体训练的可靠性与成本
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
- arXiv
- 2610.05831
- 发表
- 被测模型
- Qwen/Qwen3-8B
摘要中间长度的监督更均衡。
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出 Geodesic Unlearning,沿测地线编辑权重以提升缺模态鲁棒性
这项工作讨论多模态模型在部署时整段缺一个模态的性能下降,并把校正写成训练后的子空间编辑。
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行