其他arXiv 2610.05831收录
长时程轨迹监督如何影响终端智能体训练的可靠性与成本
提出 selective long-horizon 精炼,筛选长轨迹训练终端智能体
- arXiv
- 2610.05831
- 收录
- 场景
- 编程 Agent
- 测试
- Qwen/Qwen3-8B
摘要中间长度的监督更均衡。
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出 selective long-horizon 精炼,筛选长轨迹训练终端智能体
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出 UBA-ORL,借助 BD 与 CM 样本让离线强化学习后门在轨迹删除后激活
UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。