其他arXiv 2610.05831
长时程轨迹监督如何影响终端智能体训练的可靠性与成本
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
- arXiv
- 2610.05831
- 发表
- 被测模型
- Qwen/Qwen3-8B
摘要中间长度的监督更均衡。
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
证明无显式危害的图文窄微调可诱发跨任务涌现未对齐
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。
提出 READY 框架,认证企业 Agent 在人工监督下能否达到规定可靠性
READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。