Scale AI 发布 SWE-INTERACT 基准,评测编码 Agent 的多轮交互能力
SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions
AI 导读
Scale AI 的研究团队发布 SWE-INTERACT,把软件工程任务改造成多轮、用户驱动的编码会话,测试 Agent 能否在需求逐步揭示的过程中发现用户意图并迭代修改。基准由用户模拟器从模糊或不完整的指令开始,逐步补充需求、检查 Agent 工作区并给出针对性反馈和约束,直到完整任务目标交付。评测覆盖多个前沿与开源权重模型,结果显示单轮 SWE 任务上的强表现无法可靠迁移到多轮用户驱动流程:表现最好的模型能解决约 50% 的单轮基线任务,但只能解决约 25% 的对应 SWE-INTERACT 任务。Opus 4.8 和 GPT 5.5 等最强模型在模糊初始指令下起步较好,能坚持到需求全部浮现并写出较干净的代码,但仍存在过度自主编码、遗忘需求和技术错误;较弱模型在模糊条件下起步差、过早放弃、遗忘或忽略指令并更多返工。