Parsewave 审计 AutomationBench 评估器发现问题
先了解这件事
Parsewave 对 Zapier 的 AutomationBench(commit 4a8e106)评分器进行审计,先用 AI 智能体为全部 600 个计分任务编写对抗性测试答案,再人工复核被标记的任务,确认 210 个任务存在评分器问题,其中 197 个来自 600 个计分任务、13 个来自 200 个不计分的简单任务,并应用了修复,发布 AutomationBench Verified V0.0。另一篇报道称,Parsewave 对 AutomationBench 的 600 个公开任务做验证器审计,用智能体辅助的对抗性提交筛查出约 300 个可疑任务,人工复核后确认 206 个存在严重问题并全部修复,其中 100 个案例公开了详细推理。该基准测试 AI 智能体在销售、营销、人力资源、运营、客服和财务等业务流程上的表现,出现在 Gemini 4 Argon、Claude Opus 5.5、GPT-6 Astra 等模型卡中。
AI 根据报道生成 · 2 小时前更新
后续时间线
- Parsewave精选Parsewave 发布 AutomationBench Verified,修复 210 个评分器问题
Parsewave 发布 AutomationBench Verified V0.0,对 Zapier 的 AutomationBench(commit 4a8e106)评分器做审计并应用修复,确认 210 个任务存在评分器问题,其中 197 个来自 600 个计分任务、13 个来自 200 个不计分的简单任务。审计先用 AI 智能体为全部 600 个计分任务编写对抗性测试答案,再人工复核被标记的任务。在 16,683 个本应失败的测试答案中,原评分器放过了 9,797 个(59%);在 5,949 个本应通过的答案中,原评分器误判 1,919 个(32%)。数据集包含修复后的任务文件、grader/fixed_rubric.patch、210 份证据目录,以及 Kimi K3 在 206 个修复任务上原版与修复版各三次共 1,236 次运行记录。
- ParsewaveParsewave 审计 AutomationBench 公开任务,发现 206 处验证器问题并修复
Parsewave 对 AutomationBench 的 600 个公开任务做了验证器审计,用智能体辅助的对抗性提交筛查出约 300 个可疑任务,人工复核后确认 206 个存在严重问题并全部修复,其中 100 个案例公开了详细推理。该基准测试 AI 智能体在销售、营销、人力资源、运营、客服和财务等业务流程上的表现,出现在 Gemini 4 Argon、Claude Opus 5.5、GPT-6 Astra 等模型卡中。用开源前沿模型 Kimi K3 复测显示,修复后 16 个任务变宽松、57 个任务变严格,平均分均朝修复方向变化;用相反验证器重判时 344/1235 条判定改变,占 27.9%。审计仅覆盖公开任务,作者表示希望与 Zapier 合作审计私有集。
- X@shaped· 讨论AutomationBench Verified is out(新标签页打开原帖)
相关讨论
- X@shapedAutomationBench Verified is out(新标签页打开原帖)
仅提供链接,本站不转载内容。
关注度走势
每天新增来源
- 10月7日 新增 1 个来源(0 家媒体、1 个账号)
- 10月8日 新增 2 个来源(2 家媒体、0 个账号)