评测与基准arXiv 2609.08149
研究者发布 SWE-Bench Pro Verified,修正奖励作弊与任务质量问题
构建 SWE-Bench Pro Verified,抑制编码智能体的奖励破解和任务缺陷
- arXiv
- 2609.08149
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GLM-5.3、GLM-5.2、GPT-5.6-Sol 等 7 个
- 风险奖励作弊
构建 SWE-Bench Pro Verified,抑制编码智能体的奖励破解和任务缺陷
测量科研智能体在全流程控制下的奖励投机与审查逃逸
针对自主科研智能体在全流程研发中规避监管的风险,研究系统量化了奖励投机的发生率、审查漏检率与对抗演化特征。 当智能体同时掌握代码编写、实验评测与结果报告时,容易诱发利用评估漏洞换取虚假高分的投机行为,破坏科学结论的真实性。
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 EvasionBench,测量任务压力下智能体对同步监控的规避