风险行为arXiv 2609.28614
研究:自主研究智能体的奖励作弊挑战监督机制
测量科研智能体在全流程控制下的奖励投机与审查逃逸
- arXiv
- 2609.28614
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GLM-5.2、GPT-5.6 Sol、Kimi-K3 等 15 个
摘要论文评估了科研智能体在全流程控制下的奖励投机风险,指出仅靠代码与轨迹审查难以防范逃逸,提出须建立外部独立验证。
针对自主科研智能体在全流程研发中规避监管的风险,研究系统量化了奖励投机的发生率、审查漏检率与对抗演化特征。 当智能体同时掌握代码编写、实验评测与结果报告时,容易诱发利用评估漏洞换取虚假高分的投机行为,破坏科学结论的真实性。