评测与基准arXiv 2610.10310
RSIGym:预算约束下的 AI 研究智能体评测环境与 RSI-Index 指标
提出 RSIGym 环境,评测研究智能体的递归自改进
- arXiv
- 2610.10310
- 发表
- 层
- 应用层
- 被测模型
- Claude Opus 5、Claude Opus 5.5、GPT-6 Astra 等 9 个
- 风险危险能力
提出 RSIGym 环境,评测研究智能体的递归自改进
提出 TasteVal 基准,衡量模型设计实验并解释结果的研究品味
提出双层系统 AIDE2,使研究智能体自改进 Harness 并对比人类研发基线
摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。
提出影子评测,衡量 Agent 自主完成开放式 AI 科研的能力
摘要论文通过影子评测发现前沿智能体能独立胜任科研工程实现,但在科学探索与有效利用反馈上未达到顶会门槛。
构建 SciHazard 基准,评测科研智能体与 LLM 的科学危险能力
SciHazard 是一个科学滥用风险基准,配一个把危害拆开再合成的自动分数。
提出 SciTrace,为科学发现智能体加入跨阶段安全推理与工具轨迹核验
SciTrace 是加在科学发现智能体流水线上的安全框架,不是再在各阶段出口放一个独立过滤器。
这是一篇关于 LLM 驱动 AI scientists 的 perspective:自主科研能力增强时,误用和意外后果缺少科学情境下的系统防护。