RSIGym:预算约束下的 AI 研究智能体评测环境与 RSI-Index 指标
提出 RSIGym 环境,评测研究智能体的递归自改进
- arXiv
- 2610.10310
- 发表
- 层
- 应用层
- 被测模型
- Claude Opus 5、Claude Opus 5.5、GPT-6 Astra 等 9 个
- 风险危险能力
提出 RSIGym 环境,评测研究智能体的递归自改进
提出 TasteVal 基准,衡量模型设计实验并解释结果的研究品味
提出双层系统 AIDE2,使研究智能体自改进 Harness 并对比人类研发基线
摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。
提出 APEXA,在工具层拒绝无执行支撑的结果并拦截电机命令
APEXA 是先进光子源上的数据还原框架,用工具层代码约束语言模型智能体的工具调用。
提出 SCHEMA,用概念图与轨迹分评测科学 Agent 幻觉
SCHEMA 是面向科学智能体幻觉的证据锚定评测框架,实例化在生物医学的 Protein Domain 与 PathVQA-Enhanced。作者在摘要中称它是首个同时做到证据锚定和拓扑感知的此类框架。
提出影子评测,衡量 Agent 自主完成开放式 AI 科研的能力
摘要论文通过影子评测发现前沿智能体能独立胜任科研工程实现,但在科学探索与有效利用反馈上未达到顶会门槛。
构建 SciHazard 基准,评测科研智能体与 LLM 的科学危险能力
SciHazard 是一个科学滥用风险基准,配一个把危害拆开再合成的自动分数。
提出 BioSecBench-Refusal,评测智能体生物研发拒答与隐蔽危害识别
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
提出 SciTrace,为科学发现智能体加入跨阶段安全推理与工具轨迹核验
SciTrace 是加在科学发现智能体流水线上的安全框架,不是再在各阶段出口放一个独立过滤器。
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向
这是一篇关于 LLM 驱动 AI scientists 的 perspective:自主科研能力增强时,误用和意外后果缺少科学情境下的系统防护。