RSIGym:预算约束下的 AI 研究智能体评测环境与 RSI-Index 指标
提出 RSIGym 环境,评测研究智能体的递归自改进
- arXiv
- 2610.10310
- 发表
- 层
- 应用层
- 被测模型
- Claude Opus 5、Claude Opus 5.5、GPT-6 Astra 等 9 个
- 风险危险能力
提出 RSIGym 环境,评测研究智能体的递归自改进
比较连续后训练阶段如何改变语言模型的说服力
作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。
提出 TasteVal 基准,衡量模型设计实验并解释结果的研究品味
评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击
作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。
在 GOAD 上评测 NeuroSploit 编排对 AD 自主渗透的提升
评测 Agent 选择并早期操作高风险生物工具的能力
这项评估测量七个前沿 LLM 智能体与生物工具交互的最早两步:为设计任务选工具,以及在仓库里完成玩具级操作。作者关心的是,有生命科学背景但不会专门操作高风险工具的行为者,能否借此降低门槛。范围限于预测性、生成性工具。
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
Chan 等论证:自动化 AI 研发可能经软件反馈环形成智能爆炸,把本需数年的进展压进数月或更短。他们关心的不是换硬件的建设周期,而是 AI 扩大有效研发劳动力、再产出更强系统,以及社会能否在能力跃迁前看见、约束并适应这一过程。
发布 Systemic Risk Index 流水线与看板,评测四类系统风险
提出双层系统 AIDE2,使研究智能体自改进 Harness 并对比人类研发基线
摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力
提出 VLoc Bench,评测智能体在完整仓库中定位漏洞文件并抑制修复后误报
摘要论文提出仓库级漏洞定位基准 VLoc Bench,指出当前模型定位表现较低且易在已修复代码上产生误报。
提出基准 PATCHBENCH,评测编程 Agent 的漏洞修补是否真正修复根因
摘要论文揭示漏洞修复评测的记忆与表面防护问题,提出离栈变异基准与双重验证,测得智能体实际解决率仅约五成。
提出 FUSE 框架,评测大语言模型的化生危险能力
提出 SRE-Bench 评测智能体的真实规模二进制逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
提出 OpenMLE,后训练元进化智能体并做机器学习工程长程搜索
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。
提出影子评测,衡量 Agent 自主完成开放式 AI 科研的能力
摘要论文通过影子评测发现前沿智能体能独立胜任科研工程实现,但在科学探索与有效利用反馈上未达到顶会门槛。
构建 SciHazard 基准,评测科研智能体与 LLM 的科学危险能力
SciHazard 是一个科学滥用风险基准,配一个把危害拆开再合成的自动分数。
用 CryptanalysisBench 评测大模型的端到端密码分析能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。