评测与基准arXiv 2608.14380
AgentRewind:面向长周期 LLM Agent 的可恢复执行框架
提出 AgentRewind,用对齐检查点回退长程 Agent 的上下文与工作区
- arXiv
- 2608.14380
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GPT-5.4、GPT-5.4 mini、Qwen3.7-Max 等 7 个
- 组件权限与沙箱
提出 AgentRewind,用对齐检查点回退长程 Agent 的上下文与工作区
提出 BioSecBench-Surveillance,评测 Agent 的病原监测分析
提出 BioSecBench-Refusal,评测智能体生物安全拒答是否对准风险
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
提出 Box2-Bench,评测模型能否选择性依赖外部工作流
Box2-Bench 固定任务与模型,只改变工作流可靠性,用来衡量模型能否选择性依赖可能出错的外部指导。