AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠
提出 AgentTime 基准,评测智能体按时长工作与估时能力
- arXiv
- 2610.09944
- 发表
- 层
- 应用层
- 被测模型
- Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 等 7 个
摘要作者把完成任务和管理所用时间分开。
AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。
提出 AgentTime 基准,评测智能体按时长工作与估时能力
AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。
提出 ParanoiaEval 评测编码智能体的不必要风险处置
作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。
提出 SWE-CC 基准,评测编码 Agent 对仓库贡献策略的遵守
SWE-CC 评测编码智能体是否遵守仓库贡献策略,而不只看补丁能否通过测试。
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性
SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。
发现暴露模型家族标签会让多智能体派系化并削弱合作
Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。
提出 READY 框架,认证企业 Agent 在人工监督下能否达到规定可靠性
READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行
测量任务无关说服对 Agent 编码与网页研究行为的影响
这篇工作测量一件事:与任务无关的说服进入对话之后,AI 智能体执行后面的编码或网页研究时,轨迹是否系统性不同,以及“更容易被说服”能否预测差有多大。