AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠
提出 AgentTime 基准,评测智能体按时长工作与估时能力
- arXiv
- 2610.09944
- 发表
- 层
- 应用层
- 被测模型
- Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 等 7 个
摘要作者把完成任务和管理所用时间分开。
AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。
提出 AgentTime 基准,评测智能体按时长工作与估时能力
AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
提出 ParanoiaEval 评测编码智能体的不必要风险处置
作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。
评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击
作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。
提出 SWE-CC 基准,评测编码 Agent 对仓库贡献策略的遵守
SWE-CC 评测编码智能体是否遵守仓库贡献策略,而不只看补丁能否通过测试。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性
SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。
发现暴露模型家族标签会让多智能体派系化并削弱合作
Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力
评测安全 Agent 在对抗性任务污染下的解题成功与开销
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。
提出 READY 框架,认证企业 Agent 在人工监督下能否达到规定可靠性
READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。
提出 SKILLBLOAT,改写技能文档放大编码 Agent token 消耗
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行
提出 SRE-Bench 评测智能体的真实规模二进制逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
用 CryptanalysisBench 评测大模型的端到端密码分析能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
构建真实网络靶场基准,评测 AI 的端到端自主攻击能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。
评测自主安全智能体在授权漏洞分析中的对齐拒答效应
这项工作把安全对齐效应测成自主安全智能体的轨迹属性,而不是单轮拒答率。
测量任务无关说服对 Agent 编码与网页研究行为的影响
这篇工作测量一件事:与任务无关的说服进入对话之后,AI 智能体执行后面的编码或网页研究时,轨迹是否系统性不同,以及“更容易被说服”能否预测差有多大。