AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠
提出 AgentTime 基准,评测智能体按时长工作与估时能力
- arXiv
- 2610.09944
- 发表
- 层
- 应用层
- 被测模型
- Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 等 7 个
摘要作者把完成任务和管理所用时间分开。
AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。
另有 386 篇论文还没打上分类标签,暂不在筛选结果里。
提出 AgentTime 基准,评测智能体按时长工作与估时能力
AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。
提出 TESTJACK,动态审计编码基准通过判定是否满足任务要求
提出 ParanoiaEval 评测编码智能体的不必要风险处置
作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。
提出 CredLeak-Bench,评测 Agent 面对钓鱼的凭据泄露与恢复
评测编码智能体 harness 安全机制在对抗任务中的防护效果
用 CheckerBench 评测长程编码 Agent 合成静态分析检查器
评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击
作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。
提出 AgentMonBench 评测长时程编程智能体监控并检验 EBG
长时程软件工程任务里,用户要判断智能体哪些选择值得核验。作者用 AgentMonBench 评测监控器,并用免训练的 EBG 组织带源证据。
提出 SWE-CC 基准,评测编码 Agent 对仓库贡献策略的遵守
SWE-CC 评测编码智能体是否遵守仓库贡献策略,而不只看补丁能否通过测试。
构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
构建网页浏览 Agent 的多语言多模态压力测试基准 HyperBrowseComp
评测容器、权限规则与沙箱能否区分编译器与编码 Agent 的文件读取
作者在物理流求解器上检查一套编码智能体配置:编译器必须读本组材料与反应模型,这些字节又不得进入模型上下文或离开本机的记录。
提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
构建 AGENTTELL 基准,测量浏览器 Agent 的行为侧信道隐私泄露
摘要论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。
提出 TRUSTFORK 基准,评测展示身份劫持多智能体编排权限
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出 SWE-Prometheus 基准,评测编码智能体对真实仓库的工程治理改进
SWE-Prometheus 评测编码智能体能否在没有给定缺陷的情况下,提高真实仓库的工程治理状态。
构建 ACE 语料,评测内核级证据对 Agent 攻击检测的有效性
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出 CAVEAT 基准,评测激励失配市场中计算机使用 Agent 的购买决策退化
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力