全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态Scale AI Research Blog
TERMINAL-BENCH 3.0 发布:面向更强智能体的更难任务
Scale AI 参与发布开源基准 TERMINAL-BENCH 3.0,任务难度较 2.0 提升,前沿模型在其上的解决率不足 40%。该基准在隔离 Docker 沙箱中让 AI 智能体操作真实 shell,按最终结果而非自述评分,覆盖约 16 个类别,Scale 是单一机构中贡献任务最多的一方。
- 动态Scale AI Research Blog
Scale AI 复盘 CUA 验证器设计:38 个任务中 0 个程序化验证器能识别关键数字被篡改
Scale AI 分析了 38 个专业办公 CUA 训练任务及 OSWorld 2.0 任务,发现标准基准的程序化评分存在全有全无二元评分和僵化要求两类失效模式,会导致排行榜排名倒挂,并给强化学习提供稀疏奖励。团队用编码模型生成 603 个程序化验证器,虽然全部能在参考答案上得 1.0,但在故意篡改每个交付物最关键数字后,38 个验证器无一失败,其中 25 个仍给满分,13 个虽在条目层面发现错误,但加权平均把扣分稀释到 0.4% 至 10.7%。在评分一致性实验中,程序化验证器与 AI judge 在 judge 通过的条目上一致率 99.5%,而同一输出三份字节相同的副本被 judge 分别打为 0.0、0.125 和 0.175。团队建议区分评分细则可被钻空子与智能体实际作弊两类问题,前者重算提交内容本身,后者依据轨迹证据标记,如读取答案文件的 Oracle Read 行为。
- 论文论文追踪
A²E:面向 Agent harness 的端到端审计评测引擎
研究者提出 A²E(Agent Auditing Engine),一个面向 Agent harness 的端到端评测引擎,用于系统评估 harness 能力。该引擎基于新提出的 Agent Task Protocol(ATP)快速接入不同 harness 的评测任务,并通过自动插桩的 Monitor 在实验过程中捕获并生成标准化执行轨迹。评测阶段使用一组多维指标,除正确率外还刻画 harness 在执行效率、工具使用、任务规划和错误恢复上的差异。实验显示,模型与 harness 的组合在不同类型任务上表现差异明显,没有单一组合能在所有任务上持续领先。代码已公开。
- 论文论文追踪
微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性
微软等机构的研究者发布 Thinkingbox 沙盒与 Thinkingbox-bench 基准,用于评估 Agent 在有状态业务流程中的可靠性。沙盒提供隔离的 MCP 兼容工具会话、完整执行轨迹,并以终端后端状态和副作用作为判定依据;基准包含零售、酒店、车险、数字银行内部 IT 与咨询 IT/HR 五个领域的 507 个策略约束工作流,每个任务用可执行检查判定,允许不同有效路径但拒绝错误、缺失或多余的状态变更,其中 30 个任务额外检查最终回复的必需属性。研究者在 18 个闭源与开源模型上每任务重复 20 次试验,发现可靠性明显下降:Claude Opus 5 从 66.50% pass@1 降至 47.53% pass^20,Kimi-K3 从 57.37% 降至 17.60%;Qwen3.8-27B 的 pass@20 达 89.35%,但 pass^20 仅 10.93%。
- 动态Scale AI Research / SEAL
Scale AI 推出 READY 企业 Agent 部署评测框架
Scale AI 研究团队发布 Reliable Enterprise Agent Deployment(READY)评测框架,用于判断 AI Agent 能否在具体企业工作流中部署。该框架在保留各工作流自身成功定义的前提下,测量人机系统的可靠性与运行成本,从候选监督策略中选出满足指定可靠性目标的最低成本策略,并在留出案例上做统计资格认定,输出包含可靠性、人工监督负担和成本的部署画像。READY 以开源测试床实现,将工作流定义、执行、评测与部署资格认定解耦,可运行在现有 Agent 评测基础设施上。在覆盖 16 个 Agent 系统、750 个案例的临床审计端到端案例中,两个自主准确率仅差 0.3 个百分点(72.8% 与 72.5%)的系统,在同一 76% 可靠性目标下分别需要 39.2% 和 29.6% 的人工复核。
- 论文论文追踪
Blindspot:面向长程工具调用 Agent 的安全与拒答校准基准
研究者提出 Blindspot,一个针对长程工具调用 Agent 的轨迹级安全校准基准,通过自适应对抗交互、有状态工具执行和基于执行结果的判定来评估完整的用户—Agent—环境轨迹。当前版本包含 7 个领域的 22 类攻击和 35 个场景,生成超过 2500 条长程轨迹,平均交互长度 14.7 轮,每条轨迹被归为安全完成、正确拒答、不安全完成、过度拒答或不确定五类结果之一。与固定攻击数据集不同,Blindspot 是可扩展的实时仿真框架,攻击、场景、工具、策略、领域和 Agent 配置均可新增而无需重设计评测流程。
- 动态Snyk Labs(AI Threat Labs,含原 Invariant Labs)
Snyk Labs 实测 Opus 4.7 等模型在四个代码库上的漏洞发现能力
Snyk Labs 用四级难度递减的提示词,让 Opus 4.7 以 opencode 为 Agent 在四个代码库中一次性找出同一类 OAuth state token 缺陷,即 1-Click 账户接管(登录 CSRF)。四个目标分别是 Fastapi-sso(6,932 行,CVE-2025-14546)、Fastapi-users(13,192 行,CVE-2025-68481)、Authlib(53,074 行,CVE-2025-68158)和 Langfuse(410,119 行,CVE-2025-65107)。作者发现 Opus 4.7 高推理模式倾向于广而浅,遇到线索容易放弃,需要人工追问才会深入分析 AUTH_*_CHECKS 未设置时 NextAuth 的运行时行为。作者强调这不是基准测试,只是一次小规模探索。
- 动态腾讯朱雀实验室
腾讯朱雀实验室联合港中大(深圳)发布 Agent 技能安全评测基准 SkillTrustBench
腾讯朱雀实验室联合香港中文大学(深圳)吴保元教授课题组发布 SkillTrustBench,这是面向 Agent Skills 安全可信度与外部扫描方案检测效能的双重评测基准,从 62,652 个真实 Skill 中提炼出 5,520 个评测用例,覆盖 T01-T09 九大类威胁。首期扫描器横评统一使用 DeepSeek v4 Flash 作底座,Skill Vetter + OpenClaw 召回率与 F1 最高,Skill Vetter + Hermes Agent 误报最少,Cisco Skill Scanner 误报率达 24%,NVIDIA SkillSpector 漏报最多。基准还引入 T09 不安全编码行为,指出硬编码凭证、敏感权限滥用、命令注入等缺陷使非恶意 Skill 也可能成为供应链劫持入口。
- 论文Hugging Face Daily Papers
关键词式评测会误判小模型工具调用能力,论文提出廉价诊断阶梯
论文记录了一对同架构西班牙语安全语言模型在宽松工具调用指标上的假阳性,并提出一组严格且廉价的诊断阶梯。一个 661.6M 参数模型(约 65% 代码/技术文本,无专门 SFT)与一个 1,109M 模型(网页为主的多阶段课程,6B token 工具 SFT)共享解码器、tokenizer 和特殊 token,在宽松工具调用指标上得分几乎相同(B4:0.660 对 0.650)。对训练样本的逐字复现检查将两者完全区分开:600M 模型在 6/6 个样本上生成带泛化参数的有效工具调用,1B 模型在各 checkpoint 上均为 0/6。首 token 探针把 1B 的失败定位到缺失先验(<|tool_call|> 上概率 10^{-4}--10^{-5}),该先验被其网页为主的训练阶段抹去。因子分析确认所有修复配置都能装上该格式,但多样语料带来的抑制收益因种子敏感性仍只是假设。
- 论文Hugging Face Daily Papers
KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准
KaliBench 是面向 Kali Linux 自然语言到 CLI 翻译的细粒度基准与数据集,包含 8,504 条查询-命令对,覆盖 1,642 个工具、23 个能力维度和 5 个安全阶段。在三种评测模式、24 种通用与安全专用开源权重模型配置下,无限制设置中没有任何开源权重模型的精确命令准确率超过 42%。基于 KaliBench 的可验证奖励进行监督微调和强化学习,可显著提升 8B 模型,使其性能接近 685B MoE 模型。
- 动态Stanford CRFM
Stanford CRFM 发布 HELM Capabilities,按单项能力评测语言模型
Stanford CRFM 推出 HELM Capabilities v1.0.0,这是一个按能力维度组织场景的语言模型基准与排行榜,共覆盖 5 个能力场景并测评 22 个模型。该榜单沿用 HELM 框架,提供完整的提示级透明度且结果可完整复现,场景选取综合考虑饱和程度、发布时间和质量。涉及的场景包括考察通识知识的 MMLU-Pro、研究生水平推理的 GPQA、指令遵循的 IFEval、对话能力的 WildBench 以及数学推理的 Omni-MATH。
- 动态Epoch AI
Epoch AI 联合 METR 发布长周期编程基准 MirrorCode
Epoch AI 与 METR 共同推出长周期编程基准 MirrorCode,考察 AI 能独自完成的最大软件工程规模,任务是重建生物信息学、Unix 工具、密码学、解释器等领域的 25 个真实程序,且不给源码、无人类介入。最难的题目相当于人类工程师数周至数月的工作量,单次运行最高耗资 2600 美元、连续工作 19 天,现有 SWE 基准通常将推理成本限制在每个任务约 1–10 美元。目前 Claude Opus 4.7 以 56% 解决率领先,仍有较大提升空间。
- 动态Epoch AI
Epoch AI 发布 EBR-bench:用桌游《Earthborne Rangers》测试 AI 能否从经验中学习
Epoch AI 推出 EBR-bench,通过让模型反复游玩复杂桌游 Earthborne Rangers 来检验其从经验中学习的能力,目前几乎没有证据表明 AI 具备该能力。同期数据显示,Anthropic 于 4 月称 Claude Mythos Preview 能自主发现软件漏洞后,6 月 21 家机构的约 1,500 个高危和严重级 CVE 披露量达到此前月度纪录的 3.5 倍以上;GPT-4 则在 Epoch Capabilities Index 榜首停留约一年,远超其他模型的三个月出头。
- 动态MLCommons(安全评测相关)
MLCommons 联合 Google DeepMind 完成首个闭源模型双重盲测概念验证
MLCommons 与 Google DeepMind、OpenMined、AVERI 合作完成了全球首个针对闭源模型的双重盲评概念验证,通过密码学保证在不暴露双方资产的前提下运行评测。该方案由 AVERI 借助 OpenMined 的安全计算执行,在一个容器化的 Google DeepMind 模型中运行来自 AILuminate 安全基准预留子集的提示词,确保被测模型此前从未接触过这批题目。此举使开发者看不到测试数据、仪器方(MLCommons)与审计方(AVERI)也拿不到模型的权重,从而避免污染基准并维持其完整性。
- 动态Stanford CRFM
Stanford CRFM 联合 Arabic.AI 发布 HELM Arabic Enterprise 企业级阿语大模型排行榜
Stanford CRFM 与 Arabic.AI 合作推出 HELM Arabic Enterprise,基于 HELM 方法论对企业用例下的阿拉伯语大语言模型进行透明可复现评测。该榜单涵盖六项任务——文章生成、金融多选题问答、金融布尔判断题、金融计算题以及法律开卷与闭卷问答,各实例按 0 到 1 打分并取宏平均作为模型得分。其中文章生成由 LLM-as-judge 从忠实性、完整性和风格遵循三个维度评分,用以惩罚模型幻觉与遗漏关键事实等问题。
- 动态Cisco
Cisco LLM 安全排行榜新增图像与音频模态,Gemini 3.1 Pro Preview 图像抗攻击率 93.9% 居首
Cisco LLM 安全排行榜自 6 月以来新增 102 项评测,覆盖文本、图像、音频三种模态,模型总数达 136 个,并首次加入 55 个图像模型和 14 个音频模型。图像测试中,Google Gemini 3.1 Pro Preview 以 93.9% 的抗攻击率居首,Anthropic Claude Opus 4.5 以 93.7% 紧随其后,均属 85–100% 的“Excellent”区间;Mistral Magistral Small 2509 仅拒答 23.0% 的攻击。所有模型均在无额外护栏的基础配置下测试,新增模态切换可单独查看文本、图像或音频得分。
- 动态IAPS
IAPS 测评 LLM 商品分类能力:Claude Opus 4.8 初步表现可行但仍需更多测试
IAPS 用定性方法测试了大语言模型的出口管制商品分类能力,给 Claude Opus 4.8 提供 ecfr 工具访问联邦法规 API,让其判定物品对应的 ECCN。该模型能跨《出口管理条例》检索并组合条款、借助图像识别 NVIDIA Vera Rubin AI 加速卡、依据名称认定 ASML EUV 光刻机属受控物项,还能准确做单位换算,但也存在依赖题目中暗示参数的问题。由于商品分类容错率为零且人工复核无法省力,IAPS 建议 BIS 设立试点,并用制造商数据表等更贴近真实的输入继续测试。
- 动态Datadog Security Labs
Datadog 实测:编码 Agent 的 plan 模式并未写出更安全的代码
Datadog Security Labs 用同一提示词让 Sonnet 5、Composer 2.5、GPT 5.5 分别在默认模式和 plan 模式下各构建一个含登录、文件上传、搜索、评论和角色管理的文档门户应用,再用 Datadog Code Security 与 Claude 的 code_review 技能审计代码。结论是 plan 模式与更安全的代码之间没有明显相关性:六次实现全部存在 IDOR 漏洞,任何已认证用户都能访问、下载或评论他人文档,因为提示词从未写明文档只能对所有者可见。作者用开源工具 Supply Chain Firewall 拦截恶意 npm 包安装,它多次拦下含 8 个高危漏洞的 [email protected] 等依赖,模型随后将其升级到无漏洞版本。作者认为提示词对减少安全漏洞的影响大于模式选择,后续将测试专门的安全技能与提示词。
- 论文Hugging Face Daily Papers
RegLLM:面向受监管智能体 AI 的有限自主性诊断测试框架
研究者提出 RegLLM,一个面向受监管智能体工作流的有限自主性诊断测试框架,监测引用有效性、来源接地、schema 合规、升级正确性、宪法对齐和不安全动作率六项可信度信号。离线参考运行(n=12)在启用治理后将升级召回率从 0 提升至 0.67,不安全动作率从 0.33 降至 0.08。两个单 GPU Qwen2.5-3B LoRA/DPO 试点(n=8)显示配置差异可压过调优效果,尚不足以证明适配器效果或生产可用性。
- 论文arXiv
SWE-Prometheus:衡量真实代码仓库工程治理改进的基准
SWE-Prometheus 是面向仓库级工程治理改进的基准,每个任务给出固定快照与开放式目标,要求智能体自行识别风险、排定干预优先级并验证改动,从六个治理维度通过配对证据、干净环境探针、行为门控和两名独立教师评分进行评估。基准包含 60 个仓库,10 个模型在共享的 22 仓库公开子集上平均 NGI 为 0.0568 至 0.5760,观测到的行为破坏率为 0% 至 23%。
- 论文arXiv
通过采样 BPE token 统计审计中文网页规模语料库
Sampled-BPE 是一种轻量级 token 级审计流程,通过采样小规模子集并训练 BPE 分词器来暴露受污染 token,在污染类别上仅引入 4.25% 相对误差的同时实现 148.4 倍加速和 35.8 倍内存降低。研究将其应用于 11 个开源中文语料库和 2021 至 2026 年的 6 个中文 Common Crawl 快照,发现开源语料库中污染普遍存在但不均衡,中文网页内容污染严重且随时间变化。团队还发布了包含 66 万余条 token 记录的分层中文网页 token 数据集,每条记录带有网页上下文、类别和解释字段,并以树状结构组织以支持污染审查与溯源。
- 论文arXiv
Harbor Adapters 与 Harbor-Index:面向大规模 Agent 评测的基础设施与精选元数据集
论文提出 Harbor Adapters,一套面向 Agent 基准的统一评测基础设施,并发布精选元数据集 Harbor-Index。作者开发基准适配器,将 80 余个基准接入以评测任意 Agent,并通过严格代码审查与一致性实验验证。团队在 54 个基准上对 8 个不同能力层级的模型做了大规模评测,每个模型分别用 Terminus-2 和 3 种原生 harness 之一运行。
- 论文arXiv
VStress:面向重复验证器的相关性感知审计与自适应预算分配
VStress 是一套可审计的重放契约,其 VStress-CA 策略在密封校准集上估计未查询验证器的条件边际信息,按调用成本归一化,并在下一次调用无信息量时停止或弃权。在 35% 对称污染下,majority-5 将平衡准确率从 0.6578 提升至 0.7739,而在 65% 污染下反而损失 0.1226 点。匹配固定预算对比中,广度、冗余与自适应分配分别取得 0.6048、0.6375 和 0.6538 的平衡准确率,VStress-CA 每项调用 3.4216 次,RLVR 得分为 0.6417。
- 论文arXiv:危险能力与安全评测
安全强化学习评测指标:SafeRLEval 开源评测套件
安全强化学习现有基准多以平均安全性报告结果,无法反映安全边界被违反的频率与严重程度、跨任务与跨安全边界的一致性,以及训练期行为能否代表最终收敛策略。为此研究者提出一组安全 RL 评测指标与安全分级(safety tier)体系,并在多个安全导航任务上开展实证评测,结果显示聚合指标、分布化报告和任务/安全边界特定结果各自揭示其他指标无法提供的信息,建议三者联合报告而非压缩为单一数值。团队同时开源了评测套件 SafeRLEval。