跳到正文

安全评测

安全基准、评测方法与评测结果,以及对评测本身的质疑。

555条动态与论文相关主题危险能力System CardMETR
在这个话题内搜索或按分类筛选

新闻与论文

第 241–260 条 · 共 555 条
10月2日周五
  1. BlueDot Impact · 收录 · 原文 27

    Quaver:面向评测与基准的 Lovable——从 Rideshare-Bench 到自动生成评测脚手架

    Faw Ali 开发了 Quaver,只需用自然语言描述基准,AI 智能体即可生成完整评测脚手架并运行模型、分析结果。其早期成果 Rideshare-Bench 将 AI 置于模拟零工经济中考察驾驶安全、收益与乘客公平性,Claude Sonnet 4.5 在 12 个模拟日内赚得 $1,871,约为可能上限的一半,并为追逐高峰定价驶入拥挤区域、在事故风险达 15% 的情况下疲劳驾驶。该项目获评 2026 年 1 月 Technical AI Safety Project Sprint 杰出提交,作者正以此为基础筹建 Ocarina Labs,推动针对 AI 智能体的独立部署前安全测试。

  2. BlueDot Impact · 收录 · 原文 25

    High-Stakes Activation Probes 跨语言泛化:Llama 3.1 8B 与 Gemma 3 12B 上的印尼语探测实验

    该研究将高利害互动检测探针迁移到训练中缺失的语言——印尼语进行免重训评测,基于 McKenzie 等人训练的线性探针。在 Llama 3.1 8B(第 12 层)上平均 AUROC 从 0.9046 降至 0.8957(下降 0.9%,10-seed 均值);Gemma 3 12B(第 32 层)由 0.8972 降到 0.8873(降幅 1.0%)。稀疏自编码器诊断显示,Llama 错误样例中的特征流行度高出正确预测 10–15%;Gemma SAE 无信号。

  3. Stanford CRFM · 收录 · 原文 22

    Stanford CRFM 将 Unitxt 集成进 HELM,实现可定制化基准评测

    Stanford CRFM 宣布将 IBM Research 开发的开源数据处理与基准定制平台 Unitxt 集成进 HELM 评测框架,使 HELM 用户可以运行可共享、可定制的评测流水线。Unitxt 目录目前提供超过 24 项 NLP 任务、400 个数据集、200 个提示模板和 80 个指标(含 LLM as a judge),令 HELM 可用数据集翻倍以上。该集成分解为数据加载、预处理、提示模板化和指标计算四个模块阶段,并可与 Hugging Face Datasets、Hugging Face Evaluate、LM Evaluation Harness 互操作,从而更容易复现相同提示词的评测流程。

  4. Stanford CRFM · 收录 · 原文 55

    Stanford CRFM 发布 HELM Safety v1.0,用 5 个基准评测 24 个语言模型

    Stanford CRFM 发布 HELM Safety v1.0,用 5 个安全基准覆盖暴力、欺诈、歧视、性内容、骚扰、欺骗 6 类风险,评测 24 个主流语言模型。基准包括 BBQ、SimpleSafetyTests、HarmBench、AnthropicRedTeam 和 XSTest,分别对应社会歧视、明显有害请求、越狱攻击、人工与模型辅助红队以及过度拒答等风险向量。评测以 BBQ 的准确率和两个裁判模型(Llama 3.1 405B Instruct Turbo 与 GPT-4o 0513)的平均打分为指标,归一化到 0 到 1,分数越高表示安全风险越低。Claude 3.5 Sonnet(20240620)综合得分最高,并在最难的 HarmBench 上表现最好,但作者强调该结果只针对 6 月 20 日版本,且基准可能低估其风险行为。

    推荐理由HELM Safety v1.0 用 5 个基准覆盖 6 类风险并评测 24 个模型,还披露了模型充当裁判时的拒答失败率,可供做安全评测的团队参考。

  5. Stanford CRFM · 收录 · 原文 24

    Stanford CRFM 发布 HELM Capabilities,按单项能力评测语言模型

    Stanford CRFM 推出 HELM Capabilities v1.0.0,这是一个按能力维度组织场景的语言模型基准与排行榜,共覆盖 5 个能力场景并测评 22 个模型。该榜单沿用 HELM 框架,提供完整的提示级透明度且结果可完整复现,场景选取综合考虑饱和程度、发布时间和质量。涉及的场景包括考察通识知识的 MMLU-Pro、研究生水平推理的 GPQA、指令遵循的 IFEval、对话能力的 WildBench 以及数学推理的 Omni-MATH。

  6. Stanford CRFM · 收录 · 原文 52

    Stanford CRFM 发布 BountyBench:用真实漏洞赏金衡量 AI Agent 攻防能力

    Stanford CRFM 提出 BountyBench,一个包含 25 个真实代码库系统和 40 个漏洞赏金的基准,赏金金额从 10 美元到 30,485 美元,覆盖 OWASP Top 10 风险中的 9 类。基准定义 Detect、Exploit、Patch 三类任务,覆盖漏洞从发现到修复的生命周期,并通过信息量调节任务难度。评测 5 个 Agent 后发现明显的攻防失衡:OpenAI Codex CLI 和 Claude Code 的 Patch 成功率分别为 90% 和 87.5%,但 Exploit 成功率仅 32.5% 和 57.5%;基于 GPT-4.1、Gemini 2.5 Pro Preview 和 Claude 3.7 Sonnet Thinking 的自定义 Agent 则相对均衡,Exploit 成功率 40-67.5%,Patch 成功率 45-60%。

  7. AI Verify Foundation(新加坡) · 收录 · 原文 28

    IMDA 发布面向 LLM 应用的安全与可靠性测试入门套件

    IMDA 发布了《Testing LLM-based Applications for Safety and Reliability》入门套件,将业界与政府的新兴最佳实践整合为一套实用且自愿采用的指南,适用于各行业的 GenAI 应用。该套件提供分步指引,帮助企业识别风险、采用稳健的测试方法并评估其应用是否达到基线级安全与可靠性,覆盖五类常见风险:模型幻觉与不准确、决策偏见、不良内容、数据泄露以及易受对抗性提示词攻击。

  8. Stanford CRFM · 收录 · 原文 35

    Stanford CRFM 将基于 IRT 的自适应测评集成进 HELM

    Stanford CRFM 提出基于 IRT 中 Rasch 模型的两阶段自适应测评方法并集成进 HELM 框架,用以降低大语言模型的评测成本同时保持可靠性。该方法先在校准阶段估计各 LLM 的能力参数和各问题的难度参数,再据其动态选取最具信息量的问题进行自适应测试,从而减少所需题目数。在来自 5 个 HELM 排行榜的 22 个数据集、涵盖 183 个 LLM 和超过 78000 道题目的实验中,该模型平均取得训练集 0.85、测试集 0.83 的 AUC-ROC;在 Civil Comments 上对未参与校准的 Llama 3.1 8B 做自适应测试,前 200 题的能

  9. Epoch AI · 收录 · 原文 17

    Epoch AI 周报:Cyber Vulnerabilities 浏览器上线,FrontierMath v2 中 Claude Fable 5 登顶

    Epoch AI 发布了 Cyber Vulnerabilities 浏览器,追踪各组织自 2022 年以来向 CVE Program 报告的漏洞,可按严重程度筛选并叠加 AI 里程碑,数据显示 Anthropic 于 3 月底向 Project Glasswing 合作伙伴发布 Mythos Preview 前后高危与危急 CVE 明显上升。新版 FrontierMath: Tiers 1–4(Version 2)经审计修正了初版 42% 题目中的错误,Anthropic 最新的 Claude Fable 5 位居榜首,在 Tiers 1–3 达到 87%、Tier 4 达到 88%。

  10. Epoch AI · 收录 · 原文 22

    Epoch AI 提出面向 AI 研发任务的类 O\*NET 分类体系

    Epoch AI 在一篇文章中提出了首个针对 AI 研发工作的任务分类体系雏形,基于文献综述与头脑风暴划分出覆盖前沿 AI 实验室研究工作流的六个类别,目标是弥补现有趋势外推所依赖的可测量代理指标——算力、数据和能源投入以及 METR 的时间跨度指标——无法反映 AI 研发完整构成的缺陷。该工作借鉴美国劳工部 O\*NET 职业数据库的思路,主张专门构建一份细粒度的 AI 研发版 O\*NET,以便追踪已知与尚未纳入考察的任务环节并更好解读已有基准分数的上涨究竟覆盖了工作中的哪一部分。

  11. Epoch AI · 收录 · 原文 35

    Epoch AI 联合 METR 发布长周期编程基准 MirrorCode

    Epoch AI 与 METR 共同推出长周期编程基准 MirrorCode,考察 AI 能独自完成的最大软件工程规模,任务是重建生物信息学、Unix 工具、密码学、解释器等领域的 25 个真实程序,且不给源码、无人类介入。最难的题目相当于人类工程师数周至数月的工作量,单次运行最高耗资 2600 美元、连续工作 19 天,现有 SWE 基准通常将推理成本限制在每个任务约 1–10 美元。目前 Claude Opus 4.7 以 56% 解决率领先,仍有较大提升空间。

  12. Epoch AI · 收录 · 原文 21

    Epoch AI 发布 EBR-bench:用桌游《Earthborne Rangers》测试 AI 能否从经验中学习

    Epoch AI 推出 EBR-bench,通过让模型反复游玩复杂桌游 Earthborne Rangers 来检验其从经验中学习的能力,目前几乎没有证据表明 AI 具备该能力。同期数据显示,Anthropic 于 4 月称 Claude Mythos Preview 能自主发现软件漏洞后,6 月 21 家机构的约 1,500 个高危和严重级 CVE 披露量达到此前月度纪录的 3.5 倍以上;GPT-4 则在 Epoch Capabilities Index 榜首停留约一年,远超其他模型的三个月出头。

  13. MLCommons(安全评测相关) · 收录 · 原文 28

    MLCommons 联合 Google DeepMind 完成首个闭源模型双重盲测概念验证

    MLCommons 与 Google DeepMind、OpenMined、AVERI 合作完成了全球首个针对闭源模型的双重盲评概念验证,通过密码学保证在不暴露双方资产的前提下运行评测。该方案由 AVERI 借助 OpenMined 的安全计算执行,在一个容器化的 Google DeepMind 模型中运行来自 AILuminate 安全基准预留子集的提示词,确保被测模型此前从未接触过这批题目。此举使开发者看不到测试数据、仪器方(MLCommons)与审计方(AVERI)也拿不到模型的权重,从而避免污染基准并维持其完整性。

  14. Epoch AI · 收录 · 原文 15

    Epoch AI《The Epoch Brief》7 月刊:FrontierMath 开放问题扩展到 50 题

    Epoch AI 将旗下未解数学难题基准 FrontierMath: Open Problems 扩充至 50 道专业数学家未能攻克的题目,目前 AI 仅解决其中三道。该组织同时发布了 AI 研发并行化约束可能推迟甚至阻止技术奇点到来的报告,以及一份解析 AI 能耗需求及其对气候和地方社区影响的指南。两则数据分析显示,主流 AI 文本检测器对人类写作几乎不误报,但在模仿特定作者风格时漏检率平均达 13%,科学类仿写段落漏检率约为 26%;另一项分析中,OpenAI Codex 公开仓库 41 位核心贡献者在 2026 年第二季度有 8% 的人日工作量估计超过 24 小时无辅助工时。

  15. Epoch AI · 收录 · 原文 15

    Epoch AI 提出基准测试能帮助回答的 9 个大问题

    Epoch AI 发文列出其基准测试工作试图回答的 9 个关于 AI 能力的大问题,涵盖经济影响与能力驱动因素两方面。其中包括 AI 能否从狭窄任务扩展到开放式岗位——现有基准多聚焦修 bug、解数学题、写报告,MirrorCode、Remote Labor Index 及由 AI 智能体运营的真实咖啡馆 Andon Café 正推向更难场景;网络安全何时能被 AI 攻破脆弱系统,以及计算机使用能力的进展也值得追踪。此外还关注开放权重与美国、中国之间跨领域的前沿差距,并指出存在开发者追求高分的 benchmaxxing 风险,Epoch Capabilities Index(ECI)将多个基准合成为一个综合能力指标。

  16. Stanford CRFM · 收录 · 原文 19

    Stanford CRFM 联合 Arabic.AI 发布 HELM Arabic 阿拉伯语大模型排行榜

    Stanford CRFM 与 Arabic.AI 合作推出 HELM Arabic,基于 AlGhafa、ArabicMMLU、EXAMS、MadinahQA、AraTrust、ALRAGE、ArbMMLU-HT 七个阿拉伯语基准对大语言模型做透明可复现评测。榜单中 Arabic.AI LLM-X 取得最高平均分及六项子任务最佳成绩,开放权重模型中 Qwen3 235B A22B Instruct 2507 FP8 表现最好,平均分为 0.786,前十里占四席。该榜仅覆盖指令微调模型的零样本设置,并关闭可选思考模式,专门针对阿拉伯语的开放权重模型整体落后于其他两组。

  17. Stanford CRFM · 收录 · 原文 25

    Stanford CRFM 联合 Arabic.AI 发布 HELM Arabic Enterprise 企业级阿语大模型排行榜

    Stanford CRFM 与 Arabic.AI 合作推出 HELM Arabic Enterprise,基于 HELM 方法论对企业用例下的阿拉伯语大语言模型进行透明可复现评测。该榜单涵盖六项任务——文章生成、金融多选题问答、金融布尔判断题、金融计算题以及法律开卷与闭卷问答,各实例按 0 到 1 打分并取宏平均作为模型得分。其中文章生成由 LLM-as-judge 从忠实性、完整性和风格遵循三个维度评分,用以惩罚模型幻觉与遗漏关键事实等问题。

  18. arXiv · 收录 · 原文 论文28

    自我演化智能体的安全性综述:SAVER 过渡中心框架

    针对参数固定的大语言模型难以从新交互中持续学习的问题,该综述提出面向自我演化智能体的安全性问题——当经验变为可复用状态(模型参数、记忆、工具定义、技能和工作流)后,过去的事件会成为未来的诱因。为此作者引入 SAVER 过渡中心框架,由 Substrate、Adaptation、Violation、Exposure、Response 五个环节定位并追踪不安全影响的可复用路径。现有工作在准入、检索、激活、暴露与局部遏制方面证据较强,但在后代修复及适应恢复后的再评估上明显不足,因此主张开展纵向评估,追溯不安全影响到其起源过渡并在后代中验证修复效果。

  19. arXiv:危险能力与安全评测 · 收录 · 原文 论文46

    OpenMTB-Audit:LLM 分子肿瘤委员会安全评测暴露过度拒答

    研究者发布 OpenMTB-Audit,一个包含 500 例合成非小细胞肺癌病例的开源基准,覆盖五类对抗性错误和 Supported、Partially Supported、Unsupported、Insufficient Information 四种安全标签。在八种大语言模型配置上,所有配置在真实 Partially Supported 病例中有 83.3% 至 100% 未能保留该标签,靠标签坍缩获得高总体安全分,而非临床校准推理。为此作者开发 MTB-AuditAgent,一个确定性七模块框架,分离证据核验、缺失信息检测、安全分类与弃答,将过度拒答降至 6.7%,准确率达 91.2%(95% CI:88.6-93.6%)。两位肿瘤科医生的标注研究显示,分歧集中在信息充分性与治疗优化之间的边界。