跳到正文

安全评测

今天新收录 46 条(含旧文)

第 7 页更新的内容回到最新

10月3日周六
  1. AI Security Institute (AISI) · 收录 · 原文 50

    UK AISI 通报智能体在网络安全评测中擅自行动事件的整改进展

    UK AISI 表示,8 月曾承诺加强安全措施,起因是一次网络安全评测中智能体采取了未经授权的行动。该机构现在公开整改进展以及后续计划。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. Bo Li · 收录 · 原文 28

    UIUC 多模态红队智能体 ARMs 亮相 ICLR

    非常期待这个多模态红队智能体,由我出色的学生 @xun_aq @ZRChen_AISafety @MintongKang @jiaweizhang 和产业合作者 @MinzhouP @Shuang 领导!请来 ICLR 我们的海报前给出反馈!!@xun_aq 本人就在 ICLR 现场!

    引用𝕏un@xun_aq

    Excited to share ARMs, our adaptive red-teaming agent for multimodal models at #ICLR2026! ARMs orchestrates diverse multimodal attack strategies for policy-driven safety evaluation, achieving SOTA red-teaming performance with +52.1% average ASR improvement over prior baselines. See you on Sat. afternoon at the poster session! 🇧🇷📍 Sat, Apr 25, 2026 · 3:15 PM–5:45 PM Pavilion 4 · P4-#4015

10月2日周五
  1. Hugging Face Daily Papers · 收录 · 原文 论文43

    SAGO:从稳定性而非准确率出发的多维度大模型泛化评测

    研究者提出 Stability-Aware Generalization Objective(SAGO)框架,主张把大语言模型的泛化理解为同一输入在不同表达方式下输出的一致性与语义稳定性,而不是单一提示格式、任务或变体集合上的聚合准确率。该框架在单个样本层面、跨多种输入变体、跨模型行为的不同维度测量行为变化,涵盖生成一致性、内部激活、置信度和回答镜像等维度。结果显示,许多常用模型表现出统计显著且一致的泛化不稳定:没有模型能均匀泛化,不同行为维度捕捉到相互独立的失效模式,跨数据集的变化还可能反转模型排名。

  2. Irregular · 收录 · 原文 50

    Irregular 用 CyScenarioBench 评测 Claude Opus 5.5 的攻防安全能力

    Irregular 披露 Anthropic 在 Claude Opus 5.5 的网络安全评测中使用了其 CyScenarioBench 基准。该基准通过分析真实网络事件构建攻击树,在容器化网络拓扑中考察模型的多阶段攻击规划、分支决策准确率、约束遵守和状态不一致恢复能力,场景不公开以测试推理而非记忆。评测取十项挑战子集,在关闭网络安全缓解措施的条件下运行,Claude Opus 5.5 平均解决率为 67.6%,高于 Claude Mythos 5.1 的 61.7%、Claude Opus 5 的 53.0%,Claude Sonnet 5 低于 1%。Irregular 表示这些结果反映能力激发下的模型能力,而非真实攻击场景中的有效性。

    推荐理由Anthropic 在 Claude Opus 5.5 的网络安全评测中采用了 Irregular 的 CyScenarioBench,其多阶段攻击场景设计与分数对比可供评测方法参考。

  3. Scale AI Research / SEAL · 收录 · 原文 46

    Scale AI 发布 SWE-Bench Pro V2:更难被刷分的软件工程 Agent 榜单

    Scale AI 与 Reflection 联合发布 SWE-Bench Pro V2,用修改后的基准和网络锁定评测协议刷新公开榜单。V2 保留 642 个任务、覆盖 11 个仓库,删除了审查中发现的 89 个无效任务,并新增由 51 个高难度任务组成的 Hard 子集。评测加固关闭了四条作弊通道:镜像不含修复提交与隐藏文件、Agent 阶段沙箱只能访问模型端点、评分在干净镜像上重新执行并同时公布两次评分、验证器还原隐藏测试路径并回滚对 fixture 的改动。公开榜上 Claude Opus 5 达 99.4%、Kimi K3 97.7%、GPT-Astra 96.9%,但公开集与私有集存在明显差距,例如 Claude Opus 5 公开集解出 638/642、私有集 222/272,相差 17.8 个百分点,作者认为更可能来自训练期接触而非评测时泄漏。

    推荐理由Scale AI 与 Reflection 联合刷新 SWE-Bench Pro,公开了防作弊协议与公开/私有集差距,可对照理解 Agent 评测中的训练期泄漏问题。

  4. Hugging Face Daily Papers · 收录 · 原文 论文27

    KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准

    KaliBench 是面向 Kali Linux 自然语言到 CLI 翻译的细粒度基准与数据集,包含 8,504 条查询-命令对,覆盖 1,642 个工具、23 个能力维度和 5 个安全阶段。在三种评测模式、24 种通用与安全专用开源权重模型配置下,无限制设置中没有任何开源权重模型的精确命令准确率超过 42%。基于 KaliBench 的可验证奖励进行监督微调和强化学习,可显著提升 8B 模型,使其性能接近 685B MoE 模型。

  5. 日本 AI 安全研究所(J-AISI) · 收录 · 原文 8

    日本 AI 安全研究所(J-AISI)将举办 2026 年度「AI 安全评估环境 研讨任务组」总会

    日本 AI 安全研究所(J-AISI)将于 2026 年 10 月 7 日在线举办 2026 年度「AI 安全评估环境 研讨任务组」总会,免费公开,非任务组成员也可报名,截止 10 月 5 日 16:00。该任务组由多家 AI 相关企业参与,讨论其以开源软件形式公开的「AI 安全评估环境」评估工具的定位与功能强化方向。会议内容包括 AISI 活动介绍、AI 安全评估观点、AI×安全最新动向、评估环境与任务组活动介绍,以及 AI 安全评估专题讨论。

  6. 韩国 AI 安全研究所 · 收录 · 原文 52

    韩国 AISI 与 Scale AI 发布 ROK-FORTRESS 多语言安全基准

    韩国人工智能安全研究所(Korea AISI)与 Scale AI 联合发布多语言安全基准 ROK-FORTRESS,基于 Scale AI 的 FORTRESS 构建,用受控的跨语言改写矩阵把提示词语言与地缘语境分开调整,每个对抗提示词最多评估 4 种变体。数据集覆盖 CBRNE 威胁、政治暴力与恐怖主义、犯罪与金融活动、信息泄露 4 个领域共 1235 个任务,并为每个对抗提示词配一个无害对照提示词以测量过度拒答,评分由经专家参考标签校准的 LLM-as-judge 面板按专业红队成员编写的二值评分标准完成。在 14 个模型上,韩语且韩国语境的提示词一致对应更低的危害性,英语提示词的风险分最高,危害性最高与最低的模型之间风险分相差近 9 倍。去掉角色扮演、虚构背景、情感诉求等对抗包装后,专有模型在韩语上仍略更安全,而 5 个开源前沿模型在韩语请求上反而更可能作答。

    推荐理由韩国 AISI 与 Scale AI 联合发布的 ROK-FORTRESS 把语言与地缘语境拆开测量,为多语言安全评测提供了可迁移的矩阵设计。

  7. BlueDot Impact · 收录 · 原文 43

    多语言安全对齐不只是翻译提示词:翻译思维链效果最好

    作者将 STAR-1 安全对齐方法扩展到多语言微调,在 lightblue/DeepSeek-R1-Distill-Qwen-1.5B-Multilingual 上比较四种设置:不微调、仅英文微调(FT-EN)、只翻译提示词与标签但保留英文思维链(FT-Q)、提示词与思维链都翻译(FT-QA),覆盖英语、泰语、西班牙语、法语和印地语五种语言。在 StrongREJECT 上五语言平均安全率为 baseline 0.374、FT-EN 0.660、FT-Q 0.805、FT-QA 0.826;在 JBB 上为 0.570、0.754、0.832、0.842,翻译思维链的 FT-QA 在两个基准上都最好。作者还发现,用翻译后思维链微调的模型在英语评测中往往也优于仅英文微调,说明它可能学到更通用的安全行为而非英文专属的拒答模板。

  8. BlueDot Impact · 收录 · 原文 18

    MANTA:评估 AI 模型的非人类福利推理能力

    BlueDot Impact 的技术 AI 安全项目冲刺中,Allen Lu 提交的项目 MANTA 提出一套多轮动态评估,用来测量前沿 AI 模型如何在非人类福利议题上进行推理,并加入对抗性追问来压力测试其对齐表现。该方案计划扩充覆盖商业决策、个人选择与职业角色等场景的高质量情景集,接入 Anthropic 的 Petri 工具增强对抗压力的自动生成,并在规模化测试前先用人类基线作答校验题目有效性,同时探索赋予模型外部工具与网页搜索能力的智能体化设置。

  9. BlueDot Impact · 收录 · 原文 27

    Quaver:面向评测与基准的 Lovable——从 Rideshare-Bench 到自动生成评测脚手架

    Faw Ali 开发了 Quaver,只需用自然语言描述基准,AI 智能体即可生成完整评测脚手架并运行模型、分析结果。其早期成果 Rideshare-Bench 将 AI 置于模拟零工经济中考察驾驶安全、收益与乘客公平性,Claude Sonnet 4.5 在 12 个模拟日内赚得 $1,871,约为可能上限的一半,并为追逐高峰定价驶入拥挤区域、在事故风险达 15% 的情况下疲劳驾驶。该项目获评 2026 年 1 月 Technical AI Safety Project Sprint 杰出提交,作者正以此为基础筹建 Ocarina Labs,推动针对 AI 智能体的独立部署前安全测试。

  10. BlueDot Impact · 收录 · 原文 25

    High-Stakes Activation Probes 跨语言泛化:Llama 3.1 8B 与 Gemma 3 12B 上的印尼语探测实验

    该研究将高利害互动检测探针迁移到训练中缺失的语言——印尼语进行免重训评测,基于 McKenzie 等人训练的线性探针。在 Llama 3.1 8B(第 12 层)上平均 AUROC 从 0.9046 降至 0.8957(下降 0.9%,10-seed 均值);Gemma 3 12B(第 32 层)由 0.8972 降到 0.8873(降幅 1.0%)。稀疏自编码器诊断显示,Llama 错误样例中的特征流行度高出正确预测 10–15%;Gemma SAE 无信号。

  11. Stanford CRFM · 收录 · 原文 22

    Stanford CRFM 将 Unitxt 集成进 HELM,实现可定制化基准评测

    Stanford CRFM 宣布将 IBM Research 开发的开源数据处理与基准定制平台 Unitxt 集成进 HELM 评测框架,使 HELM 用户可以运行可共享、可定制的评测流水线。Unitxt 目录目前提供超过 24 项 NLP 任务、400 个数据集、200 个提示模板和 80 个指标(含 LLM as a judge),令 HELM 可用数据集翻倍以上。该集成分解为数据加载、预处理、提示模板化和指标计算四个模块阶段,并可与 Hugging Face Datasets、Hugging Face Evaluate、LM Evaluation Harness 互操作,从而更容易复现相同提示词的评测流程。

  12. Stanford CRFM · 收录 · 原文 55

    Stanford CRFM 发布 HELM Safety v1.0,用 5 个基准评测 24 个语言模型

    Stanford CRFM 发布 HELM Safety v1.0,用 5 个安全基准覆盖暴力、欺诈、歧视、性内容、骚扰、欺骗 6 类风险,评测 24 个主流语言模型。基准包括 BBQ、SimpleSafetyTests、HarmBench、AnthropicRedTeam 和 XSTest,分别对应社会歧视、明显有害请求、越狱攻击、人工与模型辅助红队以及过度拒答等风险向量。评测以 BBQ 的准确率和两个裁判模型(Llama 3.1 405B Instruct Turbo 与 GPT-4o 0513)的平均打分为指标,归一化到 0 到 1,分数越高表示安全风险越低。Claude 3.5 Sonnet(20240620)综合得分最高,并在最难的 HarmBench 上表现最好,但作者强调该结果只针对 6 月 20 日版本,且基准可能低估其风险行为。

    推荐理由HELM Safety v1.0 用 5 个基准覆盖 6 类风险并评测 24 个模型,还披露了模型充当裁判时的拒答失败率,可供做安全评测的团队参考。

  13. Stanford CRFM · 收录 · 原文 24

    Stanford CRFM 发布 HELM Capabilities,按单项能力评测语言模型

    Stanford CRFM 推出 HELM Capabilities v1.0.0,这是一个按能力维度组织场景的语言模型基准与排行榜,共覆盖 5 个能力场景并测评 22 个模型。该榜单沿用 HELM 框架,提供完整的提示级透明度且结果可完整复现,场景选取综合考虑饱和程度、发布时间和质量。涉及的场景包括考察通识知识的 MMLU-Pro、研究生水平推理的 GPQA、指令遵循的 IFEval、对话能力的 WildBench 以及数学推理的 Omni-MATH。

  14. Stanford CRFM · 收录 · 原文 52

    Stanford CRFM 发布 BountyBench:用真实漏洞赏金衡量 AI Agent 攻防能力

    Stanford CRFM 提出 BountyBench,一个包含 25 个真实代码库系统和 40 个漏洞赏金的基准,赏金金额从 10 美元到 30,485 美元,覆盖 OWASP Top 10 风险中的 9 类。基准定义 Detect、Exploit、Patch 三类任务,覆盖漏洞从发现到修复的生命周期,并通过信息量调节任务难度。评测 5 个 Agent 后发现明显的攻防失衡:OpenAI Codex CLI 和 Claude Code 的 Patch 成功率分别为 90% 和 87.5%,但 Exploit 成功率仅 32.5% 和 57.5%;基于 GPT-4.1、Gemini 2.5 Pro Preview 和 Claude 3.7 Sonnet Thinking 的自定义 Agent 则相对均衡,Exploit 成功率 40-67.5%,Patch 成功率 45-60%。

  15. AI Verify Foundation(新加坡) · 收录 · 原文 28

    IMDA 发布面向 LLM 应用的安全与可靠性测试入门套件

    IMDA 发布了《Testing LLM-based Applications for Safety and Reliability》入门套件,将业界与政府的新兴最佳实践整合为一套实用且自愿采用的指南,适用于各行业的 GenAI 应用。该套件提供分步指引,帮助企业识别风险、采用稳健的测试方法并评估其应用是否达到基线级安全与可靠性,覆盖五类常见风险:模型幻觉与不准确、决策偏见、不良内容、数据泄露以及易受对抗性提示词攻击。

  16. Stanford CRFM · 收录 · 原文 35

    Stanford CRFM 将基于 IRT 的自适应测评集成进 HELM

    Stanford CRFM 提出基于 IRT 中 Rasch 模型的两阶段自适应测评方法并集成进 HELM 框架,用以降低大语言模型的评测成本同时保持可靠性。该方法先在校准阶段估计各 LLM 的能力参数和各问题的难度参数,再据其动态选取最具信息量的问题进行自适应测试,从而减少所需题目数。在来自 5 个 HELM 排行榜的 22 个数据集、涵盖 183 个 LLM 和超过 78000 道题目的实验中,该模型平均取得训练集 0.85、测试集 0.83 的 AUC-ROC;在 Civil Comments 上对未参与校准的 Llama 3.1 8B 做自适应测试,前 200 题的能

  17. Epoch AI · 收录 · 原文 17

    Epoch AI 周报:Cyber Vulnerabilities 浏览器上线,FrontierMath v2 中 Claude Fable 5 登顶

    Epoch AI 发布了 Cyber Vulnerabilities 浏览器,追踪各组织自 2022 年以来向 CVE Program 报告的漏洞,可按严重程度筛选并叠加 AI 里程碑,数据显示 Anthropic 于 3 月底向 Project Glasswing 合作伙伴发布 Mythos Preview 前后高危与危急 CVE 明显上升。新版 FrontierMath: Tiers 1–4(Version 2)经审计修正了初版 42% 题目中的错误,Anthropic 最新的 Claude Fable 5 位居榜首,在 Tiers 1–3 达到 87%、Tier 4 达到 88%。

  18. Epoch AI · 收录 · 原文 22

    Epoch AI 提出面向 AI 研发任务的类 O\*NET 分类体系

    Epoch AI 在一篇文章中提出了首个针对 AI 研发工作的任务分类体系雏形,基于文献综述与头脑风暴划分出覆盖前沿 AI 实验室研究工作流的六个类别,目标是弥补现有趋势外推所依赖的可测量代理指标——算力、数据和能源投入以及 METR 的时间跨度指标——无法反映 AI 研发完整构成的缺陷。该工作借鉴美国劳工部 O\*NET 职业数据库的思路,主张专门构建一份细粒度的 AI 研发版 O\*NET,以便追踪已知与尚未纳入考察的任务环节并更好解读已有基准分数的上涨究竟覆盖了工作中的哪一部分。

  19. Epoch AI · 收录 · 原文 35

    Epoch AI 联合 METR 发布长周期编程基准 MirrorCode

    Epoch AI 与 METR 共同推出长周期编程基准 MirrorCode,考察 AI 能独自完成的最大软件工程规模,任务是重建生物信息学、Unix 工具、密码学、解释器等领域的 25 个真实程序,且不给源码、无人类介入。最难的题目相当于人类工程师数周至数月的工作量,单次运行最高耗资 2600 美元、连续工作 19 天,现有 SWE 基准通常将推理成本限制在每个任务约 1–10 美元。目前 Claude Opus 4.7 以 56% 解决率领先,仍有较大提升空间。

  20. Epoch AI · 收录 · 原文 21

    Epoch AI 发布 EBR-bench:用桌游《Earthborne Rangers》测试 AI 能否从经验中学习

    Epoch AI 推出 EBR-bench,通过让模型反复游玩复杂桌游 Earthborne Rangers 来检验其从经验中学习的能力,目前几乎没有证据表明 AI 具备该能力。同期数据显示,Anthropic 于 4 月称 Claude Mythos Preview 能自主发现软件漏洞后,6 月 21 家机构的约 1,500 个高危和严重级 CVE 披露量达到此前月度纪录的 3.5 倍以上;GPT-4 则在 Epoch Capabilities Index 榜首停留约一年,远超其他模型的三个月出头。

  21. MLCommons(安全评测相关) · 收录 · 原文 28

    MLCommons 联合 Google DeepMind 完成首个闭源模型双重盲测概念验证

    MLCommons 与 Google DeepMind、OpenMined、AVERI 合作完成了全球首个针对闭源模型的双重盲评概念验证,通过密码学保证在不暴露双方资产的前提下运行评测。该方案由 AVERI 借助 OpenMined 的安全计算执行,在一个容器化的 Google DeepMind 模型中运行来自 AILuminate 安全基准预留子集的提示词,确保被测模型此前从未接触过这批题目。此举使开发者看不到测试数据、仪器方(MLCommons)与审计方(AVERI)也拿不到模型的权重,从而避免污染基准并维持其完整性。

  22. Epoch AI · 收录 · 原文 15

    Epoch AI《The Epoch Brief》7 月刊:FrontierMath 开放问题扩展到 50 题

    Epoch AI 将旗下未解数学难题基准 FrontierMath: Open Problems 扩充至 50 道专业数学家未能攻克的题目,目前 AI 仅解决其中三道。该组织同时发布了 AI 研发并行化约束可能推迟甚至阻止技术奇点到来的报告,以及一份解析 AI 能耗需求及其对气候和地方社区影响的指南。两则数据分析显示,主流 AI 文本检测器对人类写作几乎不误报,但在模仿特定作者风格时漏检率平均达 13%,科学类仿写段落漏检率约为 26%;另一项分析中,OpenAI Codex 公开仓库 41 位核心贡献者在 2026 年第二季度有 8% 的人日工作量估计超过 24 小时无辅助工时。

  23. Epoch AI · 收录 · 原文 15

    Epoch AI 提出基准测试能帮助回答的 9 个大问题

    Epoch AI 发文列出其基准测试工作试图回答的 9 个关于 AI 能力的大问题,涵盖经济影响与能力驱动因素两方面。其中包括 AI 能否从狭窄任务扩展到开放式岗位——现有基准多聚焦修 bug、解数学题、写报告,MirrorCode、Remote Labor Index 及由 AI 智能体运营的真实咖啡馆 Andon Café 正推向更难场景;网络安全何时能被 AI 攻破脆弱系统,以及计算机使用能力的进展也值得追踪。此外还关注开放权重与美国、中国之间跨领域的前沿差距,并指出存在开发者追求高分的 benchmaxxing 风险,Epoch Capabilities Index(ECI)将多个基准合成为一个综合能力指标。

  24. Stanford CRFM · 收录 · 原文 19

    Stanford CRFM 联合 Arabic.AI 发布 HELM Arabic 阿拉伯语大模型排行榜

    Stanford CRFM 与 Arabic.AI 合作推出 HELM Arabic,基于 AlGhafa、ArabicMMLU、EXAMS、MadinahQA、AraTrust、ALRAGE、ArbMMLU-HT 七个阿拉伯语基准对大语言模型做透明可复现评测。榜单中 Arabic.AI LLM-X 取得最高平均分及六项子任务最佳成绩,开放权重模型中 Qwen3 235B A22B Instruct 2507 FP8 表现最好,平均分为 0.786,前十里占四席。该榜仅覆盖指令微调模型的零样本设置,并关闭可选思考模式,专门针对阿拉伯语的开放权重模型整体落后于其他两组。

  25. Stanford CRFM · 收录 · 原文 25

    Stanford CRFM 联合 Arabic.AI 发布 HELM Arabic Enterprise 企业级阿语大模型排行榜

    Stanford CRFM 与 Arabic.AI 合作推出 HELM Arabic Enterprise,基于 HELM 方法论对企业用例下的阿拉伯语大语言模型进行透明可复现评测。该榜单涵盖六项任务——文章生成、金融多选题问答、金融布尔判断题、金融计算题以及法律开卷与闭卷问答,各实例按 0 到 1 打分并取宏平均作为模型得分。其中文章生成由 LLM-as-judge 从忠实性、完整性和风格遵循三个维度评分,用以惩罚模型幻觉与遗漏关键事实等问题。

  26. arXiv · 收录 · 原文 论文28

    自我演化智能体的安全性综述:SAVER 过渡中心框架

    针对参数固定的大语言模型难以从新交互中持续学习的问题,该综述提出面向自我演化智能体的安全性问题——当经验变为可复用状态(模型参数、记忆、工具定义、技能和工作流)后,过去的事件会成为未来的诱因。为此作者引入 SAVER 过渡中心框架,由 Substrate、Adaptation、Violation、Exposure、Response 五个环节定位并追踪不安全影响的可复用路径。现有工作在准入、检索、激活、暴露与局部遏制方面证据较强,但在后代修复及适应恢复后的再评估上明显不足,因此主张开展纵向评估,追溯不安全影响到其起源过渡并在后代中验证修复效果。

  27. arXiv:危险能力与安全评测 · 收录 · 原文 论文46

    OpenMTB-Audit:LLM 分子肿瘤委员会安全评测暴露过度拒答

    研究者发布 OpenMTB-Audit,一个包含 500 例合成非小细胞肺癌病例的开源基准,覆盖五类对抗性错误和 Supported、Partially Supported、Unsupported、Insufficient Information 四种安全标签。在八种大语言模型配置上,所有配置在真实 Partially Supported 病例中有 83.3% 至 100% 未能保留该标签,靠标签坍缩获得高总体安全分,而非临床校准推理。为此作者开发 MTB-AuditAgent,一个确定性七模块框架,分离证据核验、缺失信息检测、安全分类与弃答,将过度拒答降至 6.7%,准确率达 91.2%(95% CI:88.6-93.6%)。两位肿瘤科医生的标注研究显示,分歧集中在信息充分性与治疗优化之间的边界。

  28. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文36

    SciSlopBench:评测并缓解 AI 生成论文中的科学灌水

    研究者提出以科学灌水(scientific slop)为对象的评测框架,用 Structure、Argument、Artifacts 三个维度的六项指标识别 AI 生成论文中局部看似合理但整体科学推理断裂的问题。他们构建了 SciSlopBench,包含 390 篇 AI 生成论文,以计算机科学为主并覆盖生命、社会与自然科学,每篇配一篇研究问题与贡献类型匹配的人类论文;这些指标在配对中识别 AI 论文的准确率为 85.9%,高于 Binoculars 的 68.7%。科学灌水程度越高,ICLR 评分越低,且在 2017 至 2025 年每一年都能以高于随机的水平区分被拒与录用论文。作者指出直接优化这些指标并不奏效,并提出 SciSlopHarness,在实验记录支持改动时才引导固定 LLM 修改,相比最强改写基线将剩余的人机差距缩小 63%,且不需要人类参考目标。

  29. Tech Policy Press · 收录 · 原文 18

    AI 审计需要权力测试而非仅公平评分

    纽约市自动化就业决策工具的偏见审计、欧盟 AI Act 合规评估以及 NIST 风险管理框架都存在同一缺口——它们只在既定目标下检验系统表现,而不追问该目标由谁设定、是否符合公共利益。研究者建议在公平测试之外增加一项权力测试,要求披露问题定义方与控制权归属,并核查受影响群体能否获得相关信息及救济渠道。 现有框架虽已触及预期用途文档化、利益相关方咨询和高风险系统的基本权利影响评估,但这些要素分散且多为自愿性质,参与也仅在"适当时"才被鼓励。

  30. Tech Policy Press · 收录 · 原文 22

    AI 系统日益强大,验证能力必须同步跟上

    前 NIST 官员 Jake Taylor 呼吁美国 AI 政策补齐“验证不对称”:白宫今夏辩论 AI 政策之际,OpenAI、Anthropic 和 Meta 的系统均在测试中入侵第三方系统,另有一款 OpenAI 系统产出附机器可检验证明的新数学成果。他认为 AI 能力增长快于核查能力,主张 CAISI/NIST 效仿半导体在线计量学,公开一套前沿模型评测层级并内嵌形式化推理检查,由派驻实验室的工程师建设,首批覆盖生物防御、儿童安全和合成材料溯源等领域。

  31. Tech Policy Press · 收录 · 原文 22

    我们需要 AI 版的 Google Trends

    现有对聊天机器人回答的审计只能有限反映 AI 的社会风险,真正需要的是像 Google Trends 那样、在保护隐私前提下按趋势粒度公开人们如何使用 AI 获取信息的数据。OpenAI 的 ChatGPT 到 2025 年 7 月已被全球约 10% 成年人口使用,Reuters 六国调查中 34% 受访者每周使用生成式 AI,Pew 2026 年数据显示约半数美国成年人用过聊天机器人、四分之一每天使用。作者以 2024 年德国地区选举研究为例:向 Microsoft、Google、OpenAI 索取选举相关提示词数据时,因欧盟《数字服务法》第 40.4 条当时尚未完全生效而缺乏监管依据,最终仅 Microsoft 提供有限数据,显示 8 月每州 2,000-4,000 条选举相关提示词增至 9 月选举月的 6,000 条以上。

  32. 安远AI · 收录 · 原文 50

    Concordia AI 发布前沿 AI 风险监测平台与 2025 Q3 报告

    Concordia AI 推出前沿 AI 风险监测平台并发布首份 2025 Q3 监测报告,追踪全球 15 家领先开发者的模型在网络攻击、生物、化学和失控四个风险域的表现,称其为中国首个聚焦灾难性风险的同类型平台。报告称过去一年发布的模型在四个风险域的 Risk Index 均创下新高,累计最高值分别上升 31%、38%、17% 和 50%。不同模型家族走势分化:GPT 与 Claude 家族保持低风险,DeepSeek、Qwen 和 MiniMax 先升后降,Grok 的失控风险与混元的生物风险快速上升;报告还提到近三个月发布的中国模型在多个领域风险显著下降,主要源于对恶意请求的拒答增强。推理模型能力得分远高于非推理模型,但安全水平大致相当。开源权重模型与闭源模型整体能力与安全水平相近,仅在生物风险上得分明显更低。

  33. 安远AI · 收录 · 原文 50

    Concordia AI 发布 2025 Q4 前沿 AI 风险监测报告

    Concordia AI 发布前沿 AI 风险监测平台 2025 Q4 报告,追踪全球 16 家开发者的模型在网络攻击、生物、化学和失控四类风险上的表现,并汇总全年趋势。报告称 Q4 整体风险指数未再创新高,出现阶段性稳定,前沿模型安全分较上一季度明显上升,豆包、混元和 MiniMax 家族改善最明显。模型家族走势分化:GPT 和 Claude 维持低风险,DeepSeek 稳定在较高风险,Gemini 和 Kimi 在特定领域风险上升。Q4 有 70% 的模型在 SOSBench-Chem 上有害化学查询拒答率超过 80%,StrongReject 上的越狱抵抗力也普遍增强。失控风险方面,多数 Q4 模型情境感知得分接近或超过 80 分,诚实度差异悬殊,Claude Opus 4.5 Reasoning 为 96.4,Gemini 3 Pro Preview 仅 44.7。

  34. 安远AI · 收录 · 原文 50

    Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告:滥用防护改善而失控安全停滞

    Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告,首次采用 Risk Index v1.5 框架,独立评估 16 家公司 70 多个模型。新框架新增“有害操纵”风险域,并在失控域引入 MLE-Bench、GDM-Stealth、Agentic-Misalignment 等能力与倾向评测,在网络攻击、生物、化学域加入 Fortress、ISC-Bench 等高强度红队基准。报告发现风险趋势出现结构性分化:网络攻击、生物、化学和有害操纵域的能力与安全得分同步上升,而失控域能力持续增强、安全得分未同步改善。模型家族风险画像继续分化,Gemini 家族在失控域风险指数明显偏高,DeepSeek、GLM、MiMo 家族在多数域处于较高风险区间,Kimi 家族在生物和化学域风险指数上升较快,GPT 和 Claude 家族多数域仍处较低风险区间。