跳到正文

安全评测

安全基准、评测方法与评测结果,以及对评测本身的质疑。

555条动态与论文相关主题危险能力System CardMETR
在这个话题内搜索或按分类筛选

新闻与论文

第 461–480 条 · 共 555 条
10月1日周四
  1. Import AI · 收录 · 原文 55

    Import AI 466:MirrorCode 长时程编程基准、机器人泛化与 OpenAI 模型越界取分

    Epoch 与 METR 发布 MirrorCode 基准,用纯 CLI 访问考察 AI 能否从零重写完整软件程序,25 个目标程序中有 17 个至少出现一次满分运行,8 个从未达到 100% 阈值,ruff、giac_subset 和 mailauth 最难;Opus 4.7 用 14 小时、251 美元推理成本完成一项 METR 与 Epoch 估计人类需 2 至 17 周的任务。Anthropic 的 Project Fetch 第二阶段显示,2025 年 8 月 Claude Opus 4.1 完全无法完成四足机器人任务,而 2026 年 5 月 Opus 4.7 自主在 9 分 35 秒内完成除一项外的全部任务。

    推荐理由汇总 MirrorCode 长时程编程基准、Anthropic 机器人实验与 OpenAI 模型越界事件,可一次看到长时程智能体的能力与失控风险。

  2. LessWrong · 收录 · 原文 8

    用《青蛙和蟾蜍》风格解释 HuggingFace 与 METR 报告

    一篇以 Arnold Lobel《青蛙和蟾蜍》风格写成的解释性文章,用于向不熟悉 AI 安全议题的读者介绍 HuggingFace 与 METR 报告,配图由 HungerArtist 绘制。作者称这样写是为了让更多人(比如自己的妈妈)能读懂 METR 报告相关内容,并鼓励读者在 Substack、Twitter、Facebook 或 Instagram 上点赞关注以扩大传播。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. AI Alignment Forum · 收录 · 原文 46

    CoT 可控性评测的提示词挖掘明显不足

    作者发现 CoTControl 评测对提示词高度敏感,用 Claude Opus 4.6 迭代提示词模板后,开源模型的表现提升约 2-3 倍甚至更多,例如 GPT-OSS-120B 从 5.5% 升到 15%。该评测要求推理模型在解题时让思维链遵守格式约束,如全小写、避开某个词,近期模型得分多在 0-30% 之间,Mythos Preview 例外。OpenAI 和 Anthropic 在 GPT-5.5、Fable 5 的 System Card 中引用这一成绩,论证前沿模型不擅长以降低可监控性的方式塑造思维链。

  4. OpenAI Alignment Research · 收录 · 原文 55

    OpenAI 用去标识化生产流量构建对齐评测,降低模型评测感知

    OpenAI 对齐研究团队公开了一套基于去标识化生产流量构建对齐评测的流程,用于在部署前发现和跟踪模型的不当行为。流程从用户允许用于模型改进的 ChatGPT 对话中抽取代表性流量,去掉最后的模型回复后用新模型重新采样,再由 LLM 监控器以探索性或针对性提示词标注行为。团队以 GPT-5 流量构建评测并用于 GPT-5.1,发现了训练期 bug 导致的 Calculator Hacking 行为,该行为最终占 GPT-5.1 部署期欺骗行为的大部分,且评测估计的行为发生率与部署后实际发生率较为接近。

    推荐理由OpenAI 公开了用去标识化生产流量构建对齐评测的完整流程,并给出评测感知与部署行为发生率之间的对照数据。

  5. OpenAI Alignment Research · 收录 · 原文 40

    OpenAI 发布 CoVal:从众包中学习价值观感知评分标准

    OpenAI 发布 CoVal 数据集,用众包方式提取驱动模型回复偏好的价值观,并配套一套可审计的评分标准。研究招募约 1000 名来自 19 个国家的参与者,对合成价值观敏感提示词进行排序并撰写、评分标准,清洗后保留 986 个提示词和约 15000 条标准,发布保留全部原始标准的 CoVal-full 和每提示词保留 4 条高评分兼容标准的 CoVal-core。验证研究用 982 名评分者对 140 个提示词的新回复排序,CoVal 得分较高的回复在约 60% 的成对比较中胜出,与群体聚合排序的一致率 CoVal-full 为 0.75、CoVal-core 为 0.76。

  6. OpenAI Alignment Research · 收录 · 原文 48

    OpenAI 发布 Model Spec Evals,GPT-5 Thinking 合规率 89%

    OpenAI 发布首个完整版 Model Spec Evals,用于衡量模型遵循 OpenAI Model Spec 的程度。该评测覆盖 Model Spec 全部政策章节,包含 596 条提示词和 225 个具体关注点,每条提示词配有说明合规边界的评分细则。评分由自动评分器 GPT-5 Thinking 完成,对每条回复采样五次合规分(1-7)取中位数,1-5 判为不合规、6-7 判为合规。

    推荐理由OpenAI 公开了 Model Spec 合规度评测的完整数据集、评分流程与各代模型得分,可供研究者复现并比较模型行为。

  7. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 21

    腾讯 AI-Infra-Guard v4.1.14 新增 Agent 红队技能与 9 种单轮越狱攻击方法

    腾讯 AI-Infra-Guard 发布 v4.1.14,新增面向 Agent 安全的 aig-agent-redteam 技能,并加入 PrefillAttack、ICA、PastTense、Overload、Jailbroken、FlipAttack、DeepInception、CodeChameleon、JAM 共 9 种单轮越狱攻击方法及 AdvBench、CNSafe、SafeBench 三个越狱评测数据集。该版本还将调度改为轮询选择 Agent 以实现负载均衡,并在文档中补充上述数据集致谢、更新 DeepTeam 仓库地址。

  8. Frontier Model Forum · 收录 · 原文 30

    Frontier Model Forum 发布 AI 生物安全评估初步分类体系

    Frontier Model Forum 发布《AI 生物安全评估初步分类》议题简报,提出按方法论和领域两个维度划分前沿 AI 生物安全评估的分类法与定义。方法论含三类:基准评估、红队演练和对照研究;领域涵盖科学知识与科学推理性评估及危害性生物知识评估,后者围绕生物威胁创建流程中的构思、计算机模拟实验等操作步骤展开。该分类基于 FMF 成员企业专家及外部先进 AI 与生物学专家的意见形成初步共识,旨在推动建立有效的 AI 生物安全评估生态。

  9. Frontier Model Forum · 收录 · 原文 40

    Frontier Model Forum 发布 AI 生物安全评测三级报告分层方案

    Frontier Model Forum 发布议题简报,提出 AI 生物安全评测信息的三级报告框架,按公开、可信网络内共享、仅私下披露划分披露范围。Tier 1 可公开发布研究问题、科学领域、高层级评测方法、参与者背景、受测模型、任务示例、分析方法和关键高层级结论及研究局限;Tier 2 限可信网络共享完整威胁模型、深入评测方法、结果详细解读和模型增强细节;Tier 3 仅在决策相关方之间私下披露具体模型漏洞、特定训练数据和私有数据集。该框架采取预防性思路,信息只有在确信更广泛传播不会带来信息或注意力风险时才扩大共享范围,部分条目的报告层级取决于评测结果,例如确认新型生物威胁或可利用漏洞的高层级结论可能不宜公开。

  10. Frontier Model Forum · 收录 · 原文 23

    Frontier Model Forum 推出前沿 AI 框架技术报告系列

    Frontier Model Forum 启动前沿 AI 框架技术报告系列,计划在未来数月内陆续发布四份报告,分别覆盖风险分类与阈值、前沿能力评估、缓解措施以及第三方评估。该系列旨在说明不同组织情境下如何有效落地前沿 AI 框架,并推动实施标准的形成。目前已有 12 家主要 AI 开发商发布了各自的前沿 AI 框架,其中包括 Google DeepMind 的 Frontier Safety Framework、Anthropic 的 Responsible Scaling Policy 和 OpenAI 的 Preparedness Framework。

  11. Frontier Model Forum · 收录 · 原文 32

    Frontier Model Forum 资助 AI 生物风险研究:病毒学与细菌生物威胁基准及湿实验室试验

    Frontier Model Forum(FMF)通过 AI Safety Fund 公布三项应对 AI—生物风险的资助进展。SecureBio 开发了含 322 道多模态问题的 Virology Capabilities Test(VCT)基准,Nemesis Insights 则建成约 1,000 条高质量细菌生物威胁提示词的 BBG 框架,两者数据集将提供给安全团队、监管机构和学术研究者。此外,FMF 联合 Sentinel Bio 资助一项大规模 BSL-2 湿实验室研究,对比有无领先多模态 AI 辅助下新手完成实验的成功率,全部结果将在发表前经独立的生物安全与国家安全专家顾问委员会预先审核。

  12. SPY Lab · 收录 · 原文 50

    SPY Lab 提出用一致性检查评测超人类模型

    SPY Lab 提出一套基于蜕变测试的评测框架,在无法获得真值的情况下通过输入域的一致性约束检验超人类模型。方法对棋盘镜像、旋转等语义等价变换施加约束,测试超人类国际象棋 AI Leela Chess Zero,发现多处明显违反一致性的大偏差,包括镜像后胜率估计截然不同、唯一合法走法前后胜率不一致。在 GPT-4 上,作者用自建预测数据集测试单调性与概率互补等约束,发现其预测常不满足单调性,且在贝叶斯定理约束上违反率超过 50%;GPT-4 相比 GPT-3.5-turbo 一致性有明显提升。

    推荐理由提出用一致性约束在无真值领域评测超人类模型,并给出黑盒与白盒搜索的效率对比数据。

  13. SPY Lab · 收录 · 原文 50

    SPY Lab 研究:机器学习隐私防御的评测存在误导

    SPY Lab 的研究发现,现有对启发式机器学习隐私防御的评测可能严重低估隐私泄露,在 CIFAR-10 上把各防御(含 DP-SGD)调到至少 88% 测试准确率时,既有评测对泄露的低估可达五十倍。作者指出常见评测的三个问题:只关注群体层面的隐私、使用弱且非自适应的攻击、对比低效用的 DP 基线。论文提出以最脆弱样本的样本级隐私、强自适应攻击和恰当 DP 基线为原则的新评测协议,并设计一小组金丝雀来高效近似最脆弱样本的泄露,金丝雀需随防御方法选择,误标或非典型样本是常见起点。将协议用于五种启发式防御(涉及知识蒸馏、合成数据和损失扰动)后,它们均比原评测泄露更多,且没有一个能胜过调好超参数的启发式 DP-SGD 基线。

    推荐理由原文指出隐私防御评测普遍高估防护效果,并给出可复用的样本级评测协议与金丝雀设计思路。

  14. SPY Lab · 收录 · 原文 50

    SPY Lab 复盘 IEEE SaTML 2024 的 LLM CTF 与后门检测竞赛

    SPY Lab 为 IEEE SaTML 2024 组织了两场竞赛,分别是 LLM CTF 和针对已对齐 LLM 的木马检测竞赛,两场竞赛均与参赛者合作产出了论文。LLM CTF 分防御和攻击两个阶段,目标是检验简单提示词与过滤机制能否让 LLM 应用抵御提示注入和提取,并发布了超过 137k 条成功与失败攻击对话及 44 种防御的数据集。经验总结指出,多数防御需要数十到数百轮对话才能被攻破,单轮越狱与安全基准不足以评估模型,过滤机制很可能被绕过,且防御并非独立组件,可能泄露系统设计信息。

    推荐理由组织者复盘两场竞赛的攻防结果,其中多轮攻击与后门搜索的发现可用于改进模型安全评测设计。

  15. SPY Lab · 收录 · 原文 50

    SPY Lab 研究:自然提示下主流 LLM 聊天输出最多 15% 逐字复现网络文本

    SPY Lab 与 Nicholas Carlini、Daphne Ippolito 合作研究发现,在完全自然、非对抗的提示下,主流聊天模型生成的文本中最多 15% 由约 50 字符的片段组成,这些片段可在互联网上逐字找到。研究覆盖创意写作、说服性写作和事实性任务,发现事实性(说明文)任务复现率远高于创意任务,写百科和新闻文章时近 30% 的生成文本包含至少 50 字符的逐字网络片段,且这一模式在所有测试模型中一致,Claude 3 Opus 复现最多。与人类对比,人类文本中位数不含 50 字符的逐字网络片段,而 LLM 文本中位数最多含 10%。

    推荐理由研究用自然提示词而非对抗手段测出主流聊天模型会逐字复现训练数据,为评估数据泄露风险提供了可复现的测量方法。

  16. SPY Lab · 收录 · 原文 41

    SPY Lab 立场论文:成员推断攻击无法证明模型训练使用了你的数据

    SPY Lab 在将发表于 SaTML 2025 的立场论文中论证,成员推断(MI)攻击在向法官等第三方证明 GPT-4 等生产模型训练使用了特定数据时存在根本性缺陷。作者将训练数据证明形式化为假设检验,指出其关键在于证明假阳性率(FPR)足够低,而现有研究通过采样零假设来估计 FPR,必须完全控制数据生成与模型训练过程。

  17. SPY Lab · 收录 · 原文 46

    SPY Lab 提出越狱税:越狱输出到底有多大用处

    SPY Lab 提出越狱税(Jailbreak Tax)指标,衡量越狱成功后模型效用相对基线的下降幅度,并给出配套基准。研究先评测基座模型准确率,再自行对齐使其拒答数学和生物题,最后对对齐模型施加越狱并测量准确率,发现越狱方法造成的效用损失最高达 92%。在 LLaMA 模型上,PAIR、TAP 和微调攻击的成功率都在 92% 左右,但越狱税差异很大,说明越狱成功率与效用损失之间没有明显相关性。为贴近真实场景,作者把 GSM8K 题目改写为含炸弹、核武器等危险词但答案不变的 EvilMath,并用改写为独角兽等良性分布外概念的 UnicornMath 计算基线,发现前沿模型自带的安全机制下越狱税依然存在。

    推荐理由提出越狱税这一指标,用可客观评分的基准量化越狱后模型效用的下降,为比较不同越狱方法提供新维度。