跳到正文

安全评测

安全基准、评测方法与评测结果,以及对评测本身的质疑。

555条动态与论文相关主题危险能力System CardMETR
在这个话题内搜索或按分类筛选

新闻与论文

第 281–300 条 · 共 555 条
10月2日周五
  1. FAR.AI · 收录 · 原文 28

    FAR.AI 欺骗研讨会总结:白盒监测为何比黑盒更有前景

    FAR.AI 举办了一场聚焦 AI 欺骗检测的研究工作坊,Chris Cundy 提出应更多投入观察模型内部计算的白盒监测方法,而非仅检查输出的黑盒监测——后者需要一个至少与被检模型同等能力的可信监视器,且无法获取模型内部持有却未表达的知识。 Neel Nanda(Google DeepMind)、Joseph Bloom(UK AISI)、Micah Carroll(OpenAI)及 Cadenza Labs 的 Walter Laurito 与 Kieron Kretschmar 分别就可错位证据标准、系统可监测性的现状与未来、思维链可监测性以及欺骗检测基准 Liars Bench 做了报告。

  2. FAR.AI · 收录 · 原文 25

    FAR.AI 第二届 TIAP 会议:AI 政策的技术创新——我们听到了什么

    FAR.AI 联合美国创新基金会、CNAS 和 RAND 于 3 月 30–31 日在华盛顿举办第二届 Technical Innovations for AI Policy 大会,超 200 名政策制定者、研究者与技术专家参会,核心议题是现有评估、标准和安全框架跟不上 AI 治理需求。Anka Reuel 指出 OpenAI 的 HealthBench 从未将测试项映射到临床公认病症,也无法证明分数能预测患者结局,并称某福利资格预筛智能体报告的 90% 准确率在计入不确定性后可落在 72%–100%。Ben Bucknall 则警告无法确认 API 输出的模型版本,提出透明披露乃至基于可信硬件飞地的密码学认证作为可能补救方向。

  3. SecureBio · 收录 · 原文 50

    SecureBio 发布 OpenAI GPT-5.5 发布前生物安全评估

    SecureBio 对 OpenAI GPT-5.5 的两个发布前检查点做了生物安全评估,访问时间为 2026 年 4 月 2 日至 9 日,期间这些检查点的 API 级生物内容过滤被关闭。在静态评测上,较新的检查点在病毒学能力测试 VCT 上取得 52.0% ± 0.3%,超过 SecureBio 测试过的所有 SOTA 模型,且未观察到拒答,是首个在该测试上超过全部人类专家的 OpenAI 模型;在分子生物学 MBCT 上得 56.2% ± 0.5%,在人类病原体 HPCT 上得 64.7% ± 0.2%,在 World Class Bio 上得 53.2% ± 0.6%。在智能体任务评测 ABC-Bench 和 ABLE 上表现较强但未超过前沿模型,ABLE 因拒答率过高难以得出结论。

    推荐理由第三方机构在发布前对 GPT-5.5 做的生物安全评测,给出静态与智能体任务的具体分数和拒答率,可对照此前前沿模型看能力变化。

  4. SecureBio · 收录 · 原文 22

    SecureBio 解析生物风险证据层级中 Evals 的角色

    SecureBio 发文阐述 evals 在 AI 赋能生物风险证据体系中的定位,主张其比纯理论推演提供更强证据,且远比湿实验室能力提升研究便宜、可重复,还能帮助排除某些能力的存在。该文将证据分为三层,指出 evals 属于第二层,是在硅基环境中估计底层模型能力的工具,虽存在规格博弈、诱导不足和数据泄漏等已知失效模式,但仍优于仅从第一性原理进行论证。

  5. SecureBio · 收录 · 原文 57

    SecureBio 发布 ABC-Bench:前沿模型在病毒 DNA 组装任务上表现如何

    SecureBio 设计 Agentic Bio-Capabilities Benchmark(ABC-Bench),用三个可客观评分的任务衡量 LLM 智能体组装病毒 DNA 的实际操作能力,并与至少一年分子生物学经验、两年编程经验的 PhD 生物学家对比。所有受测模型在三个任务上都超过人类专家中位数:Claude Sonnet 4.6 和 Gemini 3.1 Pro Preview 在液体处理机器人任务上全部运行满分,Claude Opus 4.6 在片段设计任务上全部运行满分。模型在合成筛选规避任务上表现较差,该任务没有公开协议、需要真正的生物学创造力。作者指出,任务都涉及 Python 编程,编程是人类专家被拉开差距的主要环节。研究还用 GPT-o4-mini-high 在真实实验室的工业标准机器人上做了三次独立实验,均由全质粒测序确认组装成功。

    推荐理由SecureBio 用 ABC-Bench 对比前沿模型与博士级生物学家在病毒 DNA 组装任务上的表现,并给出真实实验室验证结果。

  6. SecureBio · 收录 · 原文 43

    SecureBio 发布生物领域 AI 基准仪表盘 Trends in Biology

    SecureBio 发布公开仪表盘,汇总其全部 AI 模型评测分数,展示前沿模型在生物安全相关任务上的表现,涵盖旗舰隐性知识基准 Virology Capabilities Test 以及新一代智能体基准 ABC-Bench 等。该仪表盘覆盖三年以上、九家模型公司和十余项评测指标,其中两项结果突出:前沿模型已超过人类专家基线,且生物与生物安全相关领域的能力持续上升。仪表盘还包含 Bio Capabilities Index,其方法论与 Epoch Capabilities Index(ECI)一致,并测量和报告 BioTIER 等生物安全防护措施的有效性。所有分数通过标准化流程计算以保证比较公平有效,例如使用相同配置运行评测。仪表盘已上线,并随新模型、新基准和新分析发布而更新。

    推荐理由汇总三年、九家模型公司的生物安全评测分数,并给出能力指数与防护措施评估,便于横向比较前沿模型在生物领域的进展。

  7. SecureBio · 收录 · 原文 28

    SecureBio 的模型评估原则与实践

    SecureBio 公布其模型评估原则与实践,在 AI Evaluator Forum 的 AEF-1 Standard 基础上扩展,适用于其开展的每一次模型评估。该机构评估接近部署配置的预发布模型快照,并申请访问无安全过滤或安全微调的版本,以在护栏被绕过时评估模型底层能力。SecureBio 已开展多次生物安全预发布评估,最近一例为 GPT-5.6 Sol,此前曾独立发布 GPT-5.5 的评估报告。

  8. SecureBio · 收录 · 原文 15

    SecureBio AI 负责人 Seth Donoughe 卸任,Jasper Götting 接任

    SecureBio AI 团队主任 Seth Donoughe 卸任,将 AI 研究负责人一职交给自 2024 年起领导该团队 AI 研究的病毒学家 Jasper Götting。Donoughe 指出,当 AI 科学能力超越所有人类专家后,基于人类专家知识构建的基准将失去动态范围,需转向人类可验证但专家难以完成的任务(如预测实验结果),而 SBAI 正投入该方向;但该方法不适用于评估新想法、判断与研究方向的产出。他还强调需研究人机混合科学家,并建立 AI 驱动科学发现的安全流程。

  9. Hugging Face Daily Papers · 收录 · 原文 论文46

    VGBench 诊断语音 Agent 的声学上下文门控能力

    论文提出 VGBench,一个包含 1,018 条样本的诊断基准,用于评测语音 Agent 在旁谈、自语和说话人切换场景下是否该采取行动。每个样本共享静默、工具调用和自然语言回答三种动作空间;说话人切换对固定指定词句,仅改变声源、距离渲染和时间边界,形成受控的佩戴者到旁观者切换。六个原始 Audio LLM 和三种免训练适配方法往往能识别目标工具,却很少在该切换下抑制动作,原始模型最高切换静默率仅 14%。作者随后以 VoxGate 作为后训练案例:监督训练对 91.3% 的切换指令静默,同时对附近佩戴者指令和纯文本对照都能选对工具;探索性 GRPO 阶段切换表现相近,旁谈准确率从 68.4% 升至 70.9%,自语静默率从 52.0% 升至 60.0%。

  10. Hugging Face Daily Papers · 收录 · 原文 论文43

    IntentFlux 基准测量 LLM Agent 的意图漂移并给出 StateForge 修复方案

    论文提出意图漂移这一多轮交互失效模式,即用户已撤回或更新的意图仍继续影响最终回答或工具调用。作者构建 IntentFlux 可执行基准,把可验证任务转成带受控意图变更的对话并保留原有评分器,在 627 个案例的校准中,随着对话包含更多被取代和撤回的信息,平均任务得分从 0.476 降至 0.384。在八个模型上,同一最终任务需要从演变对话中恢复时,完全正确率显著低于单轮直接给出任务。作者进一步提出 StateForge,在生成前显式维护当前有效需求,在 General-Test 上把平均任务得分从 0.367 提升到 0.467;即使提供真实最终状态,性能仍未恢复到单轮水平,说明状态估计错误只能解释部分差距。

  11. arXiv · 收录 · 原文 论文46

    FIGS:在不惩罚共情的前提下评测多轮谄媚

    研究者提出 FIGS(Factual Integrity and Grounded Support)双轴评测框架,用自适应 10 轮对话模拟器动态挑战目标模型,评测大语言模型在多轮对话中的谄媚行为。框架用一套分类法严格区分谄媚(模型是否坚持事实、赞美是否适度)与校准认可(对用户情绪表达共情但不过度),以避免把基本共情误判为让步。作者发布了完整测试环境,包括 500 个多样化多轮场景和自动评判器。对领先模型的评测显示出一致权衡:在持续交互中,模型要么逐渐滑向谄媚,要么过度纠正为机械式的疏离,说明在自然对话中兼顾诚实与适度支持仍是未解决的难题。

  12. 安远AI · 收录 · 原文 43

    安远AI发布前沿AI风险监测平台并给出十大关键洞察

    安远AI于2025年11月7日发布国内首个前沿AI风险监测平台,并同步发布首份前沿AI风险监测报告(2025Q3),追踪全球15家领先AI公司的50个前沿模型在网络攻击、生物风险、化学风险和失控四个领域的潜在灾难性风险。报告称过去一年四类风险指数持续上升,网络攻击领域累积最大风险指数上升31%,生物风险上升38%,化学风险上升17%,失控上升50%。报告还指出推理模型能力分远高于非推理模型但安全水平大致相同,开源与闭源模型在多数领域的能力-安全分布无显著差异,生物风险领域开源模型能力明显偏弱。在具体基准上,CyberSecEval2-VulnerabilityExploit最高分从55.4升至91.7,BioLP-Bench中包括o4-mini在内的四个模型表现优于人类专家,而多数模型对有害生物问题的拒绝率偏低。

  13. 安远AI · 收录 · 原文 45

    安远AI发布2025Q4前沿AI风险监测报告:Gemini生物能力提升,豆包、混元、MiniMax安全性改善

    安远AI前沿AI风险监测平台于2026年3月3日发布第二期《前沿AI风险监测报告(2025Q4)》,监测2025年第四季度发布的13个模型(含GPT-5.2、Gemini 3 Pro Preview、Claude Opus 4.5、DeepSeek V3.2、Kimi K2 Thinking、Doubao Seed 1.8、MiniMax M2、HY 2.0 Think等)在网络攻击、生物风险、化学风险和失控四个领域的表现。报告称各领域风险指数在2025年末趋于平稳,未创新高,但模型系列趋势分化:GPT与Claude系列维持低位,DeepSeek系列稳定在高位,Doubao、Hunyuan、MiniMax系列显著下降,Gemini在生物与失控领域、Kimi在网络攻击与失控领域上升。安全分整体显著提升,以Doubao、Hunyuan、MiniMax提升最明显。

  14. 安远AI · 收录 · 原文 46

    安远AI发布2026Q1前沿AI风险监测报告:风险指数升级1.5版,失控风险连续三个季度上升

    安远AI前沿AI风险监测平台发布《前沿AI风险监测报告(2026Q1)》,监测全球16家AI公司的70多个前沿模型,并首次采用风险指数1.5版框架,测评基准从29个增加到42个,覆盖网络攻击、生物风险、化学风险、有害操纵和失控五个领域。1.5版新增有害操纵领域,并在失控领域引入Self-Proliferation、MLE-Bench、GDM-Stealth、Agentic-Misalignment、Shutdown-Resistance、DarkBench等测评,在网络攻击、生物、化学领域加入Fortress和ISC-Bench等红队攻击基准,同时对历史模型回溯重测。报告发现失控领域风险指数连续三个季度上升,累计增幅51%;Gemini系列在失控领域风险指数显著升高,DeepSeek、GLM和MiMo系列在多数领域处于较高风险区间,GPT和Claude系列多数领域维持较低风险区间。

  15. 安远AI · 收录 · 原文 46

    安远AI在WAIC发布前沿AI风险监测平台2.0

    安远AI在2026年世界人工智能大会上发布前沿AI风险监测平台2.0,包含风险指数2.0版、2026 Q2风险监测报告和前沿AI风险测评基准数据库三项更新,以及与复旦大学等合作的自主网络渗透评估报告。风险指数2.0把风险指数改为能力分的指数函数,能力分超过能力黄线阈值C0后风险加速增长,并把总安全分拆为基础安全分S1、越狱安全分S2和篡改安全分S3;测评基准新增CVE-Bench、BixBench、FrontierScience和自研FRT红队框架,FRT从2023至2026年的100多种攻击方法中筛选出22种高成功率方法,再为每个模型选取最有效的3种。测评基准数据库收录2023至2026年间200多项基准,并按风险场景关联能力、倾向、护栏三类测评功能点。合作研究对19个前沿模型评估自主网络渗透能力,Tier 1渗透成功率最高69.3%,Tier 2最高68.7%。

  16. 安远AI · 收录 · 原文 50

    安远AI发布2026Q2前沿AI风险监测报告:风险指数不到一年增长数倍,多模型越过风险黄线

    安远AI在2026年7月19日的世界人工智能大会上发布前沿AI风险监测平台2.0,包含风险指数2.0版、2026 Q2风险监测报告和前沿AI风险测评基准数据库三项更新。本期报告首次采用风险指数2.0版框架,将能力分对风险指数的影响从线性改为指数关系,把安全分拆分为基础安全分、越狱安全分和篡改安全分,并引入能力黄线与风险黄线,同时首次引入前沿越狱攻击技术。报告覆盖13家AI公司在2025Q3到2026Q2发布的47个前沿模型,包括GPT-5.5、Claude Opus 4.8、Grok 4.3、DeepSeek V4 Pro、Qwen 3.7 Max等。报告向模型开发者、AI安全研究者和政策制定者提出了相应建议。

  17. 安远AI · 收录 · 原文 33

    安远AI发布前沿AI风险测评基准数据库

    安远AI在WAIC上发布“前沿AI风险监测平台2.0”,其中“前沿AI风险测评基准数据库”收录2023年以来两百多项前沿AI风险测评基准,覆盖网络攻击、生物风险、化学风险、有害操纵、失控、核风险、具身伤害等领域。数据库采用“AI自动收集+人工审核入库”工作流,按风险领域、测评类型、测评功能点、测评对象类型、开源情况等属性结构化整理,并提供测评基准列表与风险模型两个入口。

  18. 安远AI · 收录 · 原文 52

    Concordia AI 发布 2026 Q2 前沿 AI 风险监测报告:多项风险指数一年内上升数倍

    Concordia AI 在 2026 年 7 月 19 日的 WAIC 上发布前沿 AI 风险监测平台 v2.0,包含风险指数 v2.0、2026 Q2 风险监测报告和前沿 AI 风险基准数据库。报告覆盖 13 家公司 2025 Q3 至 2026 Q2 发布的 47 个前沿模型,包括 GPT-5.5、Claude Opus 4.8、Grok 4.3、DeepSeek V4 Pro、Qwen 3.7 Max、豆包 Seed 2.1 Pro、混元 3.0 Preview、文心 5.1、MiniMax M3、Kimi K2.6、GLM 5.2 和 MiMo V2.5 Pro。风险指数 v2.0 设能力黄线与风险黄线两条阈值,前者表示无护栏时模型会显著提高严重危害风险,后者表示即使有现有护栏残余风险仍达高风险边界。

  19. FAR.AI · 收录 · 原文 15

    FAR.AI 首尔对齐研讨会 2026:AI 安全需要可信测量与工程标准

    FAR.AI 在 ICML 2026 同期举办首尔对齐研讨会,近 200 名来自前沿实验室、学术界、政府和 AI 安全机构的人士参加,核心结论是 AI 能力提升远快于可靠性建设。FAR.AI 红队目前很少在前沿闭源模型上找到端到端越狱,但发现除一层外所有防护层都会失效,单一新攻击手法即可击穿整个系统。会议还介绍了 PostTrainBench,用于衡量智能体能否端到端完成 LLM 后训练,该基准设有奖励作弊判定,被标记的作弊运行按基座模型计分。

  20. FAR.AI · 收录 · 原文 56

    FAR.AI 发布 AI Security Leaderboard:四个前沿模型护栏强度相差逾百倍

    FAR.AI 发布 AI Security Leaderboard(leaderboard.far.ai),在相同条件下测试四个前沿模型的护栏,并配套提出 Minimal Standard for Safeguards。测试用自动化工具包把越狱技术拆解重组,生成数十万条提示词,覆盖化学、生物、放射、核、爆炸物与网络等风险领域;把在某一领域超过四分之三有害请求上成功的攻击称为通用越狱,并计算攻击者找到它的成本。结果显示,最脆弱的 Grok 4.5 仅需 58 美元即可开发出跨全部测试领域的攻击,网络领域更低至 24 美元,部分越狱组件来自公开论坛和代码仓库;Claude Fable 5 与 GPT-5.6 Sol 未发现通用越狱,估计需花费超过 14000 美元。FAR.AI 称这些数字假设低投入攻击者,具备专业越狱经验者可能找到更多入口,并强调发现的弱点均属已知攻击类别、已有现成防御。

    推荐理由FAR.AI 用统一攻击工具包对四个前沿模型做同条件红队测试,并给出可比较的破解成本,为评估护栏强度提供了横向参照。