跳到正文

#生物/化学

今天还没有收录新动态
10月1日周四
  1. OpenAI Deployment Safety · 71

    OpenAI 发布 GPT-6 Astra System Card 增补:GPT-6.1 Sol

    OpenAI 发布 GPT-6 Astra System Card 的增补文件,介绍 GPT-6.1 Sol。按 Preparedness Framework,OpenAI 将 GPT-6.1 Sol 在网络安全领域视为 Critical capability,在生物与化学领域为 High capability,在 AI 自我改进上低于 High 阈值,因此沿用与 GPT-6 Astra 相同的防护体系。生物化学方面,其 Critical 级评测结果未越过指示性阈值。生物拒答评测中,它在严重与两用类别上与 GPT-6 Sol 相当,对良性提示词的拒答更少;这些结果只反映模型本身的回答,不含完整的生产环境防护。网络安全的安全评测中,GPT-6.1 Sol 在生产聊天评测上优于此前所有模型,但在合成与半合成智能体环境中比 GPT-5.6 Sol 有小幅退步。

    推荐理由GPT-6.1 Sol 的 System Card 增补给出了生物化学与网络安全能力评测结果,可对照 GPT-6 Astra 与 GPT-6 Sol 的差异。

9月2日周三
  1. arXiv:危险能力与安全评测 ·

    FUSE:面向大语言模型危险能力的模块化评测框架

    研究者提出 FUSE 模块化评测框架,通过知识(K)、防御(D)、危害(H)三条正交管线在统一协议下评测模型,并汇总为标准化危险能力画像 φ。框架以可插拔模块提供场景种子、知识库、危害查询和评判标准,核心评测引擎跨领域保持不变,化学-生物(CB)评测之外还以网络安全试点验证协议可迁移性。用 CB 模块实例化后,研究评测了来自四个模型家族的 12 个商用大语言模型,发现三个维度暴露出差异明显的画像:知识水平相近的模型在拒答韧性上不同,防御强的模型在配合时也未必生成更少有害内容,家族层面还能区分 Claude、DeepSeek 和 GPT 模型。

8月4日周二
  1. arXiv · 82

    AI Security Leaderboard 发布:四个前沿模型的越狱成本相差上百倍

    独立基准 AI Security Leaderboard 发布 v1.0 报告,按 FAR$.$AI Minimal Standard 对前沿模型的护栏从弱到强排名,测试范围覆盖 CBRNE(化学、生物、放射、核与爆炸物)严重滥用请求和进攻性网络安全。报告测试了四个领先模型:Claude Fable 5 和 GPT-5.6 Sol 抵御了所有攻击,未发现通用越狱,作者估计用该方法越狱的成本可能超过 14200 美元;而 Grok 4.5 和 Gemini 3.1 Pro 存在数百个通用越狱,每个成本不到 300 美元,Grok 最弱的网络安全领域越狱成本低至 24 美元。

    推荐理由该榜单在同一最小标准下横向比较四个前沿模型的越狱成本,并指出所有弱点都已有现成防御,便于评估方理解当前护栏差距。

7月20日周一
  1. arXiv · 85

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    上海人工智能实验室团队提出生物红队模型 Intern-BioBreaker,用于探测前沿大语言模型在生物安全任务上的越狱漏洞。该模型经科学语料继续预训练、通用越狱数据 SFT、生物数据 RL 和推理期智能体红队四阶段训练,在 SafeSci-Bio 上对 GPT-5.5 的攻击成功率达 60%,对 Claude Opus 4.8 为 26%,高于 Qwen 系列基线和 Intern-S2-Preview。扩展到 14 个前沿模型后,3/14 在 SafeSci-Bio 上达到 100% 攻击成功率,10/14 在 SoSBench-Bio 上达到 100%,Claude 系列相对更抗攻击。案例研究显示,模型可被诱导生成经 AlphaFold3 评估结构合理、受体结合能更低的流感 HA 候选序列。

    推荐理由论文给出生物风险越狱在 14 个前沿模型上的攻击成功率,并延伸到序列级与湿实验验证,可对照现有生物安全护栏的覆盖范围。

6月17日周三
  1. arXiv ·

    SciRisk-Bench:面向 AI4Science 安全的风险维度感知基准

    作者提出 SciRisk-Bench,一个从显式风险维度和科学学科两个角度评测 AI4Science 安全的基准,覆盖 7 个学科、31 个子学科和 10 个风险维度。研究指出,现有 AI4Science 安全数据集虽覆盖若干学科和任务形式,但底层风险维度界定不足。实验部分对主流 LLM 和面向科学的 LLM 按风险维度、学科和子学科进行评测,用于细粒度诊断科学模型在哪些方面仍不安全。论文编号 arXiv:2606.18936,属 cs.AI 与 cs.CY 方向。

12月18日周四
  1. UK AISI(GOV.UK 公告) · 75

    UK AISI 发布首份前沿 AI 趋势报告,量化最先进模型能力进展

    英国 AI Security Institute(AISI)发布首份 Frontier AI Trends Report,基于两年对网络、化学和生物等关键领域的能力测试,公开评估最先进 AI 系统的演进。报告称防护措施在改善,但每个受测系统仍可被某种方式绕过,且各公司防护水平不一;AISI 红队找到通用越狱所需时间从几分钟增至数小时,约提升 40 倍。关键发现包括:学徒级网络安全任务成功率从 2023 年的不足 9% 升至 2025 年的约 50%,2025 年首次有模型完成需约 10 年经验的专家级网络任务;模型完成一小时软件工程任务的比例从两年前的不足 5% 升至 40% 以上;系统在科学知识测试上超过博士级研究者。

    推荐理由英国 AISI 首次公开前沿模型能力趋势数据,给出网络、软件工程与生化任务上的量化变化,可作为评估能力增速的基线参考。

12月21日周六
  1. Frontier Model Forum ·

    Frontier Model Forum 发布 AI 生物安全评估初步分类体系

    Frontier Model Forum 发布《AI 生物安全评估初步分类》议题简报,提出按方法论和领域两个维度划分前沿 AI 生物安全评估的分类法与定义。方法论含三类:基准评估、红队演练和对照研究;领域涵盖科学知识与科学推理性评估及危害性生物知识评估,后者围绕生物威胁创建流程中的构思、计算机模拟实验等操作步骤展开。该分类基于 FMF 成员企业专家及外部先进 AI 与生物学专家的意见形成初步共识,旨在推动建立有效的 AI 生物安全评估生态。

已经到底了