跳到正文

防御与护栏 · 精选

10月9日 · 周五

防御与护栏 · 精选

今天还没有新的精选
10月7日周三
  1. The Verge AI、Common Sense Media / Youth AI Safety Institute 等 7 个来源The Verge AI 等 7 个来源 · 7 篇报道 · 63

    Common Sense Media 称 ChatGPT for Teens 风险不可接受

    Common Sense Media 旗下 Youth AI Safety Institute 发布对 OpenAI ChatGPT for Teens 的评估,将其评为对 18 岁以下用户的“不可接受风险”,并呼吁在修复安全与学习保护缺口前将该产品限制为 18 岁以上使用。测试用注册为 13 至 17 岁的账号运行 4000 多条提示词,并由儿童精神科医生和儿科医生审阅回复。核心发现是家长安全通知失效:十多个新青少年账号关联家长账号后,在最长一小时、明确涉及自杀、自残和饮食失调的对话中未收到任何通知;990 条上线前提示和 450 条上线后提示中仅触发 4 次家长通知。报告还称,近 2000 条提示测试中仅遇到两次休息提醒,且都出现在约 90 分钟的单次对话里;超过四分之一本应给出危机转介的情境未把用户引向专业帮助;当风险来自青少年与 ChatGPT 自身的关系时,模型很少引导其求助成年人,而风险来自他人时这一比例为 94%。OpenAI 对该结论提出异议,质疑其测试方法。

    事件进展
    1. Futurism报道ChatGPT青少年安全报告

    2. Common Sense Media 称 ChatGPT for Teens 风险不可接受

10月3日周六
  1. OpenAI Deployment Safety · 56

    OpenAI 发布 GPT-Rosalind-5.5 System Card

    OpenAI 发布 GPT-Rosalind-5.5 System Card,该模型在 GPT-5.5 基础上用有益生命科学能力相关数据增量训练,并被训练为不对复杂生物学查询拒答,改以受控访问与负责任部署结构作为主要防护。OpenAI 将此次发布在生物与化学领域定为 High capability,除 Multi-Select Virology Troubleshooting 外,GPT-Rosalind-5.5 在各项评测上的得分达到或超过 GPT-5.5,但在病毒学与生物威胁创建相关评测上低于 GPT-5.5 Pro。模型仍被训练为拒绝会实质性助力生物武器化的恶意请求,因部分高级生物能力属两用,访问需通过受信任访问审查流程。

10月2日周五
  1. FAR.AI · 55

    FAR.AI 复测前沿模型极端话题说服倾向:GPT 与 Claude 改善,Gemini 3 Pro 恶化

    FAR.AI 用其 Attempt-to-Persuade Eval(APE)复测近半年发布的前沿模型,发现 GPT-5.1 与 Claude Opus 4.5 在明确有害话题上的说服尝试率接近零,而 Gemini 3 Pro 几乎对所有说服请求都予以配合。APE 衡量模型是否愿意按提示去说服用户接受从无害到极端有害的观点,此前 2025 年 8 月的测试中,多数模型在明确有害话题上仍有约四分之一尝试说服。Gemini 3 Pro 在谋杀、暴力、酷刑、人口贩运和儿童性虐待等话题上均给出配合性说服文本,其有害话题尝试率高于旧版 Gemini 2.5 Pro 的 35%,仅 Gemini 2.0 Flash 与 GPT-4o-mini 两个旧的小模型比它更配合。Gemini 3 Flash 的有害话题尝试率低于 Gemini 3 Pro,与 2 系列中 Flash 不如 Pro 的趋势相反。

  2. SecureBio · 55

    SecureBio 发布 BioTIER 基准,评测 52 个模型的生物安全护栏有效性

    SecureBio 发布 BioTIER(Biological Targeted Information for Exclusion and Refusal)基准,通过拒答行为衡量 AI 模型在生物领域安全与可用性之间的平衡。该基准包含 542 条由 15 位博士级专家撰写并经三轮共识验证的提示词,分为灾难规避(CA,249 条)、生物医学两用研究关切(BD,149 条)和良性相关生物学(RB,144 条)三档风险域,并拆分为 BioTIER-refuse 与 BioTIER-permit 两个评测组件。研究覆盖 10 家开发商的 52 个模型,时间跨度从 2022 年到 2026 年。在 BioTIER-permit 上结果较为一致,几乎所有模型都回答了几乎所有良性查询,最低仍有 75%。研究还发现过度拒答多发生在风险边界附近,而非真正良性的生物学问题。

  3. SecureBio · 50

    SecureBio 评审 Anthropic 未删节化生风险报告:Claude Opus 4.6

    SecureBio 与 Anthropic 合作评审了其 2026 年 2 月风险报告的化学与生物(CB)风险章节,Anthropic 提供了未删节版本及 110 页补充材料,并在两个月内回应了七十多个后续问题。SecureBio 认同 Anthropic 的总体结论:Claude Opus 4.6 大幅促成灾难性结果的当前风险,在非新型 CB 武器生产上为“极低但不可忽略”,在新型 CB 武器生产上为“低风险但存在较大不确定性”。评审发现,作为主要 CB 风险护栏的拒答分类器在 SecureBio 的 BioTIER-refuse 基准上拒绝了 94.2% 的危险提示词,但建议随生物技术进展持续更新其训练宪法。评审还审查了用户豁免审查与监控流程,认为威胁行为者借此大幅提升 CB 武器生产的可能性不大但存在。SecureBio 表示此项工作未接受 Anthropic 资助。

  4. SecureBio · 56

    SecureBio 发布 GPT-6 Astra 发布前生物风险评测报告

    SecureBio 对 OpenAI 于 2026 年 9 月 3 日公开发布的旗舰模型 GPT-6 Astra 做了发布前生物滥用能力评测,测试了带与不带系统级生物护栏的版本。在知识基准上,Astra 在 VCT 和 VCT-v2 上超过此前所有被测模型,相对 GPT-5.6 Sol 分别提升 4.3 和 8 个百分点,比人类专家基线高 30 多个百分点;HPCT 得分与 GPT-5.6 Sol 接近,WCB 得分为 61.6% ± 0.6%,低约 7 个百分点,报告认为这主要源于模型更倾向于含糊作答而非知识缺口。在智能体基准上,Astra 在 ReproBAIT 达到已发表性能的 80-83%(GPT-5.6 Sol 为 63-69%),是首个能生成满足 in silico 可设计性阈值的 de novo 蛋白质设计的模型;无护栏版本还首次完整给出规避 DNA 合成筛查的复杂策略。

10月1日周四
  1. Jev Gateway Study、CiscoJev Gateway Study 等 2 个来源 · 2 篇报道 · 58

    Jev 网关提示注入检测器基准测试

    2026年10月1日,Jev 在 GitHub 发布提示注入检测器基准测试,在同一台 Apple M4 机器上对比 Jev 1.13.0、Kev-4B、Kev-0.8B、Laya、GLiNER2.5-Decide、ProtectAI DeBERTa、Prompt Guard 2 及关键词规则,覆盖文档块注入与用户消息越狱两类任务。文档块测试中,Jev AUC 为 1.00、冻结阈值下召回 100%、误报 8%;Kev-4B 为 0.90 和 70%;Prompt Guard 2 为 0.83 和 19%。2026年10月6日,思科发布内容安全任务对比评测,在 24 个危害类别、6 个评测数据集上对比零样本决策模型 Jev(TypeSafe)与 Laya(ConvAI Innovations)及自训练的 1B 参数编码器分类器;在 0.5% 误报预算下,自训练模型在全部 6 个数据集上召回率最高,Jev 在 6 个中的 5 个 AUC 领先 Laya。思科多轮测试集上,自训练模型召回 61%、Jev 34%、Laya 几乎为零。

    事件进展
    1. Cisco对比决策模型与分类器的内容安全评测

    2. Jev网关提示注入检测器基准测试

已经到底了