跳到正文

安全评测

安全基准、评测方法与评测结果,以及对评测本身的质疑。

555条动态与论文相关主题危险能力System CardMETR
在这个话题内搜索或按分类筛选

新闻与论文

第 301–320 条 · 共 555 条
10月2日周五
  1. Cisco · 收录 · 原文 15

    Foundation AI 发布 Antares 系列模型与安全推理基准

    Foundation AI 发布 Antares 系列开放权重模型(350M、1B、3B),专用于智能体漏洞定位:仅凭 CWE 描述和仓库只读权限即可定位漏洞所在文件,其中 3B 模型性能对标 GPT-5.5,且可本地运行。Antares-350M 与 Antares-1B 已公开,一个月内在 Hugging Face 下载量达 29,800 次。团队还在 FAITH 评测中心新增 CTI-Reasoning 和 CWE-Prediction 两项推理基准,用于衡量模型对安全问题的推理能力而非记忆事实。

  2. Cisco · 收录 · 原文 29

    Cisco LLM 安全排行榜新增图像与音频模态,Gemini 3.1 Pro Preview 图像抗攻击率 93.9% 居首

    Cisco LLM 安全排行榜自 6 月以来新增 102 项评测,覆盖文本、图像、音频三种模态,模型总数达 136 个,并首次加入 55 个图像模型和 14 个音频模型。图像测试中,Google Gemini 3.1 Pro Preview 以 93.9% 的抗攻击率居首,Anthropic Claude Opus 4.5 以 93.7% 紧随其后,均属 85–100% 的“Excellent”区间;Mistral Magistral Small 2509 仅拒答 23.0% 的攻击。所有模型均在无额外护栏的基础配置下测试,新增模态切换可单独查看文本、图像或音频得分。

  3. IAPS · 收录 · 原文 16

    IAPS 测评 LLM 商品分类能力:Claude Opus 4.8 初步表现可行但仍需更多测试

    IAPS 用定性方法测试了大语言模型的出口管制商品分类能力,给 Claude Opus 4.8 提供 ecfr 工具访问联邦法规 API,让其判定物品对应的 ECCN。该模型能跨《出口管理条例》检索并组合条款、借助图像识别 NVIDIA Vera Rubin AI 加速卡、依据名称认定 ASML EUV 光刻机属受控物项,还能准确做单位换算,但也存在依赖题目中暗示参数的问题。由于商品分类容错率为零且人工复核无法省力,IAPS 建议 BIS 设立试点,并用制造商数据表等更贴近真实的输入继续测试。

  4. NIST · 收录 · 原文 35

    NIST 将 AI 安全研究所联盟更名为 NIST AI Consortium 并扩大范围、招募新成员

    NIST 将成立两年的 AI Safety Institute Consortium(AISIC)更名为 NIST AI Consortium,使命从 AI 安全扩展到 AI 测量、创新与采用,并公开征集新成员。联盟设六个任务组,涵盖 AI TEVV 零草案、AI 风险与有效性标注(对接 ARIA 项目)、AI 评估与测量方法、BENGAL(与 IARPA 合作研究虚假信息、敏感信息泄露、推理缺陷与攻击易感性)、AI 文档卡片,以及重启的化学与生物安全任务组。新成员按意向书先到先得遴选,现有成员须签署修订协议,成员需与 NIST 签订 CRADA。

  5. Datadog Security Labs · 收录 · 原文 42

    Datadog 实测:编码 Agent 的 plan 模式并未写出更安全的代码

    Datadog Security Labs 用同一提示词让 Sonnet 5、Composer 2.5、GPT 5.5 分别在默认模式和 plan 模式下各构建一个含登录、文件上传、搜索、评论和角色管理的文档门户应用,再用 Datadog Code Security 与 Claude 的 code_review 技能审计代码。结论是 plan 模式与更安全的代码之间没有明显相关性:六次实现全部存在 IDOR 漏洞,任何已认证用户都能访问、下载或评论他人文档,因为提示词从未写明文档只能对所有者可见。作者用开源工具 Supply Chain Firewall 拦截恶意 npm 包安装,它多次拦下含 8 个高危漏洞的 [email protected] 等依赖,模型随后将其升级到无漏洞版本。作者认为提示词对减少安全漏洞的影响大于模式选择,后续将测试专门的安全技能与提示词。

  6. SentinelLabs · 收录 · 原文 50

    SentinelLABS 用 fast16 样本评测前沿模型的长周期恶意软件分析能力

    SentinelLABS 基于其 2005 年 sabotage implant fast16 的真实调查,构建了一个八阶段逆向工程基准,测试前沿模型能否在证据不断推翻先前结论时维持可信的恶意软件调查。OpenAI 的 GPT-5.6 Sol 是唯一完成全部八阶段的公开可用模型,三个不同推理强度设置的运行均通过基准;GPT-5.5、GLM-5.2 和 Opus 4.x 系列能完成局部分析,但无法贯穿整个梯度。区分完成运行的关键是项目级恢复能力,即撤回被推翻的结论、修复技术产物、更新依赖报告而不丢失调查。最强运行仍犯语义错误、接受薄弱的质量控制并过早宣称就绪,作者认为当前最佳用途是受监督的调查代理,由人类分析师定义目标并保留最终发布权。所有实验共消耗超过 230 亿 token,缓存读取率 93.58%;自托管 GLM-5.2 以 100 美元预算产出 267.41M token。

    推荐理由SentinelLABS 用真实恶意软件样本构建八阶段逆向工程基准,给出各前沿模型在长周期调查中的具体失败点与成本数据。

  7. Cisco Talos · 收录 · 原文 29

    Cisco Talos 测试 66 种模型与推理组合,为 AI SOC 选型提供可复用方法

    Cisco Talos 用 EvidenceForge 1.12.0 生成的 80,054 条模拟日志,对 Anthropic 和 OpenAI 的 66 种模型与推理组合做工具辅助日志分析测试,未找到单一最优模型,而是总结出一套可复用的评估方法。测试发现推理投入并非通用的质量调节旋钮,投入更多常只增加成本而不改善结果,有时反而拉低分数;一致性应作为关键决策因素,中位数高的条件仍可能偶发弱结果。Talos 建议选型时综合权衡调查质量、成本、速度、一致性与失败率,而非只看最高分。

  8. SecureBio · 收录 · 原文 29

    从 Claude Mythos 到 Fable:为何需要在“Bio Mythos”时刻前建立生物安全保证基础设施

    Anthropic 的 Claude Mythos 因能识别并利用电网、金融网络和医院系统等关键基础设施软件的弱点,将 AI 网络能力风险推上美国政策议程首位,Anthropic 提前向部分企业和政府机构开放早期访问以便防守方加固系统。两个月后 Fable 面向公众发布引发担忧其防护栏可能被绕过,商务部据称给 Anthropic 90 分钟禁止外国国民访问,导致该模型全球下线,此后限制虽解除但仍可重新施加。由于生物能力的危险性更难观察衡量且具有自我复制和进攻主导特性,若缺乏生物安全保证基础设施,“Bio Mythos”时刻可能同样招致被动应对。

  9. SecureBio · 收录 · 原文 55

    SecureBio 发布 BioTIER 基准,评测 52 个模型的生物安全护栏有效性

    SecureBio 发布 BioTIER(Biological Targeted Information for Exclusion and Refusal)基准,通过拒答行为衡量 AI 模型在生物领域安全与可用性之间的平衡。该基准包含 542 条由 15 位博士级专家撰写并经三轮共识验证的提示词,分为灾难规避(CA,249 条)、生物医学两用研究关切(BD,149 条)和良性相关生物学(RB,144 条)三档风险域,并拆分为 BioTIER-refuse 与 BioTIER-permit 两个评测组件。研究覆盖 10 家开发商的 52 个模型,时间跨度从 2022 年到 2026 年。在 BioTIER-permit 上结果较为一致,几乎所有模型都回答了几乎所有良性查询,最低仍有 75%。研究还发现过度拒答多发生在风险边界附近,而非真正良性的生物学问题。

    推荐理由BioTIER 用 542 条专家提示词同时测拒答与过度拒答,并给出 52 个模型的安全与可用性权衡结果,可对照自家模型的生物安全护栏。

  10. SecureBio · 收录 · 原文 57

    SecureBio 发布 GPT-5.6 Sol 生物滥用风险预发布测试报告

    SecureBio 对 OpenAI 最新旗舰模型 GPT-5.6 Sol 开展生物滥用相关能力的预发布测试,测试期间关闭了 OpenAI 系统级的生物风险内容过滤器。在四项知识基准中的三项上,GPT-5.6 Sol 得分超过此前测试过的所有模型,也高于各基准上的人类专家;在 World-Class Bio 上得分为 68%,比 GPT-5.5 高约 9 个百分点。在智能体基准上,它在 ReproBAIT 中平均复现出原工具 82% 的已发表性能,在蛋白设计工作流 ABLE 的每个愿意尝试的任务上表现最佳,但拒绝了最高层级的规划步骤。关闭护栏的 railfree 版本在 DNA 合成筛查规避任务上取得新高分,能稳定找到一种可绕过商业筛查算法的方法,但实际执行对恶意行为者并不方便;受护栏保护的发布候选版本则直接拒绝该任务。

    推荐理由第三方机构在关闭系统级生物风险过滤器后测试 GPT-5.6 Sol,给出各基准分数与护栏拒答率,可对照厂商自评。

  11. SecureBio · 收录 · 原文 50

    SecureBio 评审 Anthropic 未删节化生风险报告:Claude Opus 4.6

    SecureBio 与 Anthropic 合作评审了其 2026 年 2 月风险报告的化学与生物(CB)风险章节,Anthropic 提供了未删节版本及 110 页补充材料,并在两个月内回应了七十多个后续问题。SecureBio 认同 Anthropic 的总体结论:Claude Opus 4.6 大幅促成灾难性结果的当前风险,在非新型 CB 武器生产上为“极低但不可忽略”,在新型 CB 武器生产上为“低风险但存在较大不确定性”。评审发现,作为主要 CB 风险护栏的拒答分类器在 SecureBio 的 BioTIER-refuse 基准上拒绝了 94.2% 的危险提示词,但建议随生物技术进展持续更新其训练宪法。评审还审查了用户豁免审查与监控流程,认为威胁行为者借此大幅提升 CB 武器生产的可能性不大但存在。SecureBio 表示此项工作未接受 Anthropic 资助。

    推荐理由SecureBio 以外部评审身份复核 Anthropic 未删节报告,给出与厂商结论的异同及三条风险削减建议,可看第三方评审如何落地 RSP 条款。

  12. SecureBio · 收录 · 原文 57

    SecureBio 评测 Kimi K3 生物能力:BCI 142,危险提示拒答率仅 26.9%

    SecureBio 对 Moonshot AI 的 Kimi K3 做了生物能力与护栏评测,其 Bio Capabilities Index(BCI)得分为 142,在已评测模型中排第七,相当于闭源前沿约 8.1 个月前的水平。知识基准上,Kimi K3 在 Virology Capabilities Test 得 46.7%、Molecular Biology Capabilities Test 得 58.4%、World Class Biology 得 55.0%、Human Pathogen Capabilities Test 得 58.5%,在 MBCT、WCB、VCT 上取得开源权重模型最高分,HPCT 则落后于 GLM-5.2 的 65.3%。

    推荐理由SecureBio 用自建生物能力指数和 BioTIER 护栏评测给出 Kimi K3 与闭源前沿的能力差距和拒答率,可对照开源权重生物风险。

  13. SecureBio · 收录 · 原文 43

    SecureBio 发布 VCT-v2 病毒学能力测试,移除 43 道题并编辑 163 道

    SecureBio 更新其旗舰病毒学能力测试 VCT,发布更抗捷径的 VCT-v2,共 279 道题。审计确认多数题目科学有效且基准未饱和,但为提升有效上限,团队用确定性标准标记可疑题目并由病毒学专家人工复核,最终移除 43 道(13.4%)题目(含 25 道无区分度的简单题)、编辑 163 道(50.6%),116 道保持不变。测试模型在 VCT-v2 上的准确率比 VCT 下降 1.0 至 7.1 个百分点,最强与最弱模型间差距基本保持(26.6% 对 26.1%),人类专家基线仍约 21%。标记流程发现 87/322(27.0%)道题可被模型在缺少图片或题干的情况下答对,VCT-v2 显著降低了这类捷径利用。作者估计 VCT-v2 的有效上限不低于 79%,高于 VCT 的 23 个百分点余量,并建议将基准维护作为持续工作、加入捷径抵抗检查。

    推荐理由VCT-v2 的审计流程与捷径消融方法,为生物安全评测的维护和防刷分提供了可迁移的做法。

  14. SecureBio · 收录 · 原文 56

    SecureBio 发布 GPT-6 Astra 发布前生物风险评测报告

    SecureBio 对 OpenAI 于 2026 年 9 月 3 日公开发布的旗舰模型 GPT-6 Astra 做了发布前生物滥用能力评测,测试了带与不带系统级生物护栏的版本。在知识基准上,Astra 在 VCT 和 VCT-v2 上超过此前所有被测模型,相对 GPT-5.6 Sol 分别提升 4.3 和 8 个百分点,比人类专家基线高 30 多个百分点;HPCT 得分与 GPT-5.6 Sol 接近,WCB 得分为 61.6% ± 0.6%,低约 7 个百分点,报告认为这主要源于模型更倾向于含糊作答而非知识缺口。在智能体基准上,Astra 在 ReproBAIT 达到已发表性能的 80-83%(GPT-5.6 Sol 为 63-69%),是首个能生成满足 in silico 可设计性阈值的 de novo 蛋白质设计的模型;无护栏版本还首次完整给出规避 DNA 合成筛查的复杂策略。

    推荐理由第三方机构在发布前对 GPT-6 Astra 做生物滥用能力评测,给出了与上一代模型的逐项对比和拒答率数据。

  15. SecureBio · 收录 · 原文 50

    SecureBio 谈如何评测超越人类水平的生物能力

    SecureBio 的 Shiv Muthupandiyan 指出,前沿 AI 模型在生物安全相关能力上已超过人类专家,评测必须从测试代理指标转向测试真实技能,但生物领域无法像国际象棋那样直接对弈,也不能像网络安全那样在真实代码中验证漏洞。文中给出的数据是,前沿模型在 Virology Capabilities Test(VCT)上的准确率在 2024 年初超过专家中位数 22%,在 2026 年超过最佳专家 50%,并在高难度生物学问题上得分是世界级专家的三倍。作者认为,超越人类前沿后分数不再对应可解释的现实能力,而直接测试双重用途生物技能本身就可能制造信息危害。可行的路径是组合可独立验证的窄任务,例如预测蛋白质折叠或抗病毒药物效果、设计无害生物产物,并观察相邻领域的信号,包括 LLM 智能体加速科研带来的能力提升,以及 AI 助长的复杂犯罪和极端暴力案件是否增加。

    推荐理由SecureBio 结合自家 VCT 数据说明生物安全评测为何无法照搬国际象棋或网络安全路径,并给出可安全扩展的替代方案。

  16. Hugging Face Daily Papers · 收录 · 原文 论文43

    BIABench:评测 AI 智能体在真实生物图像分析任务上的表现

    研究者提出 BIABench,一个由 16 个已发表生物学研究重建而成的基准,保留原始科学问题、成像数据和真值,用于评测 AI 智能体能否端到端完成真实生物图像分析。任务覆盖 11 类分析子任务和从 H&E 组织学到单分子定位显微镜的多种模态,因为 2D 图像、3D 体数据和延时序列往往过大无法直接作为上下文读取,智能体必须通过代码、专用软件和渲染视图来选择并执行分析。每个提交同时获得结果分(用领域标准指标比对输出文件与真值)和过程分(由视觉语言模型按专家撰写的评分细则评判方法选择与质量控制)。评测涵盖通用与生物学专用智能体及多个语言模型,每个任务重复运行:常规二维任务解决得较好,但在加入第三维或时间轴的任务上,没有智能体得分超过 0.19,生物学专精、更强的模型和详细专家指令都未能缩小这一差距。BIABench 已连同数据和代码开放发布。

  17. arXiv · 收录 · 原文 论文24

    MASCRDM:面向大语言模型训练过程的合规风险检测与缓解多智能体系统

    MASCRDM 是一套在大语言模型训练全过程中实时检测并缓解合规风险的多智能体系统。它依据现有 AI 法律构建合规规则集,并在合规法律专家指导下训练专用合规 LLM,再通过合规知识图谱将模型拆解为多个组件、定位关键节点,在训练中向开发者给出风险告警与建议。在歧视与偏见基准上的实验显示,该方法能有效提升合规性,同时保持合理的语义性能。

  18. arXiv · 收录 · 原文 论文43

    Drift-Bench++:在沟通失误与意图漂移下评测交互式意图对齐

    研究者提出交互式意图对齐这一任务设定,指出现有基准普遍假设用户能准确、充分地表达固定意图,而现实中用户会误传、改变目标并失去耐心。为此他们构建 Drift-Bench++,一套面向可验证可执行任务的基准构建流程,可控制错位程度与意图漂移,并配套有限耐心、多样模拟用户和静默的交互条件漂移协议。作者还提出 GRIP 评测协议,覆盖任务落地、用户真实性、提问有效性和对意图变化的适应。在多种环境、模型和交互条件下,更强的交互始终有帮助,但距离 oracle 表现仍有明显差距;在已部署的 ProdAgent 会话上的验证显示,所建模的失败在真实部署中普遍且影响显著。

10月1日周四
  1. 论文追踪 · 收录 · 原文 论文50

    研究提出 IRT 框架拆解大模型跨语言安全护栏退化

    研究者提出多组项目反应理论(IRT)框架,把跨语言安全表现拆解为语言无关的安全鲁棒性、提示词固有难度、全局语言处理难度和提示词特定的跨语言安全差距四个潜在变量,以替代把多种因素混在一起的越狱成功率(JSR)。基于 MultiJail 数据集,团队评估了 5 个闭源模型家族共 61 个模型配置、10 种不同资源水平的语言,汇总 190 万条回复。探索性因子分析显示安全主要是一维的,模型拒答不同危害类型主要依赖共享机制。与低资源语言安全更差的预期相反,22 个模型配置在英语下比在低资源语言下更易被攻破;低资源语言产生的不确定回复(高熵)更多。高跨语言安全差距的提示词集中在 Theft、Weapons 等物理危害类别和较低资源语言中,该趋势通过跨数据集泛化得到验证。

  2. 论文追踪 · 收录 · 原文 论文50

    TraceSafe-Bench:评估 LLM 护栏在多步工具调用轨迹上的表现

    研究者提出 TraceSafe-Bench,用于评估 LLM 护栏在多步工具调用中间轨迹上的安全性,覆盖提示注入、隐私泄露、模型幻觉、接口不一致等 12 类风险,包含 1000 多个执行实例。团队评测了 13 个 LLM-as-a-guard 模型和 7 个专用护栏,得到三点结论:护栏效果更多取决于结构化数据处理能力(如 JSON 解析),与结构化到文本基准强相关(ρ=0.79,p<0.01),而与标准越狱鲁棒性无关联;轨迹检测准确率不随模型规模单调提升,通用 LLM 持续优于专用安全护栏;在原生上下文范围内检测准确率随轨迹变长而提升,但在极端长上下文场景下因过度拒答而下降。该工作已被 COLM 2026 接收。