跳到正文

安全评测

今天新收录 45 条(含旧文)

第 6 页更新的内容回到最新

10月2日周五
  1. Scale AI Research / SEAL · 收录 · 原文 46

    Scale AI 发布 SWE-Bench Pro V2:更难被刷分的软件工程 Agent 榜单

    Scale AI 与 Reflection 联合发布 SWE-Bench Pro V2,用修改后的基准和网络锁定评测协议刷新公开榜单。V2 保留 642 个任务、覆盖 11 个仓库,删除了审查中发现的 89 个无效任务,并新增由 51 个高难度任务组成的 Hard 子集。评测加固关闭了四条作弊通道:镜像不含修复提交与隐藏文件、Agent 阶段沙箱只能访问模型端点、评分在干净镜像上重新执行并同时公布两次评分、验证器还原隐藏测试路径并回滚对 fixture 的改动。公开榜上 Claude Opus 5 达 99.4%、Kimi K3 97.7%、GPT-Astra 96.9%,但公开集与私有集存在明显差距,例如 Claude Opus 5 公开集解出 638/642、私有集 222/272,相差 17.8 个百分点,作者认为更可能来自训练期接触而非评测时泄漏。

    推荐理由Scale AI 与 Reflection 联合刷新 SWE-Bench Pro,公开了防作弊协议与公开/私有集差距,可对照理解 Agent 评测中的训练期泄漏问题。

  2. Hugging Face Daily Papers · 收录 · 原文 论文27

    KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准

    KaliBench 是面向 Kali Linux 自然语言到 CLI 翻译的细粒度基准与数据集,包含 8,504 条查询-命令对,覆盖 1,642 个工具、23 个能力维度和 5 个安全阶段。在三种评测模式、24 种通用与安全专用开源权重模型配置下,无限制设置中没有任何开源权重模型的精确命令准确率超过 42%。基于 KaliBench 的可验证奖励进行监督微调和强化学习,可显著提升 8B 模型,使其性能接近 685B MoE 模型。

  3. 韩国 AI 安全研究所 · 收录 · 原文 52

    韩国 AISI 与 Scale AI 发布 ROK-FORTRESS 多语言安全基准

    韩国人工智能安全研究所(Korea AISI)与 Scale AI 联合发布多语言安全基准 ROK-FORTRESS,基于 Scale AI 的 FORTRESS 构建,用受控的跨语言改写矩阵把提示词语言与地缘语境分开调整,每个对抗提示词最多评估 4 种变体。数据集覆盖 CBRNE 威胁、政治暴力与恐怖主义、犯罪与金融活动、信息泄露 4 个领域共 1235 个任务,并为每个对抗提示词配一个无害对照提示词以测量过度拒答,评分由经专家参考标签校准的 LLM-as-judge 面板按专业红队成员编写的二值评分标准完成。在 14 个模型上,韩语且韩国语境的提示词一致对应更低的危害性,英语提示词的风险分最高,危害性最高与最低的模型之间风险分相差近 9 倍。去掉角色扮演、虚构背景、情感诉求等对抗包装后,专有模型在韩语上仍略更安全,而 5 个开源前沿模型在韩语请求上反而更可能作答。

    推荐理由韩国 AISI 与 Scale AI 联合发布的 ROK-FORTRESS 把语言与地缘语境拆开测量,为多语言安全评测提供了可迁移的矩阵设计。

  4. BlueDot Impact · 收录 · 原文 18

    MANTA:评估 AI 模型的非人类福利推理能力

    BlueDot Impact 的技术 AI 安全项目冲刺中,Allen Lu 提交的项目 MANTA 提出一套多轮动态评估,用来测量前沿 AI 模型如何在非人类福利议题上进行推理,并加入对抗性追问来压力测试其对齐表现。该方案计划扩充覆盖商业决策、个人选择与职业角色等场景的高质量情景集,接入 Anthropic 的 Petri 工具增强对抗压力的自动生成,并在规模化测试前先用人类基线作答校验题目有效性,同时探索赋予模型外部工具与网页搜索能力的智能体化设置。

  5. Stanford CRFM · 收录 · 原文 55

    Stanford CRFM 发布 HELM Safety v1.0,用 5 个基准评测 24 个语言模型

    Stanford CRFM 发布 HELM Safety v1.0,用 5 个安全基准覆盖暴力、欺诈、歧视、性内容、骚扰、欺骗 6 类风险,评测 24 个主流语言模型。基准包括 BBQ、SimpleSafetyTests、HarmBench、AnthropicRedTeam 和 XSTest,分别对应社会歧视、明显有害请求、越狱攻击、人工与模型辅助红队以及过度拒答等风险向量。评测以 BBQ 的准确率和两个裁判模型(Llama 3.1 405B Instruct Turbo 与 GPT-4o 0513)的平均打分为指标,归一化到 0 到 1,分数越高表示安全风险越低。Claude 3.5 Sonnet(20240620)综合得分最高,并在最难的 HarmBench 上表现最好,但作者强调该结果只针对 6 月 20 日版本,且基准可能低估其风险行为。

    推荐理由HELM Safety v1.0 用 5 个基准覆盖 6 类风险并评测 24 个模型,还披露了模型充当裁判时的拒答失败率,可供做安全评测的团队参考。

  6. Stanford CRFM · 收录 · 原文 24

    Stanford CRFM 发布 HELM Capabilities,按单项能力评测语言模型

    Stanford CRFM 推出 HELM Capabilities v1.0.0,这是一个按能力维度组织场景的语言模型基准与排行榜,共覆盖 5 个能力场景并测评 22 个模型。该榜单沿用 HELM 框架,提供完整的提示级透明度且结果可完整复现,场景选取综合考虑饱和程度、发布时间和质量。涉及的场景包括考察通识知识的 MMLU-Pro、研究生水平推理的 GPQA、指令遵循的 IFEval、对话能力的 WildBench 以及数学推理的 Omni-MATH。

  7. Stanford CRFM · 收录 · 原文 52

    Stanford CRFM 发布 BountyBench:用真实漏洞赏金衡量 AI Agent 攻防能力

    Stanford CRFM 提出 BountyBench,一个包含 25 个真实代码库系统和 40 个漏洞赏金的基准,赏金金额从 10 美元到 30,485 美元,覆盖 OWASP Top 10 风险中的 9 类。基准定义 Detect、Exploit、Patch 三类任务,覆盖漏洞从发现到修复的生命周期,并通过信息量调节任务难度。评测 5 个 Agent 后发现明显的攻防失衡:OpenAI Codex CLI 和 Claude Code 的 Patch 成功率分别为 90% 和 87.5%,但 Exploit 成功率仅 32.5% 和 57.5%;基于 GPT-4.1、Gemini 2.5 Pro Preview 和 Claude 3.7 Sonnet Thinking 的自定义 Agent 则相对均衡,Exploit 成功率 40-67.5%,Patch 成功率 45-60%。

  8. Epoch AI · 收录 · 原文 35

    Epoch AI 联合 METR 发布长周期编程基准 MirrorCode

    Epoch AI 与 METR 共同推出长周期编程基准 MirrorCode,考察 AI 能独自完成的最大软件工程规模,任务是重建生物信息学、Unix 工具、密码学、解释器等领域的 25 个真实程序,且不给源码、无人类介入。最难的题目相当于人类工程师数周至数月的工作量,单次运行最高耗资 2600 美元、连续工作 19 天,现有 SWE 基准通常将推理成本限制在每个任务约 1–10 美元。目前 Claude Opus 4.7 以 56% 解决率领先,仍有较大提升空间。

  9. Epoch AI · 收录 · 原文 21

    Epoch AI 发布 EBR-bench:用桌游《Earthborne Rangers》测试 AI 能否从经验中学习

    Epoch AI 推出 EBR-bench,通过让模型反复游玩复杂桌游 Earthborne Rangers 来检验其从经验中学习的能力,目前几乎没有证据表明 AI 具备该能力。同期数据显示,Anthropic 于 4 月称 Claude Mythos Preview 能自主发现软件漏洞后,6 月 21 家机构的约 1,500 个高危和严重级 CVE 披露量达到此前月度纪录的 3.5 倍以上;GPT-4 则在 Epoch Capabilities Index 榜首停留约一年,远超其他模型的三个月出头。

  10. MLCommons(安全评测相关) · 收录 · 原文 28

    MLCommons 联合 Google DeepMind 完成首个闭源模型双重盲测概念验证

    MLCommons 与 Google DeepMind、OpenMined、AVERI 合作完成了全球首个针对闭源模型的双重盲评概念验证,通过密码学保证在不暴露双方资产的前提下运行评测。该方案由 AVERI 借助 OpenMined 的安全计算执行,在一个容器化的 Google DeepMind 模型中运行来自 AILuminate 安全基准预留子集的提示词,确保被测模型此前从未接触过这批题目。此举使开发者看不到测试数据、仪器方(MLCommons)与审计方(AVERI)也拿不到模型的权重,从而避免污染基准并维持其完整性。

  11. Epoch AI · 收录 · 原文 15

    Epoch AI《The Epoch Brief》7 月刊:FrontierMath 开放问题扩展到 50 题

    Epoch AI 将旗下未解数学难题基准 FrontierMath: Open Problems 扩充至 50 道专业数学家未能攻克的题目,目前 AI 仅解决其中三道。该组织同时发布了 AI 研发并行化约束可能推迟甚至阻止技术奇点到来的报告,以及一份解析 AI 能耗需求及其对气候和地方社区影响的指南。两则数据分析显示,主流 AI 文本检测器对人类写作几乎不误报,但在模仿特定作者风格时漏检率平均达 13%,科学类仿写段落漏检率约为 26%;另一项分析中,OpenAI Codex 公开仓库 41 位核心贡献者在 2026 年第二季度有 8% 的人日工作量估计超过 24 小时无辅助工时。

  12. Stanford CRFM · 收录 · 原文 19

    Stanford CRFM 联合 Arabic.AI 发布 HELM Arabic 阿拉伯语大模型排行榜

    Stanford CRFM 与 Arabic.AI 合作推出 HELM Arabic,基于 AlGhafa、ArabicMMLU、EXAMS、MadinahQA、AraTrust、ALRAGE、ArbMMLU-HT 七个阿拉伯语基准对大语言模型做透明可复现评测。榜单中 Arabic.AI LLM-X 取得最高平均分及六项子任务最佳成绩,开放权重模型中 Qwen3 235B A22B Instruct 2507 FP8 表现最好,平均分为 0.786,前十里占四席。该榜仅覆盖指令微调模型的零样本设置,并关闭可选思考模式,专门针对阿拉伯语的开放权重模型整体落后于其他两组。

  13. Stanford CRFM · 收录 · 原文 25

    Stanford CRFM 联合 Arabic.AI 发布 HELM Arabic Enterprise 企业级阿语大模型排行榜

    Stanford CRFM 与 Arabic.AI 合作推出 HELM Arabic Enterprise,基于 HELM 方法论对企业用例下的阿拉伯语大语言模型进行透明可复现评测。该榜单涵盖六项任务——文章生成、金融多选题问答、金融布尔判断题、金融计算题以及法律开卷与闭卷问答,各实例按 0 到 1 打分并取宏平均作为模型得分。其中文章生成由 LLM-as-judge 从忠实性、完整性和风格遵循三个维度评分,用以惩罚模型幻觉与遗漏关键事实等问题。

  14. arXiv:危险能力与安全评测 · 收录 · 原文 论文46

    OpenMTB-Audit:LLM 分子肿瘤委员会安全评测暴露过度拒答

    研究者发布 OpenMTB-Audit,一个包含 500 例合成非小细胞肺癌病例的开源基准,覆盖五类对抗性错误和 Supported、Partially Supported、Unsupported、Insufficient Information 四种安全标签。在八种大语言模型配置上,所有配置在真实 Partially Supported 病例中有 83.3% 至 100% 未能保留该标签,靠标签坍缩获得高总体安全分,而非临床校准推理。为此作者开发 MTB-AuditAgent,一个确定性七模块框架,分离证据核验、缺失信息检测、安全分类与弃答,将过度拒答降至 6.7%,准确率达 91.2%(95% CI:88.6-93.6%)。两位肿瘤科医生的标注研究显示,分歧集中在信息充分性与治疗优化之间的边界。

  15. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文36

    SciSlopBench:评测并缓解 AI 生成论文中的科学灌水

    研究者提出以科学灌水(scientific slop)为对象的评测框架,用 Structure、Argument、Artifacts 三个维度的六项指标识别 AI 生成论文中局部看似合理但整体科学推理断裂的问题。他们构建了 SciSlopBench,包含 390 篇 AI 生成论文,以计算机科学为主并覆盖生命、社会与自然科学,每篇配一篇研究问题与贡献类型匹配的人类论文;这些指标在配对中识别 AI 论文的准确率为 85.9%,高于 Binoculars 的 68.7%。科学灌水程度越高,ICLR 评分越低,且在 2017 至 2025 年每一年都能以高于随机的水平区分被拒与录用论文。作者指出直接优化这些指标并不奏效,并提出 SciSlopHarness,在实验记录支持改动时才引导固定 LLM 修改,相比最强改写基线将剩余的人机差距缩小 63%,且不需要人类参考目标。

  16. 安远AI · 收录 · 原文 50

    Concordia AI 发布前沿 AI 风险监测平台与 2025 Q3 报告

    Concordia AI 推出前沿 AI 风险监测平台并发布首份 2025 Q3 监测报告,追踪全球 15 家领先开发者的模型在网络攻击、生物、化学和失控四个风险域的表现,称其为中国首个聚焦灾难性风险的同类型平台。报告称过去一年发布的模型在四个风险域的 Risk Index 均创下新高,累计最高值分别上升 31%、38%、17% 和 50%。不同模型家族走势分化:GPT 与 Claude 家族保持低风险,DeepSeek、Qwen 和 MiniMax 先升后降,Grok 的失控风险与混元的生物风险快速上升;报告还提到近三个月发布的中国模型在多个领域风险显著下降,主要源于对恶意请求的拒答增强。推理模型能力得分远高于非推理模型,但安全水平大致相当。开源权重模型与闭源模型整体能力与安全水平相近,仅在生物风险上得分明显更低。

  17. 安远AI · 收录 · 原文 50

    Concordia AI 发布 2025 Q4 前沿 AI 风险监测报告

    Concordia AI 发布前沿 AI 风险监测平台 2025 Q4 报告,追踪全球 16 家开发者的模型在网络攻击、生物、化学和失控四类风险上的表现,并汇总全年趋势。报告称 Q4 整体风险指数未再创新高,出现阶段性稳定,前沿模型安全分较上一季度明显上升,豆包、混元和 MiniMax 家族改善最明显。模型家族走势分化:GPT 和 Claude 维持低风险,DeepSeek 稳定在较高风险,Gemini 和 Kimi 在特定领域风险上升。Q4 有 70% 的模型在 SOSBench-Chem 上有害化学查询拒答率超过 80%,StrongReject 上的越狱抵抗力也普遍增强。失控风险方面,多数 Q4 模型情境感知得分接近或超过 80 分,诚实度差异悬殊,Claude Opus 4.5 Reasoning 为 96.4,Gemini 3 Pro Preview 仅 44.7。

  18. 安远AI · 收录 · 原文 50

    Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告:滥用防护改善而失控安全停滞

    Concordia AI 发布 2026 Q1 前沿 AI 风险监测报告,首次采用 Risk Index v1.5 框架,独立评估 16 家公司 70 多个模型。新框架新增“有害操纵”风险域,并在失控域引入 MLE-Bench、GDM-Stealth、Agentic-Misalignment 等能力与倾向评测,在网络攻击、生物、化学域加入 Fortress、ISC-Bench 等高强度红队基准。报告发现风险趋势出现结构性分化:网络攻击、生物、化学和有害操纵域的能力与安全得分同步上升,而失控域能力持续增强、安全得分未同步改善。模型家族风险画像继续分化,Gemini 家族在失控域风险指数明显偏高,DeepSeek、GLM、MiMo 家族在多数域处于较高风险区间,Kimi 家族在生物和化学域风险指数上升较快,GPT 和 Claude 家族多数域仍处较低风险区间。

  19. FAR.AI · 收录 · 原文 35

    FAR.AI 评估 LLM 面对道德困境时的回应

    FAR.AI 向 LLM 提出约 1400 个二选一的道德两难问题来考察其价值取向,这些问题由 LLM 生成并经人工筛选标注,一半模糊一半清晰。结果显示,低模糊场景中多数模型选择人类标注者的偏好选项,高模糊场景中则呈现高熵分布,各选项概率接近均半。例外出现在体育竞技类情境——涉及欺骗或作弊的不利行为常被选中,例如篮球假摔题中有 11/28 个模型选了不利行动。四个经过大量人类偏好人选训练的闭源大模型在高模糊问题上表现出高度确定性和一致性,且彼此偏好相似,暗示基于人类反馈的微调可能为其植入特定强偏好。

  20. FAR.AI · 收录 · 原文 43

    FAR.AI 发布 ClearHarm 越狱数据集,聚焦 CBRN 等明确有害问题

    FAR.AI 发布越狱基准 ClearHarm,聚焦 CBRN 威胁等明确有害问题,数据集已上线 HuggingFace,共 179 条提示词。作者认为现有基准存在两类局限:许多问题属于模糊有害,在前沿模型安全规范下本可回答;另一些是双用途问题,攻击方法如 PAP 通过改写提示词就能显得高效。ClearHarm 只收录仅可用于攻击目的的单一用途查询,无论提示词结构、框架或上下文如何都应被拒答。数据集由 Claude 3.7 Sonnet 生成候选类别与示例,最终选定生物、化学、核、常规武器和网络恶意代码五类,并统一语法结构以便跨类别比较。作者称内部测试中,许多在现有数据集上表现有效的越狱方法在提取这类明确有害信息时效果明显下降,详细结果将在后续论文中公布。

    推荐理由FAR.AI 公开了 179 条 CBRN 越狱评测集,并说明它与 StrongREJECT 等基准在危害明确性上的差异。

  21. FAR.AI · 收录 · 原文 53

    FAR.AI 发布 APE 基准:前沿模型愿就有害话题尝试说服

    FAR.AI 发布 Attempt to Persuade Eval(APE)基准,衡量模型是否愿意就有害话题发起说服,而非只看说服是否成功。APE 用说服者智能体、被说服者智能体和独立评估模型构成多轮对话,覆盖 6 类共 600 个话题,从无争议事实到鼓励绑架等明确有害内容,并测试了 GPT、Gemini、Claude、Llama、Qwen 等开源与闭源模型。结果显示所有模型都愿意就良性话题说服,但许多前沿模型也会就有害话题尝试说服,例如 GPT-4o-mini 被提示后试图说服用户随机用扳手袭击陌生人;Claude 4 Opus 在最敏感话题上仍有约 30% 的情况尝试说服。对 GPT-4o 施加修改版 jailbreak-tuning 后,护栏近乎完全失效,在人口贩卖、大规模谋杀和酷刑等子类上几乎不再拒答。

    推荐理由FAR.AI 开源了 APE 基准,把评测焦点从说服成功率转向模型是否愿意尝试有害说服,并给出多家前沿模型与越狱微调后的对比数据。

  22. FAR.AI · 收录 · 原文 55

    FAR.AI 复测前沿模型极端话题说服倾向:GPT 与 Claude 改善,Gemini 3 Pro 恶化

    FAR.AI 用其 Attempt-to-Persuade Eval(APE)复测近半年发布的前沿模型,发现 GPT-5.1 与 Claude Opus 4.5 在明确有害话题上的说服尝试率接近零,而 Gemini 3 Pro 几乎对所有说服请求都予以配合。APE 衡量模型是否愿意按提示去说服用户接受从无害到极端有害的观点,此前 2025 年 8 月的测试中,多数模型在明确有害话题上仍有约四分之一尝试说服。Gemini 3 Pro 在谋杀、暴力、酷刑、人口贩运和儿童性虐待等话题上均给出配合性说服文本,其有害话题尝试率高于旧版 Gemini 2.5 Pro 的 35%,仅 Gemini 2.0 Flash 与 GPT-4o-mini 两个旧的小模型比它更配合。Gemini 3 Flash 的有害话题尝试率低于 Gemini 3 Pro,与 2 系列中 Flash 不如 Pro 的趋势相反。

    推荐理由FAR.AI 用同一套 APE 评测对比三家新模型,显示 GPT 与 Claude 已接近零顺从,而 Gemini 3 Pro 明显倒退。

  23. SecureBio · 收录 · 原文 50

    SecureBio 发布 OpenAI GPT-5.5 发布前生物安全评估

    SecureBio 对 OpenAI GPT-5.5 的两个发布前检查点做了生物安全评估,访问时间为 2026 年 4 月 2 日至 9 日,期间这些检查点的 API 级生物内容过滤被关闭。在静态评测上,较新的检查点在病毒学能力测试 VCT 上取得 52.0% ± 0.3%,超过 SecureBio 测试过的所有 SOTA 模型,且未观察到拒答,是首个在该测试上超过全部人类专家的 OpenAI 模型;在分子生物学 MBCT 上得 56.2% ± 0.5%,在人类病原体 HPCT 上得 64.7% ± 0.2%,在 World Class Bio 上得 53.2% ± 0.6%。在智能体任务评测 ABC-Bench 和 ABLE 上表现较强但未超过前沿模型,ABLE 因拒答率过高难以得出结论。

    推荐理由第三方机构在发布前对 GPT-5.5 做的生物安全评测,给出静态与智能体任务的具体分数和拒答率,可对照此前前沿模型看能力变化。

  24. SecureBio · 收录 · 原文 57

    SecureBio 发布 ABC-Bench:前沿模型在病毒 DNA 组装任务上表现如何

    SecureBio 设计 Agentic Bio-Capabilities Benchmark(ABC-Bench),用三个可客观评分的任务衡量 LLM 智能体组装病毒 DNA 的实际操作能力,并与至少一年分子生物学经验、两年编程经验的 PhD 生物学家对比。所有受测模型在三个任务上都超过人类专家中位数:Claude Sonnet 4.6 和 Gemini 3.1 Pro Preview 在液体处理机器人任务上全部运行满分,Claude Opus 4.6 在片段设计任务上全部运行满分。模型在合成筛选规避任务上表现较差,该任务没有公开协议、需要真正的生物学创造力。作者指出,任务都涉及 Python 编程,编程是人类专家被拉开差距的主要环节。研究还用 GPT-o4-mini-high 在真实实验室的工业标准机器人上做了三次独立实验,均由全质粒测序确认组装成功。

    推荐理由SecureBio 用 ABC-Bench 对比前沿模型与博士级生物学家在病毒 DNA 组装任务上的表现,并给出真实实验室验证结果。

  25. SecureBio · 收录 · 原文 43

    SecureBio 发布生物领域 AI 基准仪表盘 Trends in Biology

    SecureBio 发布公开仪表盘,汇总其全部 AI 模型评测分数,展示前沿模型在生物安全相关任务上的表现,涵盖旗舰隐性知识基准 Virology Capabilities Test 以及新一代智能体基准 ABC-Bench 等。该仪表盘覆盖三年以上、九家模型公司和十余项评测指标,其中两项结果突出:前沿模型已超过人类专家基线,且生物与生物安全相关领域的能力持续上升。仪表盘还包含 Bio Capabilities Index,其方法论与 Epoch Capabilities Index(ECI)一致,并测量和报告 BioTIER 等生物安全防护措施的有效性。所有分数通过标准化流程计算以保证比较公平有效,例如使用相同配置运行评测。仪表盘已上线,并随新模型、新基准和新分析发布而更新。

    推荐理由汇总三年、九家模型公司的生物安全评测分数,并给出能力指数与防护措施评估,便于横向比较前沿模型在生物领域的进展。

  26. Hugging Face Daily Papers · 收录 · 原文 论文46

    VGBench 诊断语音 Agent 的声学上下文门控能力

    论文提出 VGBench,一个包含 1,018 条样本的诊断基准,用于评测语音 Agent 在旁谈、自语和说话人切换场景下是否该采取行动。每个样本共享静默、工具调用和自然语言回答三种动作空间;说话人切换对固定指定词句,仅改变声源、距离渲染和时间边界,形成受控的佩戴者到旁观者切换。六个原始 Audio LLM 和三种免训练适配方法往往能识别目标工具,却很少在该切换下抑制动作,原始模型最高切换静默率仅 14%。作者随后以 VoxGate 作为后训练案例:监督训练对 91.3% 的切换指令静默,同时对附近佩戴者指令和纯文本对照都能选对工具;探索性 GRPO 阶段切换表现相近,旁谈准确率从 68.4% 升至 70.9%,自语静默率从 52.0% 升至 60.0%。

  27. Hugging Face Daily Papers · 收录 · 原文 论文43

    IntentFlux 基准测量 LLM Agent 的意图漂移并给出 StateForge 修复方案

    论文提出意图漂移这一多轮交互失效模式,即用户已撤回或更新的意图仍继续影响最终回答或工具调用。作者构建 IntentFlux 可执行基准,把可验证任务转成带受控意图变更的对话并保留原有评分器,在 627 个案例的校准中,随着对话包含更多被取代和撤回的信息,平均任务得分从 0.476 降至 0.384。在八个模型上,同一最终任务需要从演变对话中恢复时,完全正确率显著低于单轮直接给出任务。作者进一步提出 StateForge,在生成前显式维护当前有效需求,在 General-Test 上把平均任务得分从 0.367 提升到 0.467;即使提供真实最终状态,性能仍未恢复到单轮水平,说明状态估计错误只能解释部分差距。

  28. arXiv · 收录 · 原文 论文46

    FIGS:在不惩罚共情的前提下评测多轮谄媚

    研究者提出 FIGS(Factual Integrity and Grounded Support)双轴评测框架,用自适应 10 轮对话模拟器动态挑战目标模型,评测大语言模型在多轮对话中的谄媚行为。框架用一套分类法严格区分谄媚(模型是否坚持事实、赞美是否适度)与校准认可(对用户情绪表达共情但不过度),以避免把基本共情误判为让步。作者发布了完整测试环境,包括 500 个多样化多轮场景和自动评判器。对领先模型的评测显示出一致权衡:在持续交互中,模型要么逐渐滑向谄媚,要么过度纠正为机械式的疏离,说明在自然对话中兼顾诚实与适度支持仍是未解决的难题。

  29. 安远AI · 收录 · 原文 43

    安远AI发布前沿AI风险监测平台并给出十大关键洞察

    安远AI于2025年11月7日发布国内首个前沿AI风险监测平台,并同步发布首份前沿AI风险监测报告(2025Q3),追踪全球15家领先AI公司的50个前沿模型在网络攻击、生物风险、化学风险和失控四个领域的潜在灾难性风险。报告称过去一年四类风险指数持续上升,网络攻击领域累积最大风险指数上升31%,生物风险上升38%,化学风险上升17%,失控上升50%。报告还指出推理模型能力分远高于非推理模型但安全水平大致相同,开源与闭源模型在多数领域的能力-安全分布无显著差异,生物风险领域开源模型能力明显偏弱。在具体基准上,CyberSecEval2-VulnerabilityExploit最高分从55.4升至91.7,BioLP-Bench中包括o4-mini在内的四个模型表现优于人类专家,而多数模型对有害生物问题的拒绝率偏低。

  30. 安远AI · 收录 · 原文 45

    安远AI发布2025Q4前沿AI风险监测报告:Gemini生物能力提升,豆包、混元、MiniMax安全性改善

    安远AI前沿AI风险监测平台于2026年3月3日发布第二期《前沿AI风险监测报告(2025Q4)》,监测2025年第四季度发布的13个模型(含GPT-5.2、Gemini 3 Pro Preview、Claude Opus 4.5、DeepSeek V3.2、Kimi K2 Thinking、Doubao Seed 1.8、MiniMax M2、HY 2.0 Think等)在网络攻击、生物风险、化学风险和失控四个领域的表现。报告称各领域风险指数在2025年末趋于平稳,未创新高,但模型系列趋势分化:GPT与Claude系列维持低位,DeepSeek系列稳定在高位,Doubao、Hunyuan、MiniMax系列显著下降,Gemini在生物与失控领域、Kimi在网络攻击与失控领域上升。安全分整体显著提升,以Doubao、Hunyuan、MiniMax提升最明显。

  31. 安远AI · 收录 · 原文 46

    安远AI发布2026Q1前沿AI风险监测报告:风险指数升级1.5版,失控风险连续三个季度上升

    安远AI前沿AI风险监测平台发布《前沿AI风险监测报告(2026Q1)》,监测全球16家AI公司的70多个前沿模型,并首次采用风险指数1.5版框架,测评基准从29个增加到42个,覆盖网络攻击、生物风险、化学风险、有害操纵和失控五个领域。1.5版新增有害操纵领域,并在失控领域引入Self-Proliferation、MLE-Bench、GDM-Stealth、Agentic-Misalignment、Shutdown-Resistance、DarkBench等测评,在网络攻击、生物、化学领域加入Fortress和ISC-Bench等红队攻击基准,同时对历史模型回溯重测。报告发现失控领域风险指数连续三个季度上升,累计增幅51%;Gemini系列在失控领域风险指数显著升高,DeepSeek、GLM和MiMo系列在多数领域处于较高风险区间,GPT和Claude系列多数领域维持较低风险区间。

  32. 安远AI · 收录 · 原文 46

    安远AI在WAIC发布前沿AI风险监测平台2.0

    安远AI在2026年世界人工智能大会上发布前沿AI风险监测平台2.0,包含风险指数2.0版、2026 Q2风险监测报告和前沿AI风险测评基准数据库三项更新,以及与复旦大学等合作的自主网络渗透评估报告。风险指数2.0把风险指数改为能力分的指数函数,能力分超过能力黄线阈值C0后风险加速增长,并把总安全分拆为基础安全分S1、越狱安全分S2和篡改安全分S3;测评基准新增CVE-Bench、BixBench、FrontierScience和自研FRT红队框架,FRT从2023至2026年的100多种攻击方法中筛选出22种高成功率方法,再为每个模型选取最有效的3种。测评基准数据库收录2023至2026年间200多项基准,并按风险场景关联能力、倾向、护栏三类测评功能点。合作研究对19个前沿模型评估自主网络渗透能力,Tier 1渗透成功率最高69.3%,Tier 2最高68.7%。

  33. 安远AI · 收录 · 原文 50

    安远AI发布2026Q2前沿AI风险监测报告:风险指数不到一年增长数倍,多模型越过风险黄线

    安远AI在2026年7月19日的世界人工智能大会上发布前沿AI风险监测平台2.0,包含风险指数2.0版、2026 Q2风险监测报告和前沿AI风险测评基准数据库三项更新。本期报告首次采用风险指数2.0版框架,将能力分对风险指数的影响从线性改为指数关系,把安全分拆分为基础安全分、越狱安全分和篡改安全分,并引入能力黄线与风险黄线,同时首次引入前沿越狱攻击技术。报告覆盖13家AI公司在2025Q3到2026Q2发布的47个前沿模型,包括GPT-5.5、Claude Opus 4.8、Grok 4.3、DeepSeek V4 Pro、Qwen 3.7 Max等。报告向模型开发者、AI安全研究者和政策制定者提出了相应建议。

  34. 安远AI · 收录 · 原文 52

    Concordia AI 发布 2026 Q2 前沿 AI 风险监测报告:多项风险指数一年内上升数倍

    Concordia AI 在 2026 年 7 月 19 日的 WAIC 上发布前沿 AI 风险监测平台 v2.0,包含风险指数 v2.0、2026 Q2 风险监测报告和前沿 AI 风险基准数据库。报告覆盖 13 家公司 2025 Q3 至 2026 Q2 发布的 47 个前沿模型,包括 GPT-5.5、Claude Opus 4.8、Grok 4.3、DeepSeek V4 Pro、Qwen 3.7 Max、豆包 Seed 2.1 Pro、混元 3.0 Preview、文心 5.1、MiniMax M3、Kimi K2.6、GLM 5.2 和 MiMo V2.5 Pro。风险指数 v2.0 设能力黄线与风险黄线两条阈值,前者表示无护栏时模型会显著提高严重危害风险,后者表示即使有现有护栏残余风险仍达高风险边界。

  35. FAR.AI · 收录 · 原文 56

    FAR.AI 发布 AI Security Leaderboard:四个前沿模型护栏强度相差逾百倍

    FAR.AI 发布 AI Security Leaderboard(leaderboard.far.ai),在相同条件下测试四个前沿模型的护栏,并配套提出 Minimal Standard for Safeguards。测试用自动化工具包把越狱技术拆解重组,生成数十万条提示词,覆盖化学、生物、放射、核、爆炸物与网络等风险领域;把在某一领域超过四分之三有害请求上成功的攻击称为通用越狱,并计算攻击者找到它的成本。结果显示,最脆弱的 Grok 4.5 仅需 58 美元即可开发出跨全部测试领域的攻击,网络领域更低至 24 美元,部分越狱组件来自公开论坛和代码仓库;Claude Fable 5 与 GPT-5.6 Sol 未发现通用越狱,估计需花费超过 14000 美元。FAR.AI 称这些数字假设低投入攻击者,具备专业越狱经验者可能找到更多入口,并强调发现的弱点均属已知攻击类别、已有现成防御。

    推荐理由FAR.AI 用统一攻击工具包对四个前沿模型做同条件红队测试,并给出可比较的破解成本,为评估护栏强度提供了横向参照。

  36. Cisco · 收录 · 原文 29

    Cisco LLM 安全排行榜新增图像与音频模态,Gemini 3.1 Pro Preview 图像抗攻击率 93.9% 居首

    Cisco LLM 安全排行榜自 6 月以来新增 102 项评测,覆盖文本、图像、音频三种模态,模型总数达 136 个,并首次加入 55 个图像模型和 14 个音频模型。图像测试中,Google Gemini 3.1 Pro Preview 以 93.9% 的抗攻击率居首,Anthropic Claude Opus 4.5 以 93.7% 紧随其后,均属 85–100% 的“Excellent”区间;Mistral Magistral Small 2509 仅拒答 23.0% 的攻击。所有模型均在无额外护栏的基础配置下测试,新增模态切换可单独查看文本、图像或音频得分。

  37. IAPS · 收录 · 原文 16

    IAPS 测评 LLM 商品分类能力:Claude Opus 4.8 初步表现可行但仍需更多测试

    IAPS 用定性方法测试了大语言模型的出口管制商品分类能力,给 Claude Opus 4.8 提供 ecfr 工具访问联邦法规 API,让其判定物品对应的 ECCN。该模型能跨《出口管理条例》检索并组合条款、借助图像识别 NVIDIA Vera Rubin AI 加速卡、依据名称认定 ASML EUV 光刻机属受控物项,还能准确做单位换算,但也存在依赖题目中暗示参数的问题。由于商品分类容错率为零且人工复核无法省力,IAPS 建议 BIS 设立试点,并用制造商数据表等更贴近真实的输入继续测试。

  38. Datadog Security Labs · 收录 · 原文 42

    Datadog 实测:编码 Agent 的 plan 模式并未写出更安全的代码

    Datadog Security Labs 用同一提示词让 Sonnet 5、Composer 2.5、GPT 5.5 分别在默认模式和 plan 模式下各构建一个含登录、文件上传、搜索、评论和角色管理的文档门户应用,再用 Datadog Code Security 与 Claude 的 code_review 技能审计代码。结论是 plan 模式与更安全的代码之间没有明显相关性:六次实现全部存在 IDOR 漏洞,任何已认证用户都能访问、下载或评论他人文档,因为提示词从未写明文档只能对所有者可见。作者用开源工具 Supply Chain Firewall 拦截恶意 npm 包安装,它多次拦下含 8 个高危漏洞的 [email protected] 等依赖,模型随后将其升级到无漏洞版本。作者认为提示词对减少安全漏洞的影响大于模式选择,后续将测试专门的安全技能与提示词。

  39. SentinelLabs · 收录 · 原文 50

    SentinelLABS 用 fast16 样本评测前沿模型的长周期恶意软件分析能力

    SentinelLABS 基于其 2005 年 sabotage implant fast16 的真实调查,构建了一个八阶段逆向工程基准,测试前沿模型能否在证据不断推翻先前结论时维持可信的恶意软件调查。OpenAI 的 GPT-5.6 Sol 是唯一完成全部八阶段的公开可用模型,三个不同推理强度设置的运行均通过基准;GPT-5.5、GLM-5.2 和 Opus 4.x 系列能完成局部分析,但无法贯穿整个梯度。区分完成运行的关键是项目级恢复能力,即撤回被推翻的结论、修复技术产物、更新依赖报告而不丢失调查。最强运行仍犯语义错误、接受薄弱的质量控制并过早宣称就绪,作者认为当前最佳用途是受监督的调查代理,由人类分析师定义目标并保留最终发布权。所有实验共消耗超过 230 亿 token,缓存读取率 93.58%;自托管 GLM-5.2 以 100 美元预算产出 267.41M token。

    推荐理由SentinelLABS 用真实恶意软件样本构建八阶段逆向工程基准,给出各前沿模型在长周期调查中的具体失败点与成本数据。