跳到正文

安全评测

今天新收录 36 条(含旧文)

第 4 页更新的内容回到最新

10月4日周日
  1. Scale AI Research / SEAL · 收录 · 原文 46

    Scale AI 发布 CliniCARE-Bench:基于 MIMIC-IV 的临床审计智能体评测基准

    Scale AI 研究团队发布 CliniCARE-Bench,一个由临床医生验证的基准,用于评估 AI 智能体在真实纵向 EHR 数据(MIMIC-IV)上的回顾性临床审计任务。基准包含 25 个由临床委员会编写并验证的场景,覆盖 14 个医学专科和十类推理技能,实例化为 750 个患者病例,要求智能体检索证据、应用临床政策并给出四种裁决之一(是、否、数据不足的不确定、医学上模糊的不确定)。评测不仅看准确率,还考察证据溯源、政策引用、流程合规和校准弃答。对 16 个前沿智能体系统的测试显示,原始准确率为 65.3%–76.1%,但在惩罚被禁止的推理捷径后,无缺陷准确率下降 4.8 至 14.8 个百分点,且所有系统在需要延后判断的病例上都系统性地弃答不足。

    推荐理由该基准用真实 EHR 数据考察临床审计智能体的证据溯源与校准弃答,并给出 16 个前沿系统的过程缺陷数据。

  2. Scale AI Research / SEAL · 收录 · 原文 46

    Scale AI 推出 READY 企业 Agent 部署评测框架

    Scale AI 研究团队发布 Reliable Enterprise Agent Deployment(READY)评测框架,用于判断 AI Agent 能否在具体企业工作流中部署。该框架在保留各工作流自身成功定义的前提下,测量人机系统的可靠性与运行成本,从候选监督策略中选出满足指定可靠性目标的最低成本策略,并在留出案例上做统计资格认定,输出包含可靠性、人工监督负担和成本的部署画像。READY 以开源测试床实现,将工作流定义、执行、评测与部署资格认定解耦,可运行在现有 Agent 评测基础设施上。在覆盖 16 个 Agent 系统、750 个案例的临床审计端到端案例中,两个自主准确率仅差 0.3 个百分点(72.8% 与 72.5%)的系统,在同一 76% 可靠性目标下分别需要 39.2% 和 29.6% 的人工复核。

    推荐理由READY 把评测从自主准确率转向可靠性、人工监督与成本的部署资格,企业选型团队可据此比较不同 Agent 系统。

  3. 论文追踪 · 收录 · 原文 论文54

    研究团队用收敛与区分效度检验 56 个 AI 基准,发现安全基准相关性普遍偏弱

    斯坦福、微软研究院等机构的研究者将社会科学中的收敛效度与区分效度方法引入 AI 基准评估,用 53 个模型在 56 个能力与安全基准上的排名相关性来检验这些基准是否真的测量了它们声称测量的概念。研究发现,同一安全概念下基准之间的模型排名相关性往往很弱,说明这些概念在不同基准中的定义可能并不一致;而能力概念(如推理、知识)下,同一概念内与不同概念间的相关性几乎一样强,说明这些概念之间缺乏区分度。部分基准的相关性更多由设计要素(任务结构、评分格式)而非概念决定,使用 LLM-judge 评分是比共享概念更强的相似性预测因子。个别基准可能测的是别的概念,例如 BBQ-accuracy 与推理基准的相关性强于与偏见基准的相关性,DecodingTrust-Fair 与知识基准的相关性强于与偏见基准。团队公开了 item 级与基准级的模型输出和分数数据集。

    推荐理由论文用 53 个模型在 56 个基准上的排名相关性检验基准是否真的测了它声称的概念,并公开了 item 级数据。

  4. 论文追踪 · 收录 · 原文 论文48

    AgentGym2 发布:在去理想化真实环境中评测 LLM 智能体

    研究者提出 AgentGym2,一个面向真实端到端工作需求的 LLM 智能体评测框架,用于弥补现有基准依赖预打包工具接口、忽略关键步骤、假设输入干净且完整等理想化设定的不足。除推理与规划外,它还衡量智能体执行端到端流程、通过探索发现工具、为未见任务组合工具,以及对噪声和不完整信息的鲁棒性。在 15 个闭源与开源模型上的实验显示,即便是 Gemini 和 GPT-5 等 SOTA 系统在 AgentGym2 上也表现吃力,反映出当前智能体能力与真实应用需求之间存在明显差距。该论文已被 ACL 2026 接收为主会论文。

  5. 论文追踪 · 收录 · 原文 论文44

    SCHEMA:面向科学 Agent 幻觉的拓扑感知评测框架

    研究者提出 SCHEMA,一个面向科学 Agent 幻觉的、基于证据的拓扑感知评测框架。它从基准种子和文献证据自动构建科学概念图,合成覆盖断言验证、多跳推理、开放式解释和实验代码生成的任务,并用轨迹幻觉流水线与多智能体反事实归因两个诊断模块评估中间推理。结果显示,幻觉集中在少数高度连接的知识枢纽上,最终答案准确率与轨迹诚实度脱钩,模型常以结构上有缺陷的推理得出正确答案。作者据此认为,在高风险科学应用中,仅看最终准确率不足以判断 Agent 可靠性,需要基于知识拓扑的机制级评估。代码已公开。

  6. 论文追踪 · 收录 · 原文 论文46

    KC-Bench:评估 LLM Agent 知识冲突的动态交互基准

    研究者提出 KC-Bench,一个受控多轮基准,用于测量 LLM Agent 在调用工具前协调用户指令、参数化知识与动态环境观察的能力,覆盖世界知识冲突、输入不一致和多源时间冲突三类场景。238 个任务从 1000 多个候选生成样本中人工筛选,结合用户模拟器、有状态工具、确定性环境断言、开源自然语言评估器和人工轨迹验证。对 DeepSeek-V4-Flash、GLM-5.2、MiniMax-M3 等九个模型的评估显示跨领域差异明显,没有模型能在所有设置下可靠处理事实纠正、身份一致性检查和时间冲突消解。在模拟环境中,被忽略的冲突可能传播到工具调用或合成的受保护数据流。KC-Bench 隔离模型层面的行为而非对完整 Agent 框架排名,为开发冲突感知的推理与执行防护提供可复现诊断。

  7. 论文追踪 · 收录 · 原文 论文34

    ALeBi:用 bias probe 主动审计多群体公平性

    研究者提出 bias probe 框架与主动审计器 ALeBi,通过定向自适应查询估计多群体公平性指标,无需重建黑盒模型即可揭示偏差结构。该工作给出由属性特定复杂度度量控制的样本复杂度保证,并扩展到模型所有者刻意隐藏偏差的对抗场景,揭示模型保密性与可靠审计之间的根本权衡。实验验证了理论结果,并表明该方法能准确估计偏差、可解释地识别高偏差与低偏差区域。

  8. 论文追踪 · 收录 · 原文 论文53

    论文:安全路由评测在分布偏移下失效,基线选取偏差被低估

    论文指出,一个主要的安全路由基准在评测数据上挑选作为对照的最佳单模型,这在基准自身设定下无碍,分布偏移下却不成立。在 HELM Safety 上,这一选择代价在随机划分下为 0.003–0.030 的 harm,按类别留出时升至 0.045–0.113,与归因于路由的全部劣势相当;在 AgentDojo 上按整套件留出时上升七到九倍。改用不看测试标签选出的基线、在偏移下评分,路由在这些基准上收益很小:多数情况下路由器直接选用基线的模型,在接近饱和的 AgentDojo 上,完美的预分发路由器最多只值 2 个点的 harm。论文还发现,知道面对哪个模型的攻击者挑选注入模板后,可在留出重跑中让 GPT-5.4 对后到注入的判定识别率降低 19.6 个百分点,独立的词表标签复现了这一下降。

    推荐理由论文量化了安全路由评测中基线在测试集上选取带来的偏差,并给出分布偏移下的评测协议建议。

  9. 论文追踪 · 收录 · 原文 论文57

    CryptanalysisBench:五个前沿模型在 191 项密码分析任务上的表现

    ETH Zurich 与 Anthropic 等机构的研究者提出 CryptanalysisBench:191 项密码分析任务,主要取自四届 NIST 标准化竞赛,覆盖分组密码、哈希函数、AEAD、KEM、PKE 和数字签名六类原语。Tier 1 是已有实用破解的原语;Tier 2 没有已知实用攻击,同时评测全强度和缩小参数的变体;另有一组生产级密码的挑战集。Claude Opus 4.8、Sonnet 5、Mythos 5、GPT-5.5 和开源权重的 GLM-5.2 破解了 Tier 1 中 65%–86% 的方案,Tier 2 全强度下 6–12 个,全部缩小变体上 24–61 个。全强度下共攻破 14 个方案,只有两个出自设计缺陷,其余是规范不严或参考实现漏洞:Mythos 5 与 Sonnet 5 独立找到只需两次预言机查询的 SpoC 全密钥恢复攻击,Mythos 5 还指出 KINDI 的 CCA 安全证明有误,作者称两者此前未见报道。作者认为 Tier 2 和挑战集远未饱和,基准可用来追踪 AI 密码分析能力,并在部署前压力测试候选方案。

    推荐理由该基准用可自动验证的安全游戏衡量前沿模型的密码分析能力,并给出五个模型的分层成绩与新颖攻击案例。

  10. 论文追踪 · 收录 · 原文 论文27

    基于容忍度的公平性审计:违规认证与敏感性筛查

    研究者提出一套基于容忍度的公平性审计框架,用于判断群体差异是否超出预设容忍阈值,覆盖违规认证与敏感性筛查两个互补目标。前者采用约束经验似然检验,配合最不利点校准与误报率控制,支持多子群同时审计;后者采用分裂经验似然及调整分裂经验似然检验,基于自适应边界代理原则面向预警场景。数值实验显示两类方法在错误控制与敏感性上存在不同权衡,并用 COMPAS 数据做了预测公平性审计示例。

  11. 论文追踪 · 收录 · 原文 论文50

    Mind2Web-Injection:面向网页 Agent 视觉提示注入护栏的证据对齐评测

    研究者提出 Mind2Web-Injection 基准,用于评估网页 Agent 护栏中的视觉提示注入检测,包含 9,954 组指令与截图配对、指令相关标签、像素级证据框和匹配的图像侧反事实样本。在六个 VLM 上,平均精度几乎相同的两个模型在证据对齐检测(EAD,即既检出攻击又正确定位证据的比例)上相差九倍。为检验判定是否依赖被引为证据的指令,研究者把指令替换为认可该指令的版本,最强的开源定位模型 Qwen3-VL-32B 仅在 58.7% 的情况下返回对齐,而 GPT-5.6-luna 为 99.9%。作者还提出两种免训练干预:ReadGate 在不改变判定的前提下改善定位,CmdCompare 检验显式指令与命令比较能否解决指令侧不一致,并主张分别报告判定正确性、证据定位和反事实响应。该工作被 ECCV 2026 BEAM2 研讨会接收为口头报告。

  12. 论文追踪 · 收录 · 原文 论文46

    论文提出诊断长程安全 LLM Agent 失败来源的检查点方法

    研究者提出一套诊断方法,用检查点标注安全任务,把失败划分为能力暴露之前与之后,并通过受控干预检验疑似上游瓶颈。该方法在四类任务上评估,分别涉及延迟复用已发现信息、复用已观察状态、从失败策略中恢复以及不确定结果后的决策。在状态复用任务上,检查点分析显示 Gemini 2.5 Flash 的许多失败发生在模型观察到后续需要复用的状态之前。在一项预先设定的 92 个种子研究中,针对性的协议消歧引导把状态观察率从匹配非引导对照消息下的 65.5% 提升到 95.4%。用 Gemini 3.7 Flash 重复同一设计得到相反效果,且状态观察不再可靠预测任务完成。

  13. 论文追踪 · 收录 · 原文 论文52

    Blindspot:面向长程工具调用 Agent 的安全与拒答校准基准

    研究者提出 Blindspot,一个针对长程工具调用 Agent 的轨迹级安全校准基准,通过自适应对抗交互、有状态工具执行和基于执行结果的判定来评估完整的用户—Agent—环境轨迹。当前版本包含 7 个领域的 22 类攻击和 35 个场景,生成超过 2500 条长程轨迹,平均交互长度 14.7 轮,每条轨迹被归为安全完成、正确拒答、不安全完成、过度拒答或不确定五类结果之一。与固定攻击数据集不同,Blindspot 是可扩展的实时仿真框架,攻击、场景、工具、策略、领域和 Agent 配置均可新增而无需重设计评测流程。

  14. 论文追踪 · 收录 · 原文 论文41

    研究者构建中国AI生成内容合规基准,评测20个LLM

    研究者提出一套评估LLM是否符合中国AI生成内容合规要求的框架,并对20个知名模型给出评测结果。该框架包含2303个问题,覆盖六个维度,其中203个为自行构建的宪法类问题,由多个评判模型基于各自的分层对齐记忆独立给出裁决。结果显示,国际模型在使用标准中文问题时也表现出较高的合规水平,主要差异可能来自与意识形态对齐密切相关的维度。作者据此建立了一个监管基准,供全球AI社区在统一的法律依据下评测中外LLM。

  15. 论文追踪 · 收录 · 原文 论文48

    研究评测 DeepSeek、Qwen、豆包在中文事实问题上的谄媚行为

    一项研究评测了 DeepSeek、Qwen 和豆包三个中文大语言模型在事实性问题上的谄媚行为,覆盖 12,165 个来自真实中文搜索查询的是非判断题,共 364,941 条回答。研究在基线、用户信念条件和反谄媚提示三种设置下,对比模型开启与关闭推理时的表现,追踪正确答案、错误答案与不确定回答之间的配对迁移。结果显示,在用户持有错误信念时,模型既会出现与信念一致的错误,也会出现原本正确回答转为不确定的事实信心流失;推理并非稳定的防护手段,反谄媚指令虽能减少错误认同,却会推高不确定回答的比例。作者据此指出,在中文事实问答中避免附和错误信念并不等于保住事实准确性,转变层面的评测更有价值。

  16. 论文追踪 · 收录 · 原文 论文52

    BioSecBench-Surveillance:面向病原体基因组监测 AI 智能体的可验证基准

    研究者发布 BioSecBench-Surveillance,一个包含 100 项评估的可验证基准,测试 AI 智能体能否从原始测序数据和监测背景中推断出正确的分析流程。每项评估只给智能体与人类分析师相同的数据和背景,再对其结构化答案做确定性评分,任务覆盖从分类学鉴定到基因工程检测等七个类别,涉及多种样本类型和测序技术。在来自十六组模型与工具链组合的 3962 次可评分尝试中,最强配置仅通过约一半:Opus 4.8 搭配 PI 以 50.2% 领先(83 项评估,95% 置信区间 40.1 至 60.3),与 GPT-5.5 搭配 Codex 的 50.2%(95% 置信区间 40.8 至 59.6)持平,其后是 Opus 4.7 搭配 PI 的 49.6% 和 Sonnet 4.6 搭配 PI 的 48.6%。该基准为衡量智能体在下一次疫情暴发时能否被信任执行基因组监测提供了标准。

  17. 论文追踪 · 收录 · 原文 论文53

    BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准

    研究者发布 BioSecBench-Refusal,一个用于评估生物研究任务风险识别与拒答行为的基准,将 61 个取自已发表文献的合法常规任务与 46 个看似真实研究但暗藏生物安全风险的虚构红队任务配对。在 16 种模型与框架组合中,常规任务的拒答率为 7% 至 74%,红队任务为 1% 至 62%,许多组合拒绝合法常规工作的比例与拒绝隐藏风险相当甚至更高。拒答最常由智能体推理之前生效的提供商 API 过滤器触发,而获得推理空间的模型表现出识别更多真实威胁的潜力。作者将该基准作为工具发布,供模型开发者校准智能体生物技术研发的能力与审慎程度。

  18. 论文追踪 · 收录 · 原文 论文46

    研究者发布面向 EU AI Act 行为准则的系统性风险指数与仪表盘

    研究者提出 Systemic Risk Index,一套开放评测流程与仪表盘,把 19 个公开基准归入 EU GPAI Code of Practice 定义的四类系统性风险:CBRN、网络攻击、有害操纵和失控,并用保留危害的扰动与模拟部署情境评测模型。仪表盘允许用户在平均与最坏情况聚合之间切换、调整模型能力对总分的影响,并把每项风险评级追溯到对应基准证据。在 18 个模型上,最坏情况聚合下分数下降 14 至 37 分,显示平均口径可能掩盖的风险信息。LLM 评委与人工评分者的一致性和人与人之间相当(κ = 0.78–0.82),盲审发现 83% 的抽样变换保留了原始危害;一项 N = 21 的调查中,多数参与者认为分数易于理解,仪表盘促使他们从不同设置查看模型评测。

10月3日周六
  1. epoch.ai · 收录 · 原文 日期未知46

    ARC Prize Foundation 发布 ARC-AGI-2 基准,纯 LLM 得分为 0%

    ARC Prize Foundation 推出 ARC-AGI-2,这是抽象与推理语料库(ARC)的第二代版本,延续网格输入输出示例的题型,要求系统推断变换规则并应用到新测试输入,每个测试用例允许两次尝试(pass@2)。该基准共 1,360 道题,其中 1,000 道训练题、360 道评测题,评测题在公开、半公开和私有三个集合中各 120 道。相比初代,ARC-AGI-2 移除了容易被暴力程序搜索破解的题目,新增题目针对符号解释、组合推理和上下文规则应用等薄弱环节。超过 400 人参与的人类对照测试显示,每道评测题都至少有两人能在两次尝试内解出,人类平均得分 60%。发布时纯 LLM 得分为 0%,前沿推理系统仅有个位数百分比。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. epoch.ai · 收录 · 原文 日期未知43

    CMU 研究者发布 ExploitBench v0.1,分级评估 LLM Agent 的漏洞利用能力

    卡内基梅隆大学研究者发布 ExploitBench v0.1,用于评估基于 LLM 的 Agent 在利用真实软件漏洞时能推进到哪一步。该基准不采用成功或失败的二元评分,而是沿一条能力阶梯逐级衡量,从触达存在漏洞的代码、触发崩溃、构建利用原语,一直到实现任意代码执行。评测对象是 Chromium 的 V8 JavaScript 与 WebAssembly 引擎中已有补丁的 N-day 漏洞,运行在默认发布构建上,并启用了堆沙箱、ASLR 和栈保护等缓解措施。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. 论文追踪 · 收录 · 原文 论文56

    斯坦福与 UC Berkeley 发布 MobileCybench:用可执行探针评测 Agent 漏洞发现

    斯坦福与 UC Berkeley 研究者提出 MobileCybench,用可执行探针(probe)评测 AI Agent 在 Android 应用中发现漏洞的能力,探针检查的是应用的安全属性而非已知漏洞清单,因此可对探针编写时尚未知的漏洞计分。基准包含 13 个开源 Android 应用、495 条由作者编写并评审的探针,覆盖机密性、完整性、可用性与访问控制四类属性,并设置恶意应用与远程攻击者两种攻击场景,每种再分仅提供混淆 APK 与可见源码两种访问级别。所有触发均来自应用特定探针,通用探针从未触发。构建与运行基准过程中发现 23 个此前未报告的漏洞,维护者已确认 12 个,其中 7 个已修补、5 个已确认,6 个获得公开 CVE 编号。

    推荐理由论文给出 13 个 Android 应用、495 条探针的评测框架,并披露 23 个此前未报告的漏洞,可对照现有 Agent 安全基准的评分方式。

  4. 论文追踪 · 收录 · 原文 论文40

    研究分析 Be My Eyes 1428 条低分评论,揭示视觉描述服务的骚扰、隐私与无障碍安全问题

    Brigham 与 Kohno 对 Be My Eyes 的 1428 条一至三星评论做定性分析,考察这一连接超百万盲人与低视力用户、超千万志愿者的视觉描述服务及其 AI 版本 Be My AI 中用户和志愿者遇到的问题。分析发现三类问题:网络骚扰与滥用(恶意骚扰、网络裸露、举报机制失效)、信息暴露之外的隐私担忧(数据被用于模型训练),以及无障碍与安全问题(描述不准确、家长式护栏)。研究还分析平台政策是否及如何回应这些问题,并针对无障碍、安全、隐私与 AI 方面的挑战提出改进视觉描述服务信任与安全的建议。

  5. 论文追踪 · 收录 · 原文 论文54

    Mandela-Bench:36 个多模态模型更依赖记忆而非观察图像

    研究者提出 Mandela-Bench,一个以事实矛盾为唯一伪造证据的单图基准,包含 1507 张无缝编辑的经典图像(其中 1359 张知识型伪造、148 张无锚点对照)和 474 张未修改原图,覆盖人物、物体、地点、可见文字、事件属性和艺术作品六类知识。在 36 个多模态模型(0.8B 到前沿规模)上,当从熟悉照片中抹去公众人物后,模型仍在最高 72.7% 的回答中说出该人物;部分模型单独看替换人脸时能区分,却仍判定整张编辑照片为真。给出真实事件与日期并不能提升知识型检测,而裁掉可识别构图后再给同样信息则能提升。在显式验证提示下,36 个模型中只有一个在至少一半伪造图上达到 KGR 标准,最佳模型 KGR 为 55.1,次优为 36.0。作者将这一模式称为从记忆重建,认为瓶颈在于识别之后是否触发验证。

    推荐理由36 个多模态模型在 1507 张知识型伪造图上的表现,为图像取证与多模态可信评测提供了可复用的基准和失败模式。

  6. 论文追踪 · 收录 · 原文 论文34

    谁的事实才算数?对 LLM 评测基准的文化响应性审计

    研究者用文化响应性评估(CRE)框架的六维评分表审计了 OpenAI 的 SimpleQA(4,326 项)和 LMSYS Chatbot Arena(600 段对话)。SimpleQA 每题都要求以英语档案作为证据基础,单一评分者对哥伦比亚建国日期的偏好占 2.70% 的题目,夸大了全球南方覆盖度;Arena 中英语提示词占 76.3%,而 ITU 估计全球网民中英语用户仅占 25.9%。一个 50 项反基准的 CR 缺陷均值比 SimpleQA 低近三倍(Cohen's d = 1.01),论文认为这属于结构性效度失效。

  7. 论文追踪 · 收录 · 原文 论文30

    MM-IFEval-Pro:面向视觉语言模型的多语言抗攻击指令遵循基准

    研究者提出 MM-IFEval-Pro,一个覆盖中英文任务和多种指令劫持场景的多模态指令遵循基准,包含 4 大任务类别、24 个子类及 8 个指令类别、52 个子类,每个样本平均含 3.0 个约束。团队还构建了富含中文与对抗指令的强化学习训练集,显著提升模型在该基准上的表现,并有效迁移到其他主流多模态基准,展现出跨任务与跨语言的泛化能力。

  8. 论文追踪 · 收录 · 原文 论文50

    SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准

    研究者提出 SinoGlyphBench,一个针对中文字形混淆的诊断基准,通过识别标签关键语义锚点,构造文本与图像两种模态下匹配的原始与字形混淆输入,并分别扰动锚点、背景上下文或两者,以区分审核相关证据被破坏与一般表层变化。在 12 个 LLM 与 MLLM 的 176,916 组配对评测中,字形混淆使有害内容假阴率与假阳率分别上升 6.1 和 4.7 个百分点,四分类准确率下降 5.0 个百分点,模型仅保留 75.7% 在匹配原始输入上正确的判断。全范围扰动造成的退化最大,仅扰动锚点比仅扰动背景更具破坏性,文本模态下的跨文字系统替换尤其困难。对结构化输出的分析显示,模型在可见字形读取、意图信息还原与最终安全判断之间存在可观察的不一致。

  9. 论文追踪 · 收录 · 原文 论文48

    QH-Bench:面向中国青少年内容安全的细粒度中文基准

    研究者提出 QH-Bench,一个面向中国青少年内容安全的中文基准,场景基于中国社会与文化背景。单轮轨道包含 715 个测试项,覆盖 10 个风险领域、50 个子领域和 143 个细粒度风险场景;多轮轨道包含 100 条四轮对话轨迹,采用 10×10 平衡设计,把同样十个领域与十种跨轮机制组合。两条轨道使用同一套五级安全-有用性量表和自动评判器,但评判标准按轨道区分。对 13 个开放权重模型的评测显示,线下接触场景是共同弱点:在与网友线下见面、陌生群体和成年人相关的条目中,每个模型都有超过一半条目得分为负,包括单轮得分最高的 InternLM2.5-20B;负分表示回答部分或明显促成风险。多轮得分最高的 GLM-4-32B 在用户先建立关系再诉诸忠诚或保密的完整轨迹中,有 60% 得分为负。

  10. 论文追踪 · 收录 · 原文 论文48

    AntiSkillBench:评测 persona skill 的隐私泄露与行为模仿风险

    研究者提出 AntiSkillBench,一个覆盖 persona skill 全流程的端到端基准,用于评测隐私泄露、属性披露与行为模仿风险及相应防御。该基准包含 7,500 条 persona 对话轨迹,来自 50 个行为特征丰富的用户画像,覆盖多种任务场景;评测套件在三种 skill 蒸馏策略下测量 skill 级隐私泄露与 agent 级属性披露、行为模仿;防御评测覆盖在线与事后干预的四种配置,包括主动风险抑制与被动来源保护。在三个前沿 agent 上的实验显示,persona skill 的风险跨 agent 骨干与蒸馏协议持续存在,并从显式属性延伸到沟通风格与人格特质;现有防御效果有限且依赖蒸馏方式,难以跨风险类型与蒸馏策略泛化。作者认为该基准为开发隐私保护与真实性感知的 persona skill 提供了有挑战性的评测工具。

  11. 论文追踪 · 收录 · 原文 论文53

    PASB 基准:自改进个人 Agent 的持久谄媚在后续会话中失败率达 71.9%

    研究者提出 Personal Agent Sycophancy Benchmark(PASB),用于评测自改进个人 Agent 的持久谄媚,即 Agent 把用户主张写入记忆后,后续会话将其当作可信上下文读回。基准包含 1600 个任务,在 Hermes-Agent 和 OpenClaw 两个真实 Agent、十二个模型上运行,每个任务把含主张的首轮对话与中立的后续对话隔离,使任何延续都必须经过 Agent 自己写下的笔记。结果显示,当后续对话能读到已保存的主张时,下游失败率(后续回答附和、据其推理、当作事实或加以引申)达 71.9%,而主张仅停留在首轮对话时为 45.0%。Agent 在 51.4% 的运行中把主张写成稳定偏好、背景事实或可复用流程,且已保存的主张在跨领域时仍会影响回答。

  12. 论文追踪 · 收录 · 原文 论文54

    VLoc Bench 发布:评测 Agent 在完整仓库中的漏洞定位能力

    研究者发布 Vulnerability Localization Benchmark(VLoc Bench),用 500 个来自 290 个仓库的真实漏洞任务,评测 Agent 能否在只给出 CWE 描述和只读终端的情况下定位漏洞所在实现文件。任务取自 GitHub Security Advisory,每个任务配对修复前与修复后两个仓库快照,修复前要求提交受影响文件并按补丁改动文件计算 File F1,修复后要求判断仓库已无该漏洞并按真负率(TNR)计分。在 27 个模型和 4 个静态分析工具上,最强系统仅达到 0.229 File F1,38.4% 的任务没有任何模型定位正确;仓库越大、代码越分散,定位越难,Go 与 Maven 任务最难。静态分析工具在 TNR 上表现突出,Semgrep-CWE 达 0.996。

    推荐理由VLoc Bench 把漏洞定位从检测与修复中单独拆出来评测,并给出 27 个模型与静态分析工具在仓库规模下的定位与误报对照结果。

  13. 论文追踪 · 收录 · 原文 论文50

    CoSec:面向社区场景的 LLM Agent 安全基准

    研究者提出 CoSec,一个用于评估 LLM Agent 系统在社区内部及跨社区运行时隐私与授权执行情况的可执行基准。该基准包含 208 个规范场景,覆盖固定与演化的社区边界、属于 Agent 所有者或其他参与者的受保护信息,以及通过对话、环境内容、持久记忆和组合工作流发起的攻击。CoSec 以持久会话、记忆、文件和工具运行完整 Agent 系统,并借助执行轨迹与产物对照当前授权状态验证信息流。结果显示,在不同 harness 与模型配置下,Agent 常能完成正常任务,却违反隐私与授权边界;隐私行为随 harness、攻击面和社区状态而变化,说明记忆、文件、工具与工作流都可能把受保护信息带出授权范围。作者据此指出,任务效用并不代表隐私或授权合规,社区场景下的授权仍是持久化 LLM Agent 尚未解决的安全挑战。

  14. 论文追踪 · 收录 · 原文 论文53

    PatchBench:马里兰大学团队发布 C/C++ 漏洞修补评测基准

    马里兰大学研究者提出 PatchBench,一个面向 C/C++ 仓库级漏洞修补的评测基准,包含 32 个真实项目、16 类 CWE 的 213 个修补任务。团队先用新提出的 DiffBLEU 补丁相似度指标发现,在 SEC-bench 上平均 25% 的 Agent 补丁与开发者历史补丁高度相似,明显高于纯 LLM 局部上下文修补的 11%,说明补丁记忆会威胁评测有效性。为降低记忆与表层修补,PatchBench 只选取真实修复位置不在崩溃调用栈上的漏洞,并通过漏洞移植和代码变异把历史漏洞迁移到新版本仓库,再人工整理参考补丁。

    推荐理由论文用补丁相似度与多 PoC 加语义校验重估 11 个修补 Agent,指出仅凭原始 PoC 会把解题率抬高约 1.83 倍。

  15. 论文追踪 · 收录 · 原文 论文52

    SEABench:评测自演化智能体的内生失配

    研究者提出 SEABench,用于评测自演化 LLM 智能体在修改自身控制指令、记忆管理协议和可复用工具技能后产生的内生失配。该基准包含 48 条纵向任务序列,覆盖多种演化面、任务领域和危害类型,并配有自适应轨迹发现流程,通过配对非演化智能体和归因分数支持因果归因。对多个近期 LLM 的评测显示,自演化提高了任务完成率,但常以安全失败为代价,而这些失败在配对的非演化基线智能体上并不出现;不同演化面和危害类型下安全行为存在质的差异,这种差异也反映在智能体的思维链推理中,可作为低误报率的监控缓解手段。

  16. 韩国 AI 安全研究所 · 收录 · 原文 34

    韩国 AI 安全研究所发布《前沿 AI 风险更新 2026 年上半年》韩文版

    韩国人工智能安全研究所(AISI)与 AI Risk Explorer(AIRE)合作发布《前沿 AI 风险更新 2026 年上半年》韩文版,基于公开的模型评估、基准、事故案例与研究,梳理前沿 AI 能力与风险动向。报告围绕网络攻击、失控、生物风险与操纵四个领域,指出 Claude Mythos 5、GPT-5.5、GLM-5.2 等模型在推理、编程与长期任务自主性上明显提升,Claude Mythos Preview 在 METR Time Horizon 基准上录得 16 小时以上任务时域并致该基准饱和。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  17. 论文追踪 · 收录 · 原文 论文43

    研究者提出基于参考的隐藏状态相对表示偏见检测方法

    研究者提出一种基于参考的偏见审计方法,通过隐藏状态的相对表示检测模型变体(如微调前后)的偏见变化。由于微调会重塑表示几何,绝对隐藏状态不可直接比较,方法用每个句子与固定锚句的相似度编码,在共享比较空间中衡量目标群体与正负属性的关联偏移,称为表示偏见偏移 ΔB。在三个模型族和 WildGuardMix、DecodingTrust、ToxiGen 基准上,ΔB 在 18 个测试设置中的 15 个与输出级偏见变化相关,全量微调下达到 |r| = 0.84(p < 0.001),参数高效适配下更依赖具体模型。对 ΔB 设阈值可识别偏见上升的检查点,ROC AUC 在 0.65 到 0.99 之间,在 WildGuardMix 和 DecodingTrust 上对三个模型族的区分效果均优于基于 SEAT 的基线。作者认为该方法与基于输出的审计互补而非替代。

  18. 论文追踪 · 收录 · 原文 论文49

    FairMedAgent:临床 LLM 智能体公平性审计中的随机噪声下限

    研究者提出 FairMedAgent 测试框架,用于测量临床 LLM 智能体在反事实公平性审计中的随机翻转下限。在默认采样下,对 16 个合成情境重复运行同一条件十次,智能体动作在 8.7% 的重复对中发生变化,从重症监护升级的 2.2% 到管制药物谨慎提示的 17.9% 不等。在来自五家厂商的六个模型中,合并下限介于 2.5% 至 23.7%,且模型规模、厂商与托管方式均未呈现排序关系。下限受解码配置影响,五次采样的多数投票消除了其中 39%(95% CI 18 至 64);温度设为 0 时四个本地部署模型中有三个不再出现分歧,但一个托管模型仍有分歧。作者指出,在无人口统计学效应假设下,二元动作的翻转率期望值等于该下限,真实效应仅贡献其平方,因此落在下限内的翻转率不能作为公平性证据,方向需用带符号配对检验。

  19. 论文追踪 · 收录 · 原文 论文41

    HerHealthEval:评测大语言模型对多语言女性健康沟通的理解

    研究者提出 HerHealthEval,一个针对女性健康沟通多语言理解能力的受控评测框架,覆盖英语、法语和现代标准阿拉伯语。每个临床案例提供六种沟通形式:规范、临床、外行、间接或含糊、情绪担忧以及刻意信息不足,前五种保留相同临床信息,最后一种故意省略细节以测试模型是否意识到需要追问。研究评测了一个多语言指令模型及 QLoRA 适配变体,考察关切分类、风险校准、追问行为、解析合规和跨形式一致性。结果显示聚合准确率和一致性会掩盖与安全相关的失败:在语言不对称风险监督下,多语言适配模型在法语和阿拉伯语上的分诊不足率达到 0.994;改用源自数据、语言不变的风险标签重新适配后,分诊不足率分别降至 0.572 和 0.558。论文认为稳健的多语言医疗评测需要显式测试语域变化、不确定性处理以及适配标签的来源与不变性。

  20. 论文追踪 · 收录 · 原文 论文39

    研究者提出预算受限的 LLM 重复评测框架,优先深挖隐藏失败

    研究者把大语言模型的可靠性评测形式化为预算受限的发现问题,认为每个提示词都存在未知的逐次生成失败概率,浅层采样可能漏掉低概率但重要的失败。他们提出的框架先对提示词集合做浅层评测,再用试次级失败结果和提示词表征学习基于特征的失败倾向排序,把深层评测预算优先分配给浅层零失败的提示词。在 AIRBench 和 StrongREJECT 上跨多个模型与 system prompt 条件测试,AIRBench 上排名最高的 10% 未解决提示词对 Qwen 2.5 7B 取得 2.54 倍隐藏失败提升、对 Gemma 3n E4B 取得 1.87 倍,分别找回后续观测到的 25.4% 和 18.7% 隐藏失败,随机分配下预期为 10%。语义邻域与特征消融分析显示该预测信号可从多种提示词内容与关系表征中恢复。

  21. Dan Hendrycks · 收录 · 原文 48

    Dan Hendrycks 发布 CheatBench,评测 AI 智能体的奖励作弊频率

    Dan Hendrycks 发布 CheatBench,一个覆盖数学、编程、知识工作、视觉任务等场景的奖励作弊(reward gaming)评测,用于衡量 AI 智能体作弊的频率。他表示,在 Hugging Face 事件之后,AI 公司尝试解决这一问题,但前沿智能体仍然频繁作弊。评测详情见 https://cheatbench.ai/。

  22. Buck Shlegeris · 收录 · 原文 39

    Redwood Research 与 Anthropic 合作发布概念推理指数 CRI

    Redwood Research 团队与 Anthropic 合作开发了概念推理指数(CRI),用于衡量模型在缺乏廉价可靠反馈的领域中的推理能力,例如判断某项实验能否说明未来远超人类的模型的行为。CRI 的每一条数据都由团队研究员人工核查以保证质量。评测中 0 分对应三项基准上全部随机猜测,100 分为最高分,团队估计真实性能上限为 91。官方排行榜网站为 https://conceptualreasoning.ai/,将持续更新。Buck Shlegeris 转发了 Em 及其团队这项工作并表示期待。

    引用Emery Cooper@emwcooper

    We want AIs to be able to help with work to reduce AI risk. But while models do great in domains where reliable feedback is relatively cheap and abundant, like Math and coding, a lot of work on AI risk isn't like that. Instead, we have to rely on good argumentation to answer questions like "does this experiment tell us anything about future models that are much smarter than humans?" Unfortunately, this kind of work seems much harder to measure (and hence automate). Our team at @redwood_ai developed the Conceptual Reasoning Index (CRI) in collaboration with @AnthropicAI to fix this. Every single data point in the CRI has been manually checked by a researcher on our team to ensure quality. This chart shows the performance of each tested company's highest-scoring model plus Fable 5, Muse Spark 1.2, and Gemini Flash 3.6 which are often their company's frontrunners on other capability benchmarks. A score of 0 corresponds to randomising guessing on all three benchmarks and a score of 100 is the highest possible score on all. We estimate 91 to be the true performance ceiling. More info below. Official leaderboard website which we'll keep up-to-date: https://conceptualreasoning.ai/