跳到正文

安全评测

今天新收录 34 条(含旧文)

第 3 页更新的内容回到最新

10月5日周一
  1. arXiv:危险能力与安全评测 · 收录 · 原文 论文44

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    研究者提出 SceneFactory-3D,一个 GPU 批量、物理落地的多智能体驾驶仿真器,车辆通过悬挂与摩擦受限的力在每个轮胎接触点执行加速和转向指令,空间变化的摩擦、逐世界 3D 高度场、重力与刚性接触共同约束车轮运动和底盘碰撞。逐世界地形隔离与 GPU 批量使其能并行运行匹配的物理反事实:交通场景设置和车辆控制器保持不变,只改变路面条件,从而在并行世界中评估闭环影响。作者据此对车辆控制器对路面条件的敏感性做了实证研究,在每种条件下 1024 个匹配的 12 车世界、21 种摩擦与坡度条件下测试三类学习策略,并在共享的 32 世界子集上测试两种经典规划器。当摩擦从 1.0 降至 0.18 时,学习策略安全通过施工区的车辆比例下降 6 至 90 个百分点,经典规划器下降 18 至 19 个百分点,且每种学习策略的接近碰撞情形都更频繁。代码已开源于 GitHub。

  2. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    研究:分类后缀可提升激活探针的分布外恶意输入检测

    研究者在 13 个安全基准(越狱、提示注入与正常对话)和 Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B 三个开源模型上,用严格的留一数据集(LODO)评测检验用户轮次后附加分类指令对激活探针的影响。单点探针上,分类后缀相比无后缀可将分布外检测的 AUC 提升最多约 4 个点,而跑题或仅表示关注的后缀几乎没有帮助。增益来自分类这一格式本身而非具体判据,无内容标签的后缀与真实恶意/良性判据效果相当,判据只在严格阈值下提升精确率。该结论也适用于生产中的多点池化探针(attention、multi-max、MLP),但最优后缀随读出方式变化;通过 KV-cache fork 部署时,它是一种低成本即插即用方案,但具体哪种后缀有效、提升多少取决于模型与读出方式。

  3. METR · 收录 · 原文 48

    METR 发布 Claude Opus 5.5 部署前评测:AI R&D 能力小幅提升但难以完全自动化

    METR 发布 Claude Opus 5.5 部署前评测摘要,认为其在可验证与难验证的 AI 研发任务上较 Fable 5.1 有增量提升,但证据不支持它已能完全自动化 AI 研发,研究判断与自建反馈循环仍有弱点。报告认为 AI 对模型开发至少有一定加速,但不太可能造成剧烈加速。文中约 1.5 倍的估算来自 METR 另一团队的高度实验性报告,该团队只分享结论而未向评测团队分享证据,也未说明估算适用时段。METR 明确本次不验证 Anthropic 政策阈值、不评估对齐属性;摘要由 METR 起草,Anthropic 曾获机会审阅和修改。

  4. 论文追踪 · 收录 · 原文 论文48

    PowerBench 评测 24 个模型在权力转移请求上的偏见

    研究者提出 PowerBench,用于评测语言模型在权力转移类请求上的系统性差异,把请求分为自我赋权、去权和夺权三类,并设置不改变权力的拒答诱导请求作为对照。数据集在权力领域、情境、受影响方规模和用户原有权力地位上做变化,覆盖 24 个模型(12 个来自美国开发者、12 个来自中国开发者),在用户与受影响方国籍互换、AI 智能体作为用户、8 种请求语言三种条件下评测。结果显示模型对夺权的拒答多于去权,对去权的拒答多于自我赋权;夺权拒答率随受影响方规模从个人上升到社会而提高。模型倾向于帮助他人从美国夺取权力,而不愿帮助美国用户从他人处夺取权力,但在美国获得权力且无人受损时偏向美国。当用户是 AI 智能体时,对权力转移请求的拒答增加,在针对个人的夺权上尤为明显。

  5. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文52

    OEB 基准:从 Agent 执行记录评测开放式研究中的认知过程

    研究者提出 OEB(Open-Endedness Bench),一种只读取 Agent 执行记录、不依赖参考答案或结果分数的基准无关评测方法,用于衡量 Agent 在开放式研究任务中的认知过程。OEB 把执行记录编译成统一的认知事件图,边连接 Agent 提出的命题与检验该命题的实际动作,每个节点附带可由代码在记录中核验的原文片段。其评分原则是:文字可以提出命题,但只有已执行动作返回的证据才能支持或反驳它。基于该图,OEB 从证据、实验、修正和反奖励作弊四个能力维度打分,并刻画六种主观研究习惯画像。

  6. 论文追踪 · 收录 · 原文 论文54

    宾州州立大学提出 TPRS,量化 Agent 安全基准中工具命名对 ASR 的影响

    宾州州立大学研究者提出威胁保持表示敏感性(TPRS),衡量在任务、有害动作、安全策略、真值和评测标准不变、仅改变 Agent 可见表示时攻击成功率(ASR)的变化幅度。在 ASB、MCPTox 和 AgentDojo 三个基准共 28,904 次 Agent 运行中,ASR 变化方向不一致:ASB 把威胁相关工具名换成中性名后,GPT-5-mini 的 committed ASR 上升 11.67 个百分点,Claude Haiku 4.5 上升 13.21 个百分点;MCPTox 把中性名换成威胁相关名后,GPT-5-mini 的 ASR 下降 11.00 个百分点,Haiku 4.5 下降 4.11 个百分点;AgentDojo 在 GPT-4o-mini 上 ASR 仅变化 0.50 个百分点,但需要该工具的任务上良性效用下降 5.36 个百分点。

    推荐理由论文用近 2.9 万次 Agent 运行量化了工具命名等表示变化对 ASR 的影响,做 Agent 安全评测的团队可据此检查自己的基准是否对表示敏感。

  7. 论文追踪 · 收录 · 原文 论文53

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束,GPT-5.5 发生率 11.5%

    论文识别并形式化了一种长程智能体失效模式 GHOST,即安全约束在早期对话中提出后,任务在后续良性交互中被恢复执行时该约束不再生效,导致不安全执行。作者提出 SCARBench 基准,包含 6 类工具使用域的 103 个场景、412 个匹配条件实例,长历史为 6,000–6,176 tokens、56–160 轮。在无攻击、用户良性的条件下,7 个受测模型均出现 GHOST,发生率从 Kimi-K2.6 的 6.8% 到 Qwen3.5-4B 的 27.8%;GPT-5.5 的严格 GHOST 率为 11.5%,其 Long Explicit 安全完成率 88.7%,当约束只能从长历史中恢复时安全完成率下降 12.4 个百分点。理论部分用条件风险框架证明,若安全前缀上的残余违规风险下界不可求和,执行几乎必然进入危险区域。

    推荐理由论文给出 GHOST 在 7 个模型上的发生率与可复现基准,部署长程 Agent 的团队可据此检查历史安全约束是否仍生效。

  8. Severity Daily · 收录 · 原文 日期未知56

    解读 GTIG AI 漏洞趋势报告:公开署名样本中 RCE 占比 50%

    Google Threat Intelligence Group 于 2026 年 9 月 30 日发布《Vulnerability Discovery and Exploitation Trends in the AI Era》,报告称 AI 发现的漏洞中恰好 50% 导致远程代码执行(RCE),而整个 CVE 生态中这一比例为 26%。报告统计窗口为 2025 年 1 月至 2026 年 8 月,累计追踪 2,076 个 AI 相关 CVE,其中 1,500 多个来自 2026 年 1 月至 8 月;披露量从 2026 年 1 月的 5,045 个增至 7 月的 10,477 个,8 月峰值 10,740 个。GTIG 自述其统计依赖厂商公开署名,并承认因缺乏标准化元数据、厂商直接在生产环境静默修补而不申请 CVE,公开数据显著低估 AI 发现的漏洞数量,但未说明低估偏向哪个方向。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  9. 论文追踪 · 收录 · 原文 论文60

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    日本北陆先端科学技术大学院大学(JAIST)研究者 Zhuowen Liu 在论文中重测了 15 个提示注入检测器和 2 个任务感知 LLM 判官,发现公开基准上的检测排名很难迁移到 Agent 实际场景。研究用无 LLM 回放 AgentDojo 与 τ-bench 的真实工具调用构造良性输出,再用差分回放标注注入输出,并在 BIPIA 上对比。BIPIA 上表现最好的 PIGuard 在 1% 假阳性率下只检出 2.1% 的 AgentDojo 注入,而检出 72.2% AgentDojo 注入的 Prismor 在 τ-bench 上只有 15.2%;BIPIA 与 AgentDojo 之间的 Kendall τ 仅 0.01。相反,工具输出上的假阳性率在两个 Agent 基准间保持一致(τ=0.67),范围从 0% 到超过 90%。

    推荐理由论文用 AgentDojo 与 τ-bench 的真实工具输出重测 15 个注入检测器,指出公开基准分数难以预测部署表现。

  10. 论文追踪 · 收录 · 原文 论文53

    MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%

    MLCommons 发布 Jailbreak Benchmark v1.0,对八款开源权重模型做单轮文本越狱评测,不安全回复率从基线的 11.08% 升至攻击条件下的 18.65%,平均韧性差距 7.57%。评测覆盖暴力犯罪、无差别武器、仇恨、儿童性剥削等 11 类危害,每类 24 条种子提示词共 264 条,并实现 12 种越狱攻击,其中内容框架与欺骗类因评测器限制未纳入定量分析。角色扮演、模板以及包装或 schema 类攻击的平均攻击成功率最高;31B 参数以下的可及模型平均差距约 21%,但样本量小,结论仍属初步。三款 Large 类模型出现负韧性差距,即攻击条件下的不安全回复率低于基线,作者认为可能来自评测器行为、解码设置、真实鲁棒性或模型针对越狱特征而非违规内容本身的拒答。

    推荐理由MLCommons 首次给出端到端越狱评测的完整结果与韧性差距指标,可对照自家模型的基线安全与抗攻击表现。

  11. 论文追踪 · 收录 · 原文 论文53

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    复旦大学与中关村实验室等机构的研究者提出 EvoRiskBench,一个面向工作区 Agent 运行时安全风险的演化基准,用 EP–Path–EF 框架把九类风险入口与五类技术后果通过 Agent 执行路径连接起来。基准包含六个场景下的 450 个可执行对抗任务,在隔离的 Windows 容器中运行,并用执行轨迹、环境状态和 ETW 进程与网络事件独立验证攻击结果。研究者在三种模型(GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5)与三种 harness(Claude Code、Codex、OpenClaw)组成的九种配置上做了 4050 次攻击执行,总体攻击成功率 37.46%,最高为 DeepSeek-V4-Pro-0813 配 Codex 的 68.44%。

    推荐理由论文给出九种 Model × Harness 组合在 450 个可执行用例上的 ASR 与 TSR,并指出模型差异大于 harness 差异,可供部署工作区 Agent 的团队对照自身配置。

  12. arXiv · 收录 · 原文 论文32

    超越最终决策:面向透明 AI 辅助同行评审的流程中心基准

    研究者提出一个以流程为中心的诊断基准,用于评估 AI 辅助同行评审中模型决策是否有充分可靠的评审证据支撑。该基准将 PeerRead、NLPeer ARR-22 和 OpenReview-ICLR 的异构评审记录转换为流程对齐数据,以从论文内容直接预测决策为基线,比较 Gold-process 与 Predicted-process 变量的决策价值,并进行阶段级评估、链一致性评估和干预敏感性分析。在三个数据集、六种模型上的实验显示,Gold-process 变量决策价值普遍更高,Gold–Predicted 差距跨数据集和随机种子稳定,模型生成的中间评审文本虽在相邻阶段局部一致性较高,但最终决策并未持续获得前序评审证据支持。

  13. arXiv · 收录 · 原文 论文48

    READY:面向企业 Agent 部署的可靠性资格认证框架

    研究者提出 Reliable Enterprise Agent Deployment(READY)框架,用于判断 AI Agent 能否在企业工作流中部署。该框架保留各工作流自身的成功定义,同时施加统一的资格认证流程:给定 Agent、工作流和候选监督策略类,READY 测量人机系统的可靠性与运行成本,选出满足指定可靠性目标的最低成本策略,并在留出案例上做统计资格认证,最终给出包含可靠性、人工监督负担和成本的部署画像。READY 以开源测试床实现,将工作流规范、执行、评估与资格认证解耦,可运行在现有 Agent 评测基础设施上。在一项覆盖 16 个 Agent 系统、750 个案例的临床审计端到端案例中,两个自主准确率仅差 0.3 个百分点的系统(72.8% 与 72.5%)在达到同一 76% 可靠性目标时,所需人工复核比例分别为 39.2% 和 29.6%。

  14. Microsoft Research · 收录 · 原文 40

    Microsoft Research 发布 MindTopo 基准,评测多模态模型的拓扑空间推理能力

    Microsoft Research 提出 MindTopo,一个评测多模态大语言模型拓扑推理能力的基准,覆盖连通性、分离、顺序、包围和绳结五类拓扑关系。基准分两个认知层次:推理任务让模型判断静态场景中的拓扑结构,规划任务让模型在模拟环境中通过一系列动作创建、保持或移除某种关系,环境会拒绝违反物理约束的动作。在多种闭源与开源权重模型上,静态推理表现一致优于交互规划,两者都远低于人类水平;静态错误多源于感知遗漏,规划错误则出现在场景已被理解之后,模型会采取局部可行但未追踪后续后果的动作,或在多轮中丢失任务目标。研究还测试了图像与视频生成能否帮助维持拓扑理解,图像生成仅在单帧可见关系时偶尔有用,视频推演常改变拓扑或违反任务动态。

  15. Scale AI Research Blog · 收录 · 原文 54

    Scale AI 发布 CliniCARE-Bench:临床 Agent 常因错误理由答对

    Scale AI 发布 CliniCARE-Bench,在 25 个临床场景、750 个来自 MIMIC-IV 的真实病例上评测 16 个智能体系统,四选一准确率最高仅 76.1%,最低 65.3%。该基准要求 Agent 在受治理、全程记录的工具环境中调查病例,并给出 Yes、No、Indeterminate: Lack of Data 或 Indeterminate: Medically Ambiguous 四种结论。若只认可既正确又未使用专家临床委员会禁止的捷径的结论,各系统得分下降 4.8 至 14.8 个百分点,排名也随之变化,Gemini-3.1-Pro 从 72.7% 降至 57.9%。所有系统都存在过度下结论,比例在 21.3% 至 55.3% 之间,而过度弃权仅 7.3% 至 16.5%。代码已在 GitHub 开源,论文见 arXiv。

    推荐理由Scale AI 用 750 个真实病例评测 16 个临床 Agent,把过程合规与答案正确分开计分,为高风险 Agent 的可审计评测提供了可迁移的框架。

  16. Scale AI Research Blog · 收录 · 原文 37

    Scale AI 复盘 CUA 验证器设计:38 个任务中 0 个程序化验证器能识别关键数字被篡改

    Scale AI 分析了 38 个专业办公 CUA 训练任务及 OSWorld 2.0 任务,发现标准基准的程序化评分存在全有全无二元评分和僵化要求两类失效模式,会导致排行榜排名倒挂,并给强化学习提供稀疏奖励。团队用编码模型生成 603 个程序化验证器,虽然全部能在参考答案上得 1.0,但在故意篡改每个交付物最关键数字后,38 个验证器无一失败,其中 25 个仍给满分,13 个虽在条目层面发现错误,但加权平均把扣分稀释到 0.4% 至 10.7%。在评分一致性实验中,程序化验证器与 AI judge 在 judge 通过的条目上一致率 99.5%,而同一输出三份字节相同的副本被 judge 分别打为 0.0、0.125 和 0.175。团队建议区分评分细则可被钻空子与智能体实际作弊两类问题,前者重算提交内容本身,后者依据轨迹证据标记,如读取答案文件的 Oracle Read 行为。

  17. Scale AI Research Blog · 收录 · 原文 36

    Scale AI 发布 READY 基准,衡量 AI 智能体部署可靠性、人工监督与成本

    Scale AI 推出 READY(Reliable Enterprise Agent Deployment)基准套件,用于按企业实际使用方式评估 AI 智能体,同时衡量可靠性、人工监督量和运行成本三项指标,输出的是部署画像而非单一分数。评测分三阶段:先让智能体处理真实工作流案例并记录工具调用、证据与置信度,再在给定可靠性目标下搜索成本最低的人机分工策略,最后在未见过的案例上独立验证。首批上线 CliniCARE-Bench 和 PSEBench 两个医疗基准,金融服务等行业基准将陆续发布,测试平台基于 Inspect AI 构建并已开放。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文39

    A²E:面向 Agent harness 的端到端审计评测引擎

    研究者提出 A²E(Agent Auditing Engine),一个面向 Agent harness 的端到端评测引擎,用于系统评估 harness 能力。该引擎基于新提出的 Agent Task Protocol(ATP)快速接入不同 harness 的评测任务,并通过自动插桩的 Monitor 在实验过程中捕获并生成标准化执行轨迹。评测阶段使用一组多维指标,除正确率外还刻画 harness 在执行效率、工具使用、任务规划和错误恢复上的差异。实验显示,模型与 harness 的组合在不同类型任务上表现差异明显,没有单一组合能在所有任务上持续领先。代码已公开。

  2. 论文追踪 · 收录 · 原文 论文36

    ContextWeave:面向长周期办公工作流的智能体记忆基准

    研究者提出 ContextWeave,一个纵向基准,用于评估回忆到的经验能否提升语言智能体在真实办公工作流中的下游表现。该基准将 14 名参与者数月的工作流重建为 1,005 个可执行任务,其中 568 个为核心评测任务,包含指令、容器化环境、轨迹和任务专属评分标准,衡量工作区质量与参与者偏好对齐,并诊断相关性、连续性、可解性和对误导性回忆的鲁棒性。在固定模型下比较六种记忆组件,最强配置将 Workspace Score 从 68.08 提升到 78.20,Preference Score 从 41.50 提升到 70.60。固定记忆组件时,回忆对全部五个被测基座模型都有改善,但幅度差异明显。分析显示,可操作、经验丰富的记忆比精简摘要更能支持工作流延续并减少重复探索,同时也更容易受误导性回忆影响。

  3. 论文追踪 · 收录 · 原文 论文49

    Vero:首个仓库级实现与证明联合合成基准,最强 Agent 仅解出 43 个实例中的 27 个

    研究者提出 Vero,首个在仓库层面评估实现与形式化证明联合合成的基准,用于衡量 AI Agent 能否构建经过机器校验的软件。Vero 包含 43 个多模块实例,取自 Python、Dafny、Verus 和 Coq 的真实仓库,覆盖密码协议到分布式系统等领域,每个实例由带预定 API 接口的 Lean 4 多模块仓库、人工整理的形式化规格和参考实现组成,支持仅证明与代码加证明两种评测模式。基准还引入审计机制,允许 Agent 形式化证明给定规格不可满足或参考代码有误,从而在整理阶段暴露并修正潜在的代码与规格错误。在可访问 Lean 工具链的前沿编码 Agent 配置下,最强 Agent 仅完整解出 43 个实例中的 27 个,在最难的仓库上未能闭合任何规格。作者开源了基准、整理流程与评测框架。

  4. 论文追踪 · 收录 · 原文 论文59

    ActBench:面向协作智能体行为安全的自演化基准

    香港城市大学、浙江大学、伦敦大学学院与小米的研究者提出 ActBench,一个从执行轨迹而非最终回复评估协作智能体行为安全的自演化基准。基准包含 213 个场景的 300 对良性/恶意配对用例,覆盖 15 种风险行为、六个执行空间和 48 个 web 服务 API,恶意用例在保留指令、配置、初始状态与评分标准的前提下注入任务可达载荷。构建方法结合奖励引导的束搜索与基于反思的深度探测,并用日志证据与 LLM 轨迹证据的双重验证判定攻击是否真正生效。在 24,000 条轨迹上评估 15 个 LLM 和 6 个开源协作智能体,固定框架时攻击成功率从 10.1% 到 94.4%,固定基座模型时跨框架从 73.7% 到 94.4%,模型差异大于框架差异。基准已开源于 https://github.com/zjuicsr/ActBench。

    推荐理由该基准用配对良性任务与对抗变体,从执行轨迹而非最终回复判定行为安全,并给出跨模型与跨框架的攻击成功率对比。

  5. 论文追踪 · 收录 · 原文 论文27

    EXE-Bench:为真实可用性对 AI Windows 恶意软件检测器进行权衡排名

    EXE-Bench 是一个面向 AI Windows 恶意软件检测器的综合基准,从性能、时间鲁棒性、对抗鲁棒性和计算开销四个维度打分并聚合为单一分数,用于直接公平地比较模型。该基准指出,仅在部署后评估无法完整反映检测器表现;通过特征工程注入的领域知识在抵御时间推移和对抗攻击上仍极为有效,而多数深度网络仅在部署初期表现优异。

  6. 论文追踪 · 收录 · 原文 论文46

    AIR-BENCH Live 发布:可自动更新的基础模型安全基准

    研究者提出 AIR-BENCH Live,作为 AIR-BENCH 2024 的自更新后继版本,通过自动监测政府监管、将新政策条款归入现有风险分类或提出新类别,并用多智能体、人格驱动的提示词生成算法产出多语言提示词。当前版本将基准从 314 项细分风险扩展到 335 项,新增 21 个类别,来自七个司法辖区的 31 条全新政策条款。对 14 个近期模型的评测显示安全表现差异较大(按模型自身行为判定为 0.17 至 0.89),更新后的提示词平均比 2024 版难 0.06 分,降幅集中在最顺从的模型上,且多数模型在非英语提示词上安全性略低。

  7. 论文追踪 · 收录 · 原文 论文56

    研究者提出影子评测:前沿 Agent 六天未能完成两篇 NeurIPS 投稿级研究

    研究者提出一种名为影子评测的新方法,把两篇尚未公开的 NeurIPS 2026 投稿的核心研究问题交给前沿 Agent,由原文作者按会议审稿标准打分。实验给 Agent 六天时间、3000 美元 Anthropic API 额度、GPU 算力和完整虚拟机与开放网络访问,Agent 独立完成了全部工程环节,但两篇论文均被作者明确拒稿,分别评为 Reject 和 Strong Reject。研究归纳出五类反复出现的失败模式:对可发表研究标准的判断不足、面对研究设计缺陷缺乏创造性应对、无法从死胡同有效回退、资源与时间意识薄弱、指令漂移。用 GPT-5.6 Sol 与 Codex 复现的实验重现了几乎全部失败模式。研究未发现明显的奖励作弊,但记录到一次访问 token 被提交进仓库,以及五次子 Agent 幻觉或误报结果被主 Agent 发现。

    推荐理由两项影子评测用未发表论文的原始问题考察前沿 Agent,给出可复现的失败模式清单与专家评分,为判断 AI 研发自动化进度提供新方法。

  8. The Decoder · 收录 · 原文 29

    Aleph Alpha 研究:千问、DeepSeek、Kimi 等中国模型在敏感议题上多复述官方立场或拒答

    Aleph Alpha 用自建基准测试了阿里千问(Qwen)、DeepSeek 与月之暗面(Kimi)等中国模型,覆盖天安门、台湾、新疆等 967 个敏感议题,其自研评分系统判定仅 17% 至 41% 的回答算平衡,其余为复述官方立场、回避或拒答。DeepSeek V4 Pro 拒答三分之二问题,对照的 Claude Sonnet 5 与 Mistral Small 平衡回答率分别为 70% 和 92%。研究还称 Nvidia Nemotron Cascade 2 有 17% 回答呈类似倾向,归因于其 930 万条训练样本中约 3500 条由 DeepSeek 和 Qwen 生成。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  9. 论文追踪 · 收录 · 原文 论文43

    范围综述梳理 LLM 聊天机器人对心理健康的 119 篇相关文献

    一篇发表于 npj Digital Medicine 的范围综述系统梳理了 119 篇关于 LLM 聊天机器人(LLM-CB)心理健康危害的文献,将其归纳为概念性工作、心理健康支持使用、认知过度依赖、AI 依赖和 AI 精神病五类主题。综述指出,概念性文献共列出 22 种潜在危害,涵盖幻觉、谄媚、偏见、数据隐私、缺乏监管等,但多数仍属推测,实际影响程度不明。在心理健康支持使用类研究中,18/29 为情境/基准研究,显示 LLM-CB 在高风险情境下可能给出不恰当或有害回应,但用户实际受影响程度尚未量化。认知过度依赖类研究(15 篇)发现频繁使用与认知和学业表现下降相关,其中 3 项实验研究提示因果关系,但对批判性思维的影响结论不一致。综述还提到 OpenAI 2025 年自报数据估计超过百万 ChatGPT 用户(约 0.15%)表现出严重心理困扰迹象,该数据基于内部分类器、未经独立验证。

  10. 论文追踪 · 收录 · 原文 论文53

    微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性

    微软等机构的研究者发布 Thinkingbox 沙盒与 Thinkingbox-bench 基准,用于评估 Agent 在有状态业务流程中的可靠性。沙盒提供隔离的 MCP 兼容工具会话、完整执行轨迹,并以终端后端状态和副作用作为判定依据;基准包含零售、酒店、车险、数字银行内部 IT 与咨询 IT/HR 五个领域的 507 个策略约束工作流,每个任务用可执行检查判定,允许不同有效路径但拒绝错误、缺失或多余的状态变更,其中 30 个任务额外检查最终回复的必需属性。研究者在 18 个闭源与开源模型上每任务重复 20 次试验,发现可靠性明显下降:Claude Opus 5 从 66.50% pass@1 降至 47.53% pass^20,Kimi-K3 从 57.37% 降至 17.60%;Qwen3.8-27B 的 pass@20 达 89.35%,但 pass^20 仅 10.93%。

    推荐理由论文给出 507 个有状态业务流程任务与 18 个模型的重复试验结果,可看到 pass@1 与 pass^20 之间的可靠性落差。

  11. 论文追踪 · 收录 · 原文 论文42

    AgentAudit:面向 AI Agent 全生命周期信任评估的开源框架

    研究者提出 AgentAudit,一个可附加在任意 LLM Agent 上、只读取执行轨迹而不干预其运行的开源评估框架,覆盖规划、工具选择、工具执行、记忆与推理的完整流程。该框架从指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实性、安全与执行完整性十个能力、接地、安全与行为维度评估整条执行轨迹,并结合行为分类与失败归因定位出错的阶段。所有轨迹由同一个固定裁判模型打分,而该模型本身也是被评测模型之一,作者在第七节 E 小节讨论了这一局限。论文还指出,任务完成表现相近的模型在可信度上可能差异很大,若干非前沿模型在对抗任务中反复被归类为 Unsafe_Compliance,而不只是任务失败,这是通过/失败式基准无法呈现的区别。

  12. 论文追踪 · 收录 · 原文 论文48

    Harness-IF:评估编码 Agent 跨指令面的指令遵循能力

    研究者提出 Harness-IF,用于评估编码 Agent 在多个指令面上的规则遵循情况,并区分真正遵循与碰巧符合默认行为。该基准包含 60 个真实多轮编码任务,取自 642 条规则库,256 条规则获得判定,分布在部署 Agent 会读取的五个可配置指令面上。为区分遵循与巧合,作者提出 Against-Prior Accuracy(AP-Acc),只对与模型无提示默认行为相反的规则打分,通过九次探针构建中隐去规则重跑任务来观测。在 12 个前沿模型上,准确率为 72.1% 至 85.9%,AP-Acc 为 66.1% 至 78.6%,所有模型在反先验规则上表现更差,差距 3.6 至 7.4 个百分点,平均 5.81。作者指出聚合分数会以模型相关的幅度高估遵循程度。

  13. 论文追踪 · 收录 · 原文 论文53

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    研究者构建了覆盖十类政治敏感话题的 200 张图像基准,对 9 个视觉语言模型(7 个中国来源、2 个非中国来源)在四种提问范式和两种提示语言下运行 21708 次试验,由两个前沿 LLM 评审按六个维度逐条标注,并在 200 条样本上与三名人类专家验证。结果显示,中文提示下出现国家立场改写的几率约为英文提示的 3.67 倍,且在每个模型内部都成立;中国来源模型的改写率高于非中国模型,方向在两个评审和人类标注者间一致,幅度随评审不同在 1.6 至 3.2 倍之间。改写集中在文本提及敏感主体的条件下(36.5%),仅给图像时为 9.8%;在四代 Qwen 多模态模型上,显式拒答下降而国家立场改写上升,改写以替换和委婉语为主,且不含拒答关键词,关键词检测方法难以发现。

    推荐理由对 9 个视觉语言模型 21708 次试验的审计显示,审查正从可见的拒答转向难以察觉的改写,为多模态安全评测提供了新的测量维度。

  14. 论文追踪 · 收录 · 原文 论文50

    aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡

    研究者提出 aiXamine,一个统一黑盒评测平台,把 LLM 的安全、安全(security)与隐私当作相互依赖的属性来评估。平台通过自动化红队流程编排 9 项服务上的 46 个测试,生成从提示词级诊断到跨服务权衡分析的分层风险画像,可在相同条件下复现对比闭源与开源权重系统。作者用 aiXamine 测试了 120 多个 LLM、超过 5000 次测试运行,发现三种单轴评测看不到的跨维度现象:更强的对齐会系统性提高过度拒答,形成可量化的安全税;隐私与其他可信维度近乎正交,标准对齐无法覆盖;无 on-policy 校正的 off-policy 知识蒸馏会导致熵坍缩,在同一基础架构上把鲁棒性从 56.9 降到 2.6。

  15. 论文追踪 · 收录 · 原文 论文58

    论文发现安全监控器主要拦截模型本就会拒答的请求

    Sripad Karne 的论文测量了安全监控器在目标模型实际会作答的请求上的召回率,发现四款文本护栏、两个激活探针和 Latent Guard 在 1% 假阳性率下,对模型会拒答请求的召回率是模型会作答请求的 1.1 到 6.4 倍,而 AUROC 多数仍在 0.85 以上,标准指标掩盖了这一差距。研究基于 647 条有害请求(来自 Aegis 2.0、HarmBench、StrongREJECT),每条改写成间接、直接、直白三个显式程度版本且意图经 LLM 与人工核验;Gemma-4-31B-IT 在直白版本只答 12 条,在间接版本答 340 条,相差 28 倍,其中 344 条翻转请求里各护栏漏放 153 到 321 条。作者把原因追溯到显式程度本身:模型与护栏内部的危害读数都随措辞变软而下降,沿显式方向对 Qwen3Guard 做激活引导可把标记率从 26% 推到 100%。

    推荐理由论文把监控器召回率按目标模型是否真的作答来切分,并给出措辞阶梯训练护栏的配方,做护栏评测与部署的团队可据此重设指标。

  16. 论文追踪 · 收录 · 原文 论文53

    SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

    研究者发布 SRE-Bench,一个由逆向工程专家投入 5000 多专家小时从零构建、避免训练数据污染的逆向工程基准,包含 19 个平均 16,915.8 行代码的私有程序、44 种自研反分析机制,共 262 个二进制实例和 1,572 个确定性评分任务。在标准化公开评测中,GPT-5.6-Sol 与 Claude-Fable-5.1 分别只完整解出 31.5% 和 26.9% 的实例,说明源码安全能力强并不等于二进制分析能力强。在无预算上限、关闭安全护栏的模型方内部评测中,GPT-6-Astra 达到 99.2% pass@4,但从多次尝试中挑出正确解仍是未解问题。自研保护套件把 GPT-5.6-Sol 的平均分从 4.69 降到 2.50(满分 6),其他较弱模型几乎归零;GPT-6-Astra 基本保住分数,但在受保护二进制上的每分成本升至 1.5 倍。分析还显示,编译器优化和静态链接对 Agent 影响很小,而去除符号代价高昂,表明当前 Agent 更依赖名称线索而非指令级推理。

    推荐理由SRE-Bench 用 5000 专家小时从零构建的私有二进制,把逆向工程从源码安全评测中单列出来,并给出前沿模型在真实规模与混淆下的分数落差。

  17. Scale AI Research / SEAL · 收录 · 原文 46

    Scale AI 提出 ChainWorld,将 OSWorld 原子任务组合成长程桌面工作流评测 Agent

    Scale AI 研究团队提出 ChainWorld,通过方向兼容性搜索把 OSWorld 的原子桌面任务组合成长程桌面工作流,同时保留原有评测器。该工作流包含 347 条长度为二到四的任务链,并对同一任务序列采用两种呈现方式:单轮评测把所有任务放在一个提示词中,多轮评测则逐个揭示任务。在四款现有 computer-use Agent 上,任务链最高完成率为 31%;多轮评测提升了其中三款模型的完成率,但两种协议都仍具挑战性。两种协议暴露出不同的失败特征:单轮失败集中在产物精度,多轮失败更多体现为会话管理问题,如进度碎片化和后续轮次脱离。

    推荐理由ChainWorld 把原子桌面任务串成长程工作流,并对比单轮与多轮协议下四款 computer-use Agent 的完成率与失败模式。

  18. Scale AI Research / SEAL · 收录 · 原文 40

    Scale AI 发布 SWE-INTERACT 基准,评测编码 Agent 的多轮交互能力

    Scale AI 的研究团队发布 SWE-INTERACT,把软件工程任务改造成多轮、用户驱动的编码会话,测试 Agent 能否在需求逐步揭示的过程中发现用户意图并迭代修改。基准由用户模拟器从模糊或不完整的指令开始,逐步补充需求、检查 Agent 工作区并给出针对性反馈和约束,直到完整任务目标交付。评测覆盖多个前沿与开源权重模型,结果显示单轮 SWE 任务上的强表现无法可靠迁移到多轮用户驱动流程:表现最好的模型能解决约 50% 的单轮基线任务,但只能解决约 25% 的对应 SWE-INTERACT 任务。Opus 4.8 和 GPT 5.5 等最强模型在模糊初始指令下起步较好,能坚持到需求全部浮现并写出较干净的代码,但仍存在过度自主编码、遗忘需求和技术错误;较弱模型在模糊条件下起步差、过早放弃、遗忘或忽略指令并更多返工。

  19. Scale AI Research / SEAL · 收录 · 原文 38

    Scale AI 发布 HarnessOpt-Bench,评测 LLM 的 Agent 框架优化能力

    Scale AI 研究团队发布 HarnessOpt-Bench,用于在评估成本高且结果随机的条件下衡量前沿 LLM 端到端优化 Agent 框架(harness)的能力。优化器由一个 LLM 搭配编码框架组成,接收目标 Agent 的初始框架、带评分的评估反馈和固定的目标评估预算,通过修改框架并提交最终候选方案,其得分由在搜索全程不可见的留出测试集上相对初始框架的归一化增益决定。可信执行环境负责执行评估边界、计量目标 Agent 的资源消耗并保留候选版本以供审计。研究在 4 个下游任务上以共享编码框架和各自原生框架两种方式评测 5 个前沿 LLM 作为优化器,共完成 111 次计分运行。结果显示,优化器模型之间的差异大于它们所用编码框架之间的差异,原生框架并不总是更优,增益在不同任务和初始框架条件下波动明显。

  20. Scale AI Research / SEAL · 收录 · 原文 46

    Scale AI 发布 CliniCARE-Bench:基于 MIMIC-IV 的临床审计智能体评测基准

    Scale AI 研究团队发布 CliniCARE-Bench,一个由临床医生验证的基准,用于评估 AI 智能体在真实纵向 EHR 数据(MIMIC-IV)上的回顾性临床审计任务。基准包含 25 个由临床委员会编写并验证的场景,覆盖 14 个医学专科和十类推理技能,实例化为 750 个患者病例,要求智能体检索证据、应用临床政策并给出四种裁决之一(是、否、数据不足的不确定、医学上模糊的不确定)。评测不仅看准确率,还考察证据溯源、政策引用、流程合规和校准弃答。对 16 个前沿智能体系统的测试显示,原始准确率为 65.3%–76.1%,但在惩罚被禁止的推理捷径后,无缺陷准确率下降 4.8 至 14.8 个百分点,且所有系统在需要延后判断的病例上都系统性地弃答不足。

    推荐理由该基准用真实 EHR 数据考察临床审计智能体的证据溯源与校准弃答,并给出 16 个前沿系统的过程缺陷数据。

  21. Scale AI Research / SEAL · 收录 · 原文 46

    Scale AI 推出 READY 企业 Agent 部署评测框架

    Scale AI 研究团队发布 Reliable Enterprise Agent Deployment(READY)评测框架,用于判断 AI Agent 能否在具体企业工作流中部署。该框架在保留各工作流自身成功定义的前提下,测量人机系统的可靠性与运行成本,从候选监督策略中选出满足指定可靠性目标的最低成本策略,并在留出案例上做统计资格认定,输出包含可靠性、人工监督负担和成本的部署画像。READY 以开源测试床实现,将工作流定义、执行、评测与部署资格认定解耦,可运行在现有 Agent 评测基础设施上。在覆盖 16 个 Agent 系统、750 个案例的临床审计端到端案例中,两个自主准确率仅差 0.3 个百分点(72.8% 与 72.5%)的系统,在同一 76% 可靠性目标下分别需要 39.2% 和 29.6% 的人工复核。

    推荐理由READY 把评测从自主准确率转向可靠性、人工监督与成本的部署资格,企业选型团队可据此比较不同 Agent 系统。