跳到正文

第 3 页更新的内容回到最新

10月6日周二
  1. 论文追踪 · 收录 · 原文 论文54

    AgentHazard:评估计算机使用智能体有害行为的基准

    研究者发布 AgentHazard,一个评估计算机使用智能体有害行为的基准,包含 2,653 条实例,覆盖 10 类风险与 10 种攻击策略,每条实例把有害目标嵌入一系列单看合理、累积后导致不安全执行的步骤。基准在 Claude Code、OpenClaw 和 IFlow 三个框架上,用 Qwen2.5、Qwen3、Kimi、GLM 等模型评测,结果显示当前系统仍高度脆弱:Qwen3-Coder 驱动 Claude Code 时攻击成功率达 73.63%,GLM-4.6 在 Claude Code 下达 82.90%,平均危害分 7.05。同一模型在不同框架下攻击成功率差异超过 16 个百分点,说明模型层面的对齐不能可靠迁移到智能体层面。基准提供沙箱化、模块化的评测框架与轨迹级执行数据。

    推荐理由AgentHazard 用 2,653 条多步可执行任务测出智能体在累积上下文中的危害行为,并给出各框架与模型的攻击成功率对比。

  2. Hugging Face Daily Papers · 收录 · 原文 论文29

    Tail-Influence Sampling:面向 CVaR 策略评估的尾部影响采样

    针对均值回报相近的策略在罕见失败上差异显著、而估计下尾 CVaR 需大量昂贵 rollout 的问题,作者提出 Tail-Influence Sampling(TIS):为每个可查询条件分布推导"尾部影响",聚合其不确定性经 Bellman 复用对 CVaR 的作用,并据此把固定评估预算重新分配给对尾部最关键的核,另设访问锚定变体防止试点分配不足。在固定维度与正分位边际下,TIS 达到 oracle 渐近方差与一阶 MSE(含试点成本),锚定变体与 oracle 相差不超过两倍。CliffWalking 上相同转移预算下 MSE 较学习占用降低 41%、较完整 rollout 降低 76%;冻结语言模型评审流程中,锚定 TIS 在 24 个 MMLU-Pro 设置中的 23 个优于同等正则化的均值影响混合,六次调用 FinQA 评审的 MSE 比 rollout 低 2.4-3.4 倍。

  3. Hugging Face Daily Papers · 收录 · 原文 论文40

    研究提出医疗答案事实核查失败分类法,指出检索后验证范式的固有局限

    研究者针对开放式医疗答案的事实性验证,提出两套失败分类法,把失败拆解为检索阶段的五类质量维度错误和验证器推理的六个连续步骤错误。研究基于 MedExpert 开放式数据集和 3 个封闭式数据集开展案例研究,并用 LLM-as-Judge 自动归纳模式,对证据质量和验证器推理错误进行大规模标注。在 4 种检索方法和 6 个前沿验证模型上的压力测试显示,扩大模型规模、增加推理投入、引入权威网络来源以及医疗微调都无法消除这些失败模式,说明它们是检索后验证范式在开放式医疗场景中的固有局限,而非旧系统的产物。代码与数据已公开。

10月5日周一
  1. 论文追踪 · 收录 · 原文 论文33

    HakemBench:土耳其语类型化决策基准发布

    HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开放,含 2,346 个条目、4,275 道选择题、是非题与评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。评测框架以宏 F1 衡量决策质量、以归一化 Brier 分数衡量校准、以归一化广义风险-覆盖率曲线下面积衡量选择性自动化,三者取几何平均,并用 2,000 次 bootstrap 给出区间,同时报告选项顺序、改写、英译与替换名称探针。

  2. 论文追踪 · 收录 · 原文 论文35

    多模态声明验证对 LLM 改写有多鲁棒?

    研究测试了多模态声明验证任务对 LLM 改写的鲁棒性,采用自然改写和受控注入两种策略,评估了覆盖五个 VLM 家族、2B 至 38B 参数的 11 个开放权重模型。结果显示多数模型准确率无显著下降,验证任务比评审分数操纵稳定得多,但概率偏移持续存在:对冲类条件在几乎所有模型上引发显著偏移,增强类条件影响较弱,语法纠正等通用润色条件影响甚微。

  3. 论文追踪 · 收录 · 原文 论文39

    论文发现语言驱动机器人安全监控的细化缺口:安全高层计划可能产生不安全执行

    论文审计了语言驱动机器人系统中安全监控的一个轨迹完整性假设,即监控器检查的高层动作序列是否代表执行中实际发生的导航与隐式动作效果。作者在 RoboGuard 上比较同一 LTL 规范下表面计划与图细化轨迹的判定结果,评估包含 28 个受控案例(覆盖五类动作抽象族)和 14 个端到端案例,后者由 SPINE 从自然语言指令生成计划、RoboGuard 生成场景落地的安全规范。在受控评估中,全部 12 个目标抽象案例都出现预期的表面与细化差异,16 个对照案例表现符合预期,作者据此提出基于图的轨迹细化作为轻量缓解手段和物理 AI 安全监控的诊断工具。

  4. 论文追踪 · 收录 · 原文 论文32

    LiteTrajEval:面向生产级 AI 智能体的轻量级评分标准引导轨迹评估

    LiteTrajEval将离线领域规则提取、在线轨迹规范化与压缩,以及单次LLM评判结合,生成智能体轨迹诊断。作者在73条全部为失败的轨迹上评估:检测率对应失败召回,定位对齐度仅针对已检测案例,并允许一定步骤偏差,不能解读为任意生产轨迹的总体准确率。论文报告了相对AgentRx的成本和速度收益,并介绍企业平台试点;试点没有逐步骤真值,完整部署效果仍需进一步核验。

  5. 论文追踪 · 收录 · 原文 论文49

    OLMo-Detect:面向 LLM 成员推断的多阶段混淆控制基准

    研究者提出 OLMo-Detect,一个基于完全开放的 OLMo 2 流程构建的多阶段、混淆控制成员推断基准,覆盖预训练、中期训练和后训练,并在三个关键维度上对齐成员与非成员,同时用 infini-gram 严格过滤非成员。研究还引入成员与非成员错位的 OLMo-Detect(Shifted)变体以评估分布偏移下的鲁棒性,并在 OLMo 2 系列上评测了 15 种无监督和 3 种有监督成员推断攻击。结果显示:最佳无监督与有监督攻击的 AUC 均仅为 0.68,有监督攻击在跨域评测中性能下降;攻击性能在中期训练阶段最高,这一模式由数据类型而非阶段效应驱动,人工整理的数学数据远比其他类型更易被检测;整体分数从 1B 到 13B 提升但在 32B 趋于平台;没有无监督攻击能抵御分布偏移,AUC 变化幅度最高达 0.42。研究称这些结论可推广到 OLMo 3 和非 OLMo 模型。

  6. 论文追踪 · 收录 · 原文 论文46

    CorrectGuard 提出黑盒安全护栏的免查看正确性估计框架

    研究者提出 CorrectGuard,一个面向黑盒安全护栏的免查看正确性估计框架,用于在人类不可查看用户输入和机器不可查看输入两种场景下评估护栏表现。该方法仅使用有标注的可查看数据训练独立的模型评估器,预测护栏对不可访问输入的判定是否正确,无需接触护栏内部。研究在涵盖有害内容、越狱、提示注入和提取的 13 个安全数据集上,以留一数据集方式评估上下文学习、嵌入向量和微调三类正确性模型,并将开源权重护栏统一视为黑盒。结果显示,基于上下文学习的正确性分类器在两种场景下均显著提升错误识别能力,宏观准确率最高提升 25 个百分点,基于微调的方法提升近 15 个百分点,但不同护栏和留出数据集之间差异明显。

  7. Hugging Face Daily Papers · 收录 · 原文 论文36

    HyperBrowseComp:面向网页浏览 Agent 的多语言多模态压力测试基准

    研究者发布 HyperBrowseComp,一个面向网页浏览 Agent 的多语言、多模态基准,包含 423 道由母语或高水平使用者人工编写并验证的题目,覆盖 13 种语言。题目要求给出简短且可公开核实的答案,需要定位冷门证据、追踪多步线索链,或查阅视频、扫描文档、图像、地图等异构来源。为降低仅靠参数化知识作答的可能,作者用无联网模型筛除较容易的题目。评测在统一 Agent 协议下,使用模型厂商自带搜索与共享外部检索框架两种方式,并对部分题目做了人类评估以对照模型表现与投入。

  8. arXiv:危险能力与安全评测 · 收录 · 原文 论文43

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    研究者提出 SceneFactory-3D,一个 GPU 批量、物理落地的多智能体驾驶仿真器,车辆通过悬挂与摩擦受限的力在每个轮胎接触点执行加速和转向指令,空间变化的摩擦、逐世界 3D 高度场、重力与刚性接触共同约束车轮运动和底盘碰撞。逐世界地形隔离与 GPU 批量使其能并行运行匹配的物理反事实:交通场景设置和车辆控制器保持不变,只改变路面条件,从而在并行世界中评估闭环影响。作者据此对车辆控制器对路面条件的敏感性做了实证研究,在每种条件下 1024 个匹配的 12 车世界、21 种摩擦与坡度条件下测试三类学习策略,并在共享的 32 世界子集上测试两种经典规划器。当摩擦从 1.0 降至 0.18 时,学习策略安全通过施工区的车辆比例下降 6 至 90 个百分点,经典规划器下降 18 至 19 个百分点,且每种学习策略的接近碰撞情形都更频繁。代码已开源于 GitHub。

  9. arXiv:危险能力与安全评测 · 收录 · 原文 论文50

    研究:分类后缀可提升激活探针的分布外恶意输入检测

    研究者在 13 个安全基准(越狱、提示注入与正常对话)和 Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B 三个开源模型上,用严格的留一数据集(LODO)评测检验用户轮次后附加分类指令对激活探针的影响。单点探针上,分类后缀相比无后缀可将分布外检测的 AUC 提升最多约 4 个点,而跑题或仅表示关注的后缀几乎没有帮助。增益来自分类这一格式本身而非具体判据,无内容标签的后缀与真实恶意/良性判据效果相当,判据只在严格阈值下提升精确率。该结论也适用于生产中的多点池化探针(attention、multi-max、MLP),但最优后缀随读出方式变化;通过 KV-cache fork 部署时,它是一种低成本即插即用方案,但具体哪种后缀有效、提升多少取决于模型与读出方式。

  10. 论文追踪 · 收录 · 原文 论文48

    PowerBench 评测 24 个模型在权力转移请求上的偏见

    研究者提出 PowerBench,用于评测语言模型在权力转移类请求上的系统性差异,把请求分为自我赋权、去权和夺权三类,并设置不改变权力的拒答诱导请求作为对照。数据集在权力领域、情境、受影响方规模和用户原有权力地位上做变化,覆盖 24 个模型(12 个来自美国开发者、12 个来自中国开发者),在用户与受影响方国籍互换、AI 智能体作为用户、8 种请求语言三种条件下评测。结果显示模型对夺权的拒答多于去权,对去权的拒答多于自我赋权;夺权拒答率随受影响方规模从个人上升到社会而提高。模型倾向于帮助他人从美国夺取权力,而不愿帮助美国用户从他人处夺取权力,但在美国获得权力且无人受损时偏向美国。当用户是 AI 智能体时,对权力转移请求的拒答增加,在针对个人的夺权上尤为明显。

  11. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文52

    OEB 基准:从 Agent 执行记录评测开放式研究中的认知过程

    研究者提出 OEB(Open-Endedness Bench),一种只读取 Agent 执行记录、不依赖参考答案或结果分数的基准无关评测方法,用于衡量 Agent 在开放式研究任务中的认知过程。OEB 把执行记录编译成统一的认知事件图,边连接 Agent 提出的命题与检验该命题的实际动作,每个节点附带可由代码在记录中核验的原文片段。其评分原则是:文字可以提出命题,但只有已执行动作返回的证据才能支持或反驳它。基于该图,OEB 从证据、实验、修正和反奖励作弊四个能力维度打分,并刻画六种主观研究习惯画像。

  12. 论文追踪 · 收录 · 原文 论文54

    宾州州立大学提出 TPRS,量化 Agent 安全基准中工具命名对 ASR 的影响

    宾州州立大学研究者提出威胁保持表示敏感性(TPRS),衡量在任务、有害动作、安全策略、真值和评测标准不变、仅改变 Agent 可见表示时攻击成功率(ASR)的变化幅度。在 ASB、MCPTox 和 AgentDojo 三个基准共 28,904 次 Agent 运行中,ASR 变化方向不一致:ASB 把威胁相关工具名换成中性名后,GPT-5-mini 的 committed ASR 上升 11.67 个百分点,Claude Haiku 4.5 上升 13.21 个百分点;MCPTox 把中性名换成威胁相关名后,GPT-5-mini 的 ASR 下降 11.00 个百分点,Haiku 4.5 下降 4.11 个百分点;AgentDojo 在 GPT-4o-mini 上 ASR 仅变化 0.50 个百分点,但需要该工具的任务上良性效用下降 5.36 个百分点。

    推荐理由论文用近 2.9 万次 Agent 运行量化了工具命名等表示变化对 ASR 的影响,做 Agent 安全评测的团队可据此检查自己的基准是否对表示敏感。

  13. 论文追踪 · 收录 · 原文 论文53

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束,GPT-5.5 发生率 11.5%

    论文识别并形式化了一种长程智能体失效模式 GHOST,即安全约束在早期对话中提出后,任务在后续良性交互中被恢复执行时该约束不再生效,导致不安全执行。作者提出 SCARBench 基准,包含 6 类工具使用域的 103 个场景、412 个匹配条件实例,长历史为 6,000–6,176 tokens、56–160 轮。在无攻击、用户良性的条件下,7 个受测模型均出现 GHOST,发生率从 Kimi-K2.6 的 6.8% 到 Qwen3.5-4B 的 27.8%;GPT-5.5 的严格 GHOST 率为 11.5%,其 Long Explicit 安全完成率 88.7%,当约束只能从长历史中恢复时安全完成率下降 12.4 个百分点。理论部分用条件风险框架证明,若安全前缀上的残余违规风险下界不可求和,执行几乎必然进入危险区域。

    推荐理由论文给出 GHOST 在 7 个模型上的发生率与可复现基准,部署长程 Agent 的团队可据此检查历史安全约束是否仍生效。

  14. 论文追踪 · 收录 · 原文 论文60

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    日本北陆先端科学技术大学院大学(JAIST)研究者 Zhuowen Liu 在论文中重测了 15 个提示注入检测器和 2 个任务感知 LLM 判官,发现公开基准上的检测排名很难迁移到 Agent 实际场景。研究用无 LLM 回放 AgentDojo 与 τ-bench 的真实工具调用构造良性输出,再用差分回放标注注入输出,并在 BIPIA 上对比。BIPIA 上表现最好的 PIGuard 在 1% 假阳性率下只检出 2.1% 的 AgentDojo 注入,而检出 72.2% AgentDojo 注入的 Prismor 在 τ-bench 上只有 15.2%;BIPIA 与 AgentDojo 之间的 Kendall τ 仅 0.01。相反,工具输出上的假阳性率在两个 Agent 基准间保持一致(τ=0.67),范围从 0% 到超过 90%。

    推荐理由论文用 AgentDojo 与 τ-bench 的真实工具输出重测 15 个注入检测器,指出公开基准分数难以预测部署表现。

  15. 论文追踪 · 收录 · 原文 论文53

    MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%

    MLCommons 发布 Jailbreak Benchmark v1.0,对八款开源权重模型做单轮文本越狱评测,不安全回复率从基线的 11.08% 升至攻击条件下的 18.65%,平均韧性差距 7.57%。评测覆盖暴力犯罪、无差别武器、仇恨、儿童性剥削等 11 类危害,每类 24 条种子提示词共 264 条,并实现 12 种越狱攻击,其中内容框架与欺骗类因评测器限制未纳入定量分析。角色扮演、模板以及包装或 schema 类攻击的平均攻击成功率最高;31B 参数以下的可及模型平均差距约 21%,但样本量小,结论仍属初步。三款 Large 类模型出现负韧性差距,即攻击条件下的不安全回复率低于基线,作者认为可能来自评测器行为、解码设置、真实鲁棒性或模型针对越狱特征而非违规内容本身的拒答。

    推荐理由MLCommons 首次给出端到端越狱评测的完整结果与韧性差距指标,可对照自家模型的基线安全与抗攻击表现。

  16. 论文追踪 · 收录 · 原文 论文53

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    复旦大学与中关村实验室等机构的研究者提出 EvoRiskBench,一个面向工作区 Agent 运行时安全风险的演化基准,用 EP–Path–EF 框架把九类风险入口与五类技术后果通过 Agent 执行路径连接起来。基准包含六个场景下的 450 个可执行对抗任务,在隔离的 Windows 容器中运行,并用执行轨迹、环境状态和 ETW 进程与网络事件独立验证攻击结果。研究者在三种模型(GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5)与三种 harness(Claude Code、Codex、OpenClaw)组成的九种配置上做了 4050 次攻击执行,总体攻击成功率 37.46%,最高为 DeepSeek-V4-Pro-0813 配 Codex 的 68.44%。

    推荐理由论文给出九种 Model × Harness 组合在 450 个可执行用例上的 ASR 与 TSR,并指出模型差异大于 harness 差异,可供部署工作区 Agent 的团队对照自身配置。

  17. arXiv · 收录 · 原文 论文32

    超越最终决策:面向透明 AI 辅助同行评审的流程中心基准

    研究者提出一个以流程为中心的诊断基准,用于评估 AI 辅助同行评审中模型决策是否有充分可靠的评审证据支撑。该基准将 PeerRead、NLPeer ARR-22 和 OpenReview-ICLR 的异构评审记录转换为流程对齐数据,以从论文内容直接预测决策为基线,比较 Gold-process 与 Predicted-process 变量的决策价值,并进行阶段级评估、链一致性评估和干预敏感性分析。在三个数据集、六种模型上的实验显示,Gold-process 变量决策价值普遍更高,Gold–Predicted 差距跨数据集和随机种子稳定,模型生成的中间评审文本虽在相邻阶段局部一致性较高,但最终决策并未持续获得前序评审证据支持。

  18. arXiv · 收录 · 原文 论文48

    READY:面向企业 Agent 部署的可靠性资格认证框架

    研究者提出 Reliable Enterprise Agent Deployment(READY)框架,用于判断 AI Agent 能否在企业工作流中部署。该框架保留各工作流自身的成功定义,同时施加统一的资格认证流程:给定 Agent、工作流和候选监督策略类,READY 测量人机系统的可靠性与运行成本,选出满足指定可靠性目标的最低成本策略,并在留出案例上做统计资格认证,最终给出包含可靠性、人工监督负担和成本的部署画像。READY 以开源测试床实现,将工作流规范、执行、评估与资格认证解耦,可运行在现有 Agent 评测基础设施上。在一项覆盖 16 个 Agent 系统、750 个案例的临床审计端到端案例中,两个自主准确率仅差 0.3 个百分点的系统(72.8% 与 72.5%)在达到同一 76% 可靠性目标时,所需人工复核比例分别为 39.2% 和 29.6%。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文39

    A²E:面向 Agent harness 的端到端审计评测引擎

    研究者提出 A²E(Agent Auditing Engine),一个面向 Agent harness 的端到端评测引擎,用于系统评估 harness 能力。该引擎基于新提出的 Agent Task Protocol(ATP)快速接入不同 harness 的评测任务,并通过自动插桩的 Monitor 在实验过程中捕获并生成标准化执行轨迹。评测阶段使用一组多维指标,除正确率外还刻画 harness 在执行效率、工具使用、任务规划和错误恢复上的差异。实验显示,模型与 harness 的组合在不同类型任务上表现差异明显,没有单一组合能在所有任务上持续领先。代码已公开。

  2. 论文追踪 · 收录 · 原文 论文36

    ContextWeave:面向长周期办公工作流的智能体记忆基准

    研究者提出 ContextWeave,一个纵向基准,用于评估回忆到的经验能否提升语言智能体在真实办公工作流中的下游表现。该基准将 14 名参与者数月的工作流重建为 1,005 个可执行任务,其中 568 个为核心评测任务,包含指令、容器化环境、轨迹和任务专属评分标准,衡量工作区质量与参与者偏好对齐,并诊断相关性、连续性、可解性和对误导性回忆的鲁棒性。在固定模型下比较六种记忆组件,最强配置将 Workspace Score 从 68.08 提升到 78.20,Preference Score 从 41.50 提升到 70.60。固定记忆组件时,回忆对全部五个被测基座模型都有改善,但幅度差异明显。分析显示,可操作、经验丰富的记忆比精简摘要更能支持工作流延续并减少重复探索,同时也更容易受误导性回忆影响。

  3. 论文追踪 · 收录 · 原文 论文49

    Vero:首个仓库级实现与证明联合合成基准,最强 Agent 仅解出 43 个实例中的 27 个

    研究者提出 Vero,首个在仓库层面评估实现与形式化证明联合合成的基准,用于衡量 AI Agent 能否构建经过机器校验的软件。Vero 包含 43 个多模块实例,取自 Python、Dafny、Verus 和 Coq 的真实仓库,覆盖密码协议到分布式系统等领域,每个实例由带预定 API 接口的 Lean 4 多模块仓库、人工整理的形式化规格和参考实现组成,支持仅证明与代码加证明两种评测模式。基准还引入审计机制,允许 Agent 形式化证明给定规格不可满足或参考代码有误,从而在整理阶段暴露并修正潜在的代码与规格错误。在可访问 Lean 工具链的前沿编码 Agent 配置下,最强 Agent 仅完整解出 43 个实例中的 27 个,在最难的仓库上未能闭合任何规格。作者开源了基准、整理流程与评测框架。

  4. 论文追踪 · 收录 · 原文 论文59

    ActBench:面向协作智能体行为安全的自演化基准

    香港城市大学、浙江大学、伦敦大学学院与小米的研究者提出 ActBench,一个从执行轨迹而非最终回复评估协作智能体行为安全的自演化基准。基准包含 213 个场景的 300 对良性/恶意配对用例,覆盖 15 种风险行为、六个执行空间和 48 个 web 服务 API,恶意用例在保留指令、配置、初始状态与评分标准的前提下注入任务可达载荷。构建方法结合奖励引导的束搜索与基于反思的深度探测,并用日志证据与 LLM 轨迹证据的双重验证判定攻击是否真正生效。在 24,000 条轨迹上评估 15 个 LLM 和 6 个开源协作智能体,固定框架时攻击成功率从 10.1% 到 94.4%,固定基座模型时跨框架从 73.7% 到 94.4%,模型差异大于框架差异。基准已开源于 https://github.com/zjuicsr/ActBench。

    推荐理由该基准用配对良性任务与对抗变体,从执行轨迹而非最终回复判定行为安全,并给出跨模型与跨框架的攻击成功率对比。

  5. 论文追踪 · 收录 · 原文 论文27

    EXE-Bench:为真实可用性对 AI Windows 恶意软件检测器进行权衡排名

    EXE-Bench 是一个面向 AI Windows 恶意软件检测器的综合基准,从性能、时间鲁棒性、对抗鲁棒性和计算开销四个维度打分并聚合为单一分数,用于直接公平地比较模型。该基准指出,仅在部署后评估无法完整反映检测器表现;通过特征工程注入的领域知识在抵御时间推移和对抗攻击上仍极为有效,而多数深度网络仅在部署初期表现优异。

  6. 论文追踪 · 收录 · 原文 论文46

    AIR-BENCH Live 发布:可自动更新的基础模型安全基准

    研究者提出 AIR-BENCH Live,作为 AIR-BENCH 2024 的自更新后继版本,通过自动监测政府监管、将新政策条款归入现有风险分类或提出新类别,并用多智能体、人格驱动的提示词生成算法产出多语言提示词。当前版本将基准从 314 项细分风险扩展到 335 项,新增 21 个类别,来自七个司法辖区的 31 条全新政策条款。对 14 个近期模型的评测显示安全表现差异较大(按模型自身行为判定为 0.17 至 0.89),更新后的提示词平均比 2024 版难 0.06 分,降幅集中在最顺从的模型上,且多数模型在非英语提示词上安全性略低。

  7. 论文追踪 · 收录 · 原文 论文56

    研究者提出影子评测:前沿 Agent 六天未能完成两篇 NeurIPS 投稿级研究

    研究者提出一种名为影子评测的新方法,把两篇尚未公开的 NeurIPS 2026 投稿的核心研究问题交给前沿 Agent,由原文作者按会议审稿标准打分。实验给 Agent 六天时间、3000 美元 Anthropic API 额度、GPU 算力和完整虚拟机与开放网络访问,Agent 独立完成了全部工程环节,但两篇论文均被作者明确拒稿,分别评为 Reject 和 Strong Reject。研究归纳出五类反复出现的失败模式:对可发表研究标准的判断不足、面对研究设计缺陷缺乏创造性应对、无法从死胡同有效回退、资源与时间意识薄弱、指令漂移。用 GPT-5.6 Sol 与 Codex 复现的实验重现了几乎全部失败模式。研究未发现明显的奖励作弊,但记录到一次访问 token 被提交进仓库,以及五次子 Agent 幻觉或误报结果被主 Agent 发现。

    推荐理由两项影子评测用未发表论文的原始问题考察前沿 Agent,给出可复现的失败模式清单与专家评分,为判断 AI 研发自动化进度提供新方法。

  8. 论文追踪 · 收录 · 原文 论文43

    范围综述梳理 LLM 聊天机器人对心理健康的 119 篇相关文献

    一篇发表于 npj Digital Medicine 的范围综述系统梳理了 119 篇关于 LLM 聊天机器人(LLM-CB)心理健康危害的文献,将其归纳为概念性工作、心理健康支持使用、认知过度依赖、AI 依赖和 AI 精神病五类主题。综述指出,概念性文献共列出 22 种潜在危害,涵盖幻觉、谄媚、偏见、数据隐私、缺乏监管等,但多数仍属推测,实际影响程度不明。在心理健康支持使用类研究中,18/29 为情境/基准研究,显示 LLM-CB 在高风险情境下可能给出不恰当或有害回应,但用户实际受影响程度尚未量化。认知过度依赖类研究(15 篇)发现频繁使用与认知和学业表现下降相关,其中 3 项实验研究提示因果关系,但对批判性思维的影响结论不一致。综述还提到 OpenAI 2025 年自报数据估计超过百万 ChatGPT 用户(约 0.15%)表现出严重心理困扰迹象,该数据基于内部分类器、未经独立验证。

  9. 论文追踪 · 收录 · 原文 论文36

    研究对比家长与青少年对 AI 伴侣使用的不同描述

    研究分析了 2023 至 2026 年间来自家长与青少年 Reddit 社区的 1,628 条关于青少年使用 AI 伴侣的帖子,并构建了覆盖使用方式、风险、收益与家长干预的编码手册,用 LLM 在语料规模上应用。两个社区呈现出不同图景:青少年最常讨论从 AI 伴侣获得情感支持(占青少年帖 31%,家长帖 19%),家长最常讨论青少年将 AI 伴侣用于浪漫和性互动(36% 对 25%)。青少年也并非忽视其他风险,依恋与依赖是他们提及最多的风险(19%),接近家长的 16%。青少年还描述了以风险为中心的分类未涵盖、家长很少提及的收益,最突出的是情感支持(27% 对 5%)。作者认为这些差异与某种使用方式对对话外的人是否可见有关,并建议家长指导和系统设计应关注既不会通过这两种途径被家长察觉的使用场景,情感支持居首。

  10. 论文追踪 · 收录 · 原文 论文53

    微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性

    微软等机构的研究者发布 Thinkingbox 沙盒与 Thinkingbox-bench 基准,用于评估 Agent 在有状态业务流程中的可靠性。沙盒提供隔离的 MCP 兼容工具会话、完整执行轨迹,并以终端后端状态和副作用作为判定依据;基准包含零售、酒店、车险、数字银行内部 IT 与咨询 IT/HR 五个领域的 507 个策略约束工作流,每个任务用可执行检查判定,允许不同有效路径但拒绝错误、缺失或多余的状态变更,其中 30 个任务额外检查最终回复的必需属性。研究者在 18 个闭源与开源模型上每任务重复 20 次试验,发现可靠性明显下降:Claude Opus 5 从 66.50% pass@1 降至 47.53% pass^20,Kimi-K3 从 57.37% 降至 17.60%;Qwen3.8-27B 的 pass@20 达 89.35%,但 pass^20 仅 10.93%。

    推荐理由论文给出 507 个有状态业务流程任务与 18 个模型的重复试验结果,可看到 pass@1 与 pass^20 之间的可靠性落差。

  11. 论文追踪 · 收录 · 原文 论文42

    AgentAudit:面向 AI Agent 全生命周期信任评估的开源框架

    研究者提出 AgentAudit,一个可附加在任意 LLM Agent 上、只读取执行轨迹而不干预其运行的开源评估框架,覆盖规划、工具选择、工具执行、记忆与推理的完整流程。该框架从指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实性、安全与执行完整性十个能力、接地、安全与行为维度评估整条执行轨迹,并结合行为分类与失败归因定位出错的阶段。所有轨迹由同一个固定裁判模型打分,而该模型本身也是被评测模型之一,作者在第七节 E 小节讨论了这一局限。论文还指出,任务完成表现相近的模型在可信度上可能差异很大,若干非前沿模型在对抗任务中反复被归类为 Unsafe_Compliance,而不只是任务失败,这是通过/失败式基准无法呈现的区别。

  12. 论文追踪 · 收录 · 原文 论文48

    Harness-IF:评估编码 Agent 跨指令面的指令遵循能力

    研究者提出 Harness-IF,用于评估编码 Agent 在多个指令面上的规则遵循情况,并区分真正遵循与碰巧符合默认行为。该基准包含 60 个真实多轮编码任务,取自 642 条规则库,256 条规则获得判定,分布在部署 Agent 会读取的五个可配置指令面上。为区分遵循与巧合,作者提出 Against-Prior Accuracy(AP-Acc),只对与模型无提示默认行为相反的规则打分,通过九次探针构建中隐去规则重跑任务来观测。在 12 个前沿模型上,准确率为 72.1% 至 85.9%,AP-Acc 为 66.1% 至 78.6%,所有模型在反先验规则上表现更差,差距 3.6 至 7.4 个百分点,平均 5.81。作者指出聚合分数会以模型相关的幅度高估遵循程度。

  13. 论文追踪 · 收录 · 原文 论文53

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    研究者构建了覆盖十类政治敏感话题的 200 张图像基准,对 9 个视觉语言模型(7 个中国来源、2 个非中国来源)在四种提问范式和两种提示语言下运行 21708 次试验,由两个前沿 LLM 评审按六个维度逐条标注,并在 200 条样本上与三名人类专家验证。结果显示,中文提示下出现国家立场改写的几率约为英文提示的 3.67 倍,且在每个模型内部都成立;中国来源模型的改写率高于非中国模型,方向在两个评审和人类标注者间一致,幅度随评审不同在 1.6 至 3.2 倍之间。改写集中在文本提及敏感主体的条件下(36.5%),仅给图像时为 9.8%;在四代 Qwen 多模态模型上,显式拒答下降而国家立场改写上升,改写以替换和委婉语为主,且不含拒答关键词,关键词检测方法难以发现。

    推荐理由对 9 个视觉语言模型 21708 次试验的审计显示,审查正从可见的拒答转向难以察觉的改写,为多模态安全评测提供了新的测量维度。

  14. 论文追踪 · 收录 · 原文 论文50

    aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡

    研究者提出 aiXamine,一个统一黑盒评测平台,把 LLM 的安全、安全(security)与隐私当作相互依赖的属性来评估。平台通过自动化红队流程编排 9 项服务上的 46 个测试,生成从提示词级诊断到跨服务权衡分析的分层风险画像,可在相同条件下复现对比闭源与开源权重系统。作者用 aiXamine 测试了 120 多个 LLM、超过 5000 次测试运行,发现三种单轴评测看不到的跨维度现象:更强的对齐会系统性提高过度拒答,形成可量化的安全税;隐私与其他可信维度近乎正交,标准对齐无法覆盖;无 on-policy 校正的 off-policy 知识蒸馏会导致熵坍缩,在同一基础架构上把鲁棒性从 56.9 降到 2.6。

  15. 论文追踪 · 收录 · 原文 论文58

    论文发现安全监控器主要拦截模型本就会拒答的请求

    Sripad Karne 的论文测量了安全监控器在目标模型实际会作答的请求上的召回率,发现四款文本护栏、两个激活探针和 Latent Guard 在 1% 假阳性率下,对模型会拒答请求的召回率是模型会作答请求的 1.1 到 6.4 倍,而 AUROC 多数仍在 0.85 以上,标准指标掩盖了这一差距。研究基于 647 条有害请求(来自 Aegis 2.0、HarmBench、StrongREJECT),每条改写成间接、直接、直白三个显式程度版本且意图经 LLM 与人工核验;Gemma-4-31B-IT 在直白版本只答 12 条,在间接版本答 340 条,相差 28 倍,其中 344 条翻转请求里各护栏漏放 153 到 321 条。作者把原因追溯到显式程度本身:模型与护栏内部的危害读数都随措辞变软而下降,沿显式方向对 Qwen3Guard 做激活引导可把标记率从 26% 推到 100%。

    推荐理由论文把监控器召回率按目标模型是否真的作答来切分,并给出措辞阶梯训练护栏的配方,做护栏评测与部署的团队可据此重设指标。

  16. 论文追踪 · 收录 · 原文 论文53

    SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

    研究者发布 SRE-Bench,一个由逆向工程专家投入 5000 多专家小时从零构建、避免训练数据污染的逆向工程基准,包含 19 个平均 16,915.8 行代码的私有程序、44 种自研反分析机制,共 262 个二进制实例和 1,572 个确定性评分任务。在标准化公开评测中,GPT-5.6-Sol 与 Claude-Fable-5.1 分别只完整解出 31.5% 和 26.9% 的实例,说明源码安全能力强并不等于二进制分析能力强。在无预算上限、关闭安全护栏的模型方内部评测中,GPT-6-Astra 达到 99.2% pass@4,但从多次尝试中挑出正确解仍是未解问题。自研保护套件把 GPT-5.6-Sol 的平均分从 4.69 降到 2.50(满分 6),其他较弱模型几乎归零;GPT-6-Astra 基本保住分数,但在受保护二进制上的每分成本升至 1.5 倍。分析还显示,编译器优化和静态链接对 Agent 影响很小,而去除符号代价高昂,表明当前 Agent 更依赖名称线索而非指令级推理。

    推荐理由SRE-Bench 用 5000 专家小时从零构建的私有二进制,把逆向工程从源码安全评测中单列出来,并给出前沿模型在真实规模与混淆下的分数落差。

  17. 论文追踪 · 收录 · 原文 论文41

    MemoReason 基准:参数记忆使 LLM 推理成绩最多下降 15.7%

    研究者提出 MemoReason 基准,通过把真实人物、公司、日期替换为同类型虚构实体,构造结构相同但熟悉度不同的配对推理任务,以区分大语言模型的真实上下文推理与参数记忆。对近期 LLM 的评测显示,虚构设定下性能出现一致且统计显著的下降,最高达 15.7%,表明存在明显的记忆偏置。但对虚构设定中失败题目的针对性分析显示,模型很少直接给出对应的真实答案,说明直接调用参数捷径并非主要失败模式,参数记忆影响推理的机制比简单事实回忆更复杂。该基准为研究这些机制并把真实与虚构配对评测扩展到更广推理场景提供了受控框架。

  18. 论文追踪 · 收录 · 原文 论文49

    研究者提出可提取记忆的匹配比较检验方法

    A. Feder Cooper、Percy Liang 等研究者提出用匹配比较来判定语言模型的可提取记忆,即同时测量训练序列与可比非训练序列的生成概率,以非训练序列的概率作为可预测性基线,超过基线才算记忆证据。方法包含两种形式:在序列从总体抽样时使用按选定假阳性率校准的 conformal 检验,以及针对单文档、以匹配的非训练文档校准的普查。在 Wikipedia 上,OLMo 2 32B 复现非训练 10-token 后缀的频率约为训练后缀的 24%,这部分反映的是假阳性而非记忆;在书籍数据上,Llama 3.1 70B 的校准普查阈值低至 10^(-27),可为任何可行采样预算都难以提取的序列提供记忆证据。作者据此把可提取记忆重新定义为同时满足有效记忆主张与在现实预算内近乎确定生成。

  19. 论文追踪 · 收录 · 原文 论文54

    研究团队用收敛与区分效度检验 56 个 AI 基准,发现安全基准相关性普遍偏弱

    斯坦福、微软研究院等机构的研究者将社会科学中的收敛效度与区分效度方法引入 AI 基准评估,用 53 个模型在 56 个能力与安全基准上的排名相关性来检验这些基准是否真的测量了它们声称测量的概念。研究发现,同一安全概念下基准之间的模型排名相关性往往很弱,说明这些概念在不同基准中的定义可能并不一致;而能力概念(如推理、知识)下,同一概念内与不同概念间的相关性几乎一样强,说明这些概念之间缺乏区分度。部分基准的相关性更多由设计要素(任务结构、评分格式)而非概念决定,使用 LLM-judge 评分是比共享概念更强的相似性预测因子。个别基准可能测的是别的概念,例如 BBQ-accuracy 与推理基准的相关性强于与偏见基准的相关性,DecodingTrust-Fair 与知识基准的相关性强于与偏见基准。团队公开了 item 级与基准级的模型输出和分数数据集。

    推荐理由论文用 53 个模型在 56 个基准上的排名相关性检验基准是否真的测了它声称的概念,并公开了 item 级数据。