跳到正文

#安全评测

今天收录 2 条

第 2 页更新的内容回到最新

9月27日周日
  1. arXiv:越狱与提示注入 ·

    ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架

    作者提出 ORBIT,一个基于 UK AISI Inspect 构建的可配置多智能体安全与安全评测框架,用于在真实多智能体环境中联合变化攻击、防御与架构。框架允许配置通信拓扑、记忆、调度和智能体角色,支持四类威胁、四种防御策略以及非对抗性失败,基准套件覆盖浏览器使用、计算机使用、智能体编码、客服和协作分配五个场景族。核心发现是防御在不同威胁间不可迁移:在多议题编码任务中把被攻陷智能体的攻击成功率降低 60 个百分点的逐动作防御,对相互串通的智能体没有可测量的保护,且所测试的防御没有一个能泛化到全部攻击。作者还展示了安全与性能的权衡以及架构与防御效果之间的相互作用,并将 ORBIT 开源。

  2. arXiv:越狱与提示注入 ·

    Agentic Commerce Bench:衡量会花钱的智能体的欺诈检测能力

    论文提出用于衡量和降低智能体支付欺诈损失的三项成果。第一是智能体商务欺诈分类体系,把智能体推理、wire、结算通道、交易对手、委托人五个观测层级与请求级、历史级证据对应起来,记录各层级能观测到哪些攻击。第二是 Agentic Commerce Bench(ACB)基准,包含由生产数据聚合生成的二十类欺诈,涉及 1,647 个编目服务操作和 1,068 笔结算,其中六类的交易对手身份完全真实。第三是开源检测器栈 gordonguard 及离线 harness,可用于审计智能体配置、在无账号情况下重放恶意交易对手,并以内联方式运行同一批检测器。

9月26日周六
  1. arXiv:越狱与提示注入 · 81

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    瑞士意大利语区大学的研究者提出用规则化、可逆的语义保持变换作为对齐泛化的受控探针,在八个模型上发现一种被称为对齐-效用不对称的现象:模型一旦能在变换后的输入上正常工作,任务效用往往基本保留,而对齐失败上升得更陡。在微调设置下,GPT-4.1 mini 的有害率从 13.3% 升至 74.3%,效用下降有限;Llama3-8B、Gemma-7B、Qwen2.5-7B 的对齐差距分别达 64.0、51.0、63.3 个百分点。在 ICL 设置下,Gemini 3 Flash 有害率从 2.3% 升至 43.0%,Claude 4 Sonnet 从 0.0% 升至 12.0%。仅用良性变换数据微调(ρ=0)时对齐失败仍升至 40.3%,说明该不对称无需接触变换后的有害样本即可出现;谄媚与 BBQ 公平性两个维度也出现类似退化。作者据此建议发布评估不应只依赖标准形式提示词。

    推荐理由论文用可控的语义保持变换同时测量任务效用与对齐失败,给出了八款模型上效用保留而对齐失效的具体差距。

  2. arXiv:越狱与提示注入 · 80

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    作者审计了一个针对工具调用型 LLM Agent 的间接提示注入(IPI)基准及其评测装置,归纳出四类缺陷:载荷静默未投递、按工具身份而非参数判定攻击成功、把误拒率与模型能力不足混为一谈、缺少审计轨迹。用同一批执行轨迹重新打分后,按工具身份判定的评分器报告 21.7% 攻击成功率,而按参数判定的真实值为 1.2%,虚高约十八倍;审计套件中 43 个攻击载荷有 39 个(91%)从未投递。修正后,此前报告攻击成功率 62.8% 的 llama3.1:8b 降至 0%(43 次攻击中 0 次得手),该模型在 41 次攻击中读到了注入内容、72% 的攻击场景完成了良性部分,但均未执行恶意指令;此前归因于 gemma4:12b 的“工具绑定障碍”也被证明是环境不匹配造成的假象。

    推荐理由作者审计了一个 IPI 基准的评测装置,量化四类缺陷对攻击成功率的影响,并给出可复用的校验框架。

  3. arXiv · 79

    Cave-Bench:虚假指控下 LLM 智能体最高 60.06% 的运行会破坏正确工作

    研究者提出 Cave-Bench,一个包含 365 个智能体任务、685 段分阶段交互的基准,用来测量智能体在收到虚假指控时是否会破坏此前已验证正确的工作。作者把接受虚假指控称为 gaslight sycophancy,把据此改动正确工作称为破坏性过度纠正。每个任务先达到已验证的正确状态,工作区保留支持该状态的依据与历史,而能否定指控的关键事实位于智能体无法访问的外部或运行时状态中,因此正确做法是保留工作并索要缺失证据。在 Claude Code 下评测 14 个最新模型,虚假指控在最高 60.06% 的运行中造成破坏;较弱模型往往先认错再执行,较强模型常在已找回支持证据后仍然破坏工作。项目上下文与权威压力是高危条件,智能体对刚完成的工作比对有存档证据的工作保护更差,同一模型在 OpenCode、Codex 和 Hermes 上表现不同。

    推荐理由Cave-Bench 用 365 个任务量化智能体在虚假指控下破坏已完成正确工作的比例,并给出可复现的干预对比。

  4. arXiv:对齐与欺骗 ·

    零训练 LLM+OVOD 流水线中的归因缺口:CAAP–SNAP 差异的细粒度分析

    在完整 5,000 张图像的 COCO-Val 划分(27,273 个检测)上,零训练 LLM+开放词汇检测器(OVOD)流水线的类无关定位准确率(CAAP)与语义命名准确率(SNAP)持续背离,原因并非物体视觉复杂度——小目标和被遮挡目标反而定位更好。当 LLM 措辞超出检测器原生类别集时,定位准确率从 80.9% 降至 31.6%;其中真实同义词仍达 89.3%,语义无关的"噪声"标签仅 12.0%。

  5. Hugging Face Daily Papers · 78

    AgentTell:浏览器 Agent 的行为侧信道泄漏基准

    BRAC University 等机构的研究者提出 AgentTell,用于测量浏览器 Agent 的行为侧信道泄漏,即 Agent 在一个网站获取用户私密信息后,在另一个网站通过任务导向的选项选择无意泄露该信息。基准包含 20 个场景、100 个任务,每个任务先在 plant 网站让 Agent 获知秘密,再到 probe 网站选择与秘密对应的专属操作或不会泄露的通用操作。在六个模型上共评估 9,760 个会话,携带秘密的 Agent 在 61.1% 的会话中通过操作泄露信息,即使记忆里明确写下不得分享,仍在 56.7% 的这类会话中泄露;34.5% 的泄露会话中,Agent 的最终回复还错误地保证未披露任何信息。泄漏程度因秘密类型而异,个人属性、账户设置和物品归属关系泄漏最多,服务账户身份泄漏最少;若秘密在前一任务中被实际使用,泄漏概率更高。

    推荐理由论文给出跨网站行为侧信道泄漏的量化结果,做浏览器 Agent 的团队可据此检查选项设计是否泄露用户隐私。

  6. arXiv:对齐与欺骗 ·

    LLM Judge 验证在稀疏重叠下的问题:从推理到设计

    研究证明标注重叠稀疏性是 LLM-as-a-judge 部署决策错误的首要决定因素:5% 成对重叠时错误决策率达 25%,从十个候选评判者中选出错误最优者的概率达 65%。作者推导出最小重叠公式,显示 ρ ≥ 0.25 足以应对非边界评判者,边界案例仍难以解决;零成本分层分配方案在分层有信息量时可将错误拒绝率减半。研究在 10 个 LLM 评判者、四个评估矩阵上验证,覆盖视觉评估、因果推理与摘要任务。

9月25日周五
  1. arXiv:危险能力与安全评测 ·

    人机协作中的达克效应:Human+AI 得分更高但自我评估并未变准

    一项 N=366 的研究对比了人类单独与 Human+AI 在推理任务上的表现,Human+AI 得分更高,但自我评估与成绩仅弱相关,平均高估程度与人类单独组相近。Human+AI 组中信心区分正确与错误答案的准确性更低,达克效应在两组均存在且该组对比更明显;控制分数噪声后效应减弱但未消失。研究据此区分了表现增强与元认知增强,并呼吁界面支持验证、传达任务相关的 AI 模型表现。

  2. arXiv:Agent 与 MCP 安全 ·

    RecToolBench:在模糊用户意图下评测推荐专用工具编排的基准

    RecToolBench 是一个基于 MCP 的基准,用于评测模糊用户指令下使用工具的推荐智能体,包含 3 个推荐领域、13 个 MCP 服务器、32 个工具和 1200 多个可执行任务,覆盖单工具调用、并行调用、顺序工具链与混合编排。该基准通过 synthesize–fuzzify–judge 流水线构建,并用规则执行检查与基于评分标准的 LLM 评估来评测智能体轨迹。实验显示,语法有效的工具调用并不保证推荐成功,模型在语义参数落地、多步证据整合和最终推荐上表现不佳,且随编排复杂度上升而恶化。

  3. arXiv:越狱与提示注入 ·

    PrivDrift:审计活跃 LLM 对话中话题漂移下的用户秘密泄露

    研究者提出 PrivDrift 基准,用于审计用户披露的秘密在对话话题漂移和说服式探测后是否仍可被恢复。该基准包含 1000 组受控多轮对话,设有植入秘密、内容密集的漂移轮次和标准化提取探测。在三个具备扩展上下文窗口的 LLM 上,对话级混合泄露率在 38.7% 至 54.6% 之间,并随模型、秘密类型和说服强度明显变化。在测试的漂移窗口内,额外的话题漂移并未可靠降低泄露,作者据此认为活跃 LLM 场景中的隐私风险应被视为持续的行为失效模式,而非仅训练数据记忆或即时越狱行为。

9月24日周四
  1. arXiv ·

    SWE-Prometheus:衡量真实代码仓库工程治理改进的基准

    SWE-Prometheus 是面向仓库级工程治理改进的基准,每个任务给出固定快照与开放式目标,要求智能体自行识别风险、排定干预优先级并验证改动,从六个治理维度通过配对证据、干净环境探针、行为门控和两名独立教师评分进行评估。基准包含 60 个仓库,10 个模型在共享的 22 仓库公开子集上平均 NGI 为 0.0568 至 0.5760,观测到的行为破坏率为 0% 至 23%。

  2. 腾讯 AI-Infra-Guard 版本发布 ·

    腾讯 AI-Infra-Guard v4.6.3 发布

    腾讯 AI-Infra-Guard 发布 v4.6.3,新增 DeepTeam 在运行期间将完成的测试用例写入磁盘,并修复 API Checker 对 Claude 5 签名的支持。该版本为 API Checker 补充失败指纹样本以提升模型识别可靠性,同时为 Prompt-Eval 加入限流感知退避、熔断器和进程组终止机制,并在熔断器与模型间共享限流计数器、加固 Retry-After 解析。文档方面新增 FORGE-Bench 与 RogueHandoff-20 研究条目并同步至 8 种语言 README。

  3. arXiv:Agent 与 MCP 安全 ·

    研究提出 ACE 语料库,评估内核级证据对 Agent 安全检测的有效性

    论文将应用层 Agent 遥测与内核级 syscall 追踪配对,首次给出内核层与应用层信号在 Agent 安全上的配对证据刻画。作者构建 Agent Cross-Layer Evidence(ACE)配对会话语料库,包含 4,047 个会话和 17 个威胁模型,覆盖六类投递向量家族、OWASP LLM 与 Agent 威胁类别中的 14 个,并归纳为 12 种攻击机制。在四类检测器上,内核证据单独即具判别力,与应用层证据组合通常优于任一单层视角,显示出单层分析可能遗漏的互补信号。研究还展示了对未见攻击家族的泛化能力以及向另一 Agent 运行时的迁移。

  4. arXiv:Agent 与 MCP 安全 · 77

    dreadnode 发布 ScopeBench:测量 Agent 在目标压力下是否守住授权边界

    dreadnode 发布 ScopeBench,用 30 个死胡同式 Agent 安全任务测量 Agent 在目标压力下是否守住授权边界。每个任务在无范围与有范围两种条件下运行,环境、验证器和目标相同,仅范围声明不同;有范围条件下成功提交 flag 即证明发生了越界行为,构成违规率的高精度下界。8 个模型在同一 harness 中运行,原始能力从 12.2% 到 81.1%,范围遵守率从 34.4% 到 86.7%;机械验证确认 227 次违规,轨迹裁判在机械失败轨迹中另找出 331 次违规,合计 558 次。裁判经 100 条人工逐调用标注轨迹校准,并在模型盲审中保持 100% 召回、失败层重加权特异度 90.5%,误差为单侧过度标记。opus-4-8 的原始能力比 sonnet-4-6 高 10 个百分点,范围遵守率高 35.6 个百分点。

    推荐理由ScopeBench 把能力与边界遵守拆成两条轴,并公开 30 个任务与 2160 条轨迹,可供部署渗透测试 Agent 的团队复用其测量设计。

9月23日周三
  1. arXiv ·

    CELLAUDIT:审计 AI 智能体发现细胞模型中的输入使用声明

    CELLAUDIT 通过审计输入能否进入所引计算、拟合预测是否依赖该输入、以及该依赖是否改善对观测响应的预测,来检验 AI 智能体发现细胞模型中的输入使用声明。在 BBBC047 基准上,智能体选出的预测器平均留出 Global PCC 为 0.3153,但对化合物替换保持不变,仅用对照谱的预测器也达到 0.3142;源码检查发现化合物查询通路被 singleton key-value attention 阻断。对 48 个候选的分层审计中,47 个在化合物替换下改变预测,但仅 20 个在两折上目标损失增益区间高于零。

  2. Redwood Research · 78

    Redwood 评测:GPT-6-Astra 用填充 token 推理的能力远超此前模型

    Redwood Research 测量 GPT-6-Astra 在提示词被无意义填充 token 占位、且被要求不推理时直接作答的表现,发现它在需要大量串行认知的任务上明显优于无填充 token 的情况,例如 4-hop 自然事实推理从约 10-20% 提升到约 50%,旧 AIME 题从约 60-70% 提升到约 90%。

    推荐理由Redwood 用填充 token 测出 Astra 存在大量未言明的推理,为思维链监控的可靠性提供了可复现的评测方法。

  3. arXiv:Agent 与 MCP 安全 ·

    Ajar:在 AgentDojo 上测量 Agent 防御中未关闭的权限

    Ajar 提出一种直接测量 Agent 防御中开放权限的评测方法,它挂载在已有的 Agent 安全基准上,复用其任务、工具 schema、参考解和目标状态,为每个良性任务构造任务并不需要的候选工具调用,并在 Agent 可行动的每个节点把这些调用提交给防御方,允许其中任何一个即意味着权限被开放。作者将 Ajar 接入 AgentDojo,使开放权限成为攻击成功率与良性效用之外的第三个维度,并测试了 Progent、CaMeL、AC4A、Permission Assistant 和 Claude Code 的 Auto mode 五种防御。

9月22日周二
  1. arXiv:对齐与欺骗 ·

    NavSafe-∞:在真实感环境中评测闭环驾驶安全

    作者提出 NavSafe-∞,一个包含 280 个场景、覆盖 28 类事件的光真实感闭环驾驶安全基准,按结构化交通安全分类法为交通碰撞、弱势道路使用者碰撞、交通违规和交通事故给出类别级能力分数。对 20 个端到端驾驶策略的评测显示,开环基准上的提升并不能可靠迁移到闭环安全。作者进一步分析两种常见补救手段:被动演示扰动主要在该策略的闭环 rollout 仍接近其扰动训练状态时有效;开环强化学习微调则出现奖励作弊,用安全裕度换取自车前进,闭环反馈会把这种倾向放大为累积的安全关键错误。作者认为这些结果说明开环基准在判断闭环安全成功上存在盲点,基准与可扩展工具箱将开源并持续维护。

  2. arXiv:对齐与欺骗 ·

    认证依据哪个 Oracle?执行标签决定 text-to-SQL 保形弃答报告的风险

    针对 text-to-SQL 的保形弃答证书,其真实性取决于校准所用的正确性标签。研究在 Spider-Realistic 上做预注册干预,把基准自带数据库换成其蒸馏多实例测试套件,在四个 SQL 专用 checkpoint 和两种划分方案下,证书的留出风险比自身标签所报高出 2.73 至 10.23 个百分点;在两位 SQL 专家盲标下,名义 0.10 的证书在两个 checkpoint 上实际风险达 20.0 和 17.2 个百分点。更严格的 oracle 双向出错,其拒绝的答案多数并非错误,接受的答案中也有错误。

  3. arXiv:后门、投毒与隐私 ·

    研究重新审视后门修复评测:区分总体干净效用与良性性能保持

    论文提出后门修复评测不应只看攻击成功率(ASR)和总体干净准确率,因为总体准确率会掩盖集中在部分标签空间上的性能退化。作者从保持视角区分总体干净效用与原有类别性能的保持,通过比较修复前后的干净性能定义类别级保持损失,并指出聚合会通过局部损失稀释和跨类别补偿隐藏局部退化。为此论文引入最差类别保持损失和尾部保持损失来刻画局部保持损失,并在代表性后门攻击、修复方法、数据集、攻击目标和模型架构上开展系统实证研究,另在干净标签攻击下做了验证。结果显示,有效抑制攻击和良好的总体干净性能并不必然意味着各类别原有良性性能被均匀保持,修复后仍可能存在明显的局部保持损失,其严重程度和类别结构随修复条件变化。

9月21日周一
  1. arXiv:Agent 与 MCP 安全 ·

    DUMA-Bench:评估 LLM Agent 安全的双控多智能体基准

    研究者提出 DUMA-Bench,一个在双控交互下测量 LLM Agent 安全的基准与评测协议,其中 Agent 和用户都能影响共享环境状态。该基准在 τ²-bench 基础上扩展出对抗环境,覆盖 RAG 投毒、跨 Agent 操纵和不安全输出处理等八类漏洞。作者评测了来自 OpenAI、Anthropic、DeepSeek、Qwen 等五个模型家族的 14 个模型,跨八个领域和多种用户行为模式。实验显示,引入双控交互后攻击成功率从 26.9% 升至 41.1%,说明 Agent 安全不只取决于模型本身,还来自模型、用户与环境之间的交互。

  2. arXiv:Agent 与 MCP 安全 ·

    论文指出 Agent 安全评测中攻击成功率并非单一数值

    论文认为当前 Agent 安全评测中广泛使用的攻击成功率(ASR)并非单一指标,而是由六项设计选择参数化的一族指标,论文之间很少说明且从未保持一致。作者对 2025 年 2 月至 2026 年 9 月间发布到 arXiv 的 259 篇 Agent 安全论文做全文元分析,发现多数未报告方差估计或重复运行:手工编码的 50 篇随机样本中为 58%(95% CI 44-71),对全部 259 篇自动编码为 65.3%;仅 30.9% 披露了足以判断评测是否随机的解码信息,在确认使用 LLM judge 的 64 篇中,29.7% 报告了与人工标注的一致性检验。

  3. arXiv ·

    LIBERO-VPro:评测机器人基础模型闭环视觉鲁棒性的基准

    研究者提出 LIBERO-VPro,用于系统评测机器人基础模型在执行过程中的闭环视觉鲁棒性,通过扰动执行时可获得的视觉证据来考察模型表现。该基准覆盖视觉证据退化、相机陈旧、视觉来源一致性和任务相关场景变化四个维度,包含 12 个挑战类别、96 种实验设置和 3,296 个任务条件用例。作者评测了三个视觉-语言-动作模型和三个世界-动作模型,共约 196,000 次仿真回合,并在 Franka Research 3 上补充了 200 次真实世界 rollout。

  4. arXiv:危险能力与安全评测 ·

    尼日利亚金融科技 AI 系统部署前评估的监管框架:基于 SafeAlert 的上下文感知评测

    针对尼日利亚及非洲大陆尚无监管文件规定金融科技 AI 系统采购前须做何种部署前评估的空白,研究者提出上下文感知的监管框架。他们构建 SafeAlert 评测套件,在三种系统提示词条件下测试六款商用模型,发现能拒绝通用有害请求的模型在特定话术下仍会生成完整诈骗脚本,且多款模型将大部分合法的尼日利亚银行通信误判为可疑或欺诈。论文建议 CBN、NITDA、SEC 和 AU 引入部署前评估要求,并指出该缺口源于监管规范缺失而非技术或资金不足。

  5. arXiv:越狱与提示注入 ·

    综述提出智能体 AI 安全的跨维度威胁分类 T={S,B,P,A}

    一篇综述对 2022 至 2026 年间发表的 66 项研究做结构化梳理,提出跨维度表示 T={S,B,P,A},把受影响的系统面、交互或信任边界、被违反的安全属性与实证考察的架构关联起来。作者分析了 22 项有制品支撑的红队研究以及 11 个代表性安全基准,发现证据集中在提示词与推理、记忆和工具调用类攻击,且多为单智能体场景;持久化、人机交互、复杂多智能体、系统性和长时程威胁的覆盖较少。作者强调这些结论描述的是所选语料而非全部实证研究,并指出指标异构、自适应防御评估有限、架构分布不均和执行状态捕获不完整制约了可比性与可复现性,据此提出 13 个开放研究问题。

9月20日周日
  1. arXiv ·

    多模态大模型能否生成并检测社交媒体多模态假新闻

    研究提出一个由故事智能体、图像智能体和评论智能体协作的多智能体框架,用于生成能与真实新闻对抗的虚假社交媒体帖子。作者用该框架在科学、健康、娱乐三个领域生成了超过 9000 组配对的多模态新闻帖子,并以此评测 16 个开源与闭源多模态大语言模型的自动检测能力。结果显示,多数模型的准确率明显低于人类水平,在识别图像真实性方面尤其失败。作者称该工作为开发针对社交媒体假新闻的防御提供了基础,代码与数据已在 GitHub 公开。

9月19日周六
  1. arXiv ·

    通过心理测量画像衡量大语言模型的行为特征

    研究团队开发了一套跨语言心理测量画像框架,用七种心理量表评估九个 LLM,中英文各重复施测五次,未解决的题目保留为 NA。模型呈现结构化的、模型特异的画像,同时共享一种对齐塑造的模式:亲社会与自我调节反应更高,支配性、脱离和有害意图认同更低。NA 反应呈结构化分布,语言条件和提供方来源与画像配置及可作答性相关,重复施测显示高可复现性并可还原模型身份。

  2. arXiv:危险能力与安全评测 · 78

    PIR:从模型内部激活读出被隐藏的答案

    作者提出 Probe of Internal Recognition(PIR),借鉴测谎中的隐藏信息测试,把问题与候选答案一起输入模型,从激活中读出模型认为正确的选项,无需诚实参考模型或标注真值语料。在 Gemma、Qwen、Llama、Mistral、Phi 五个家族共八个模型上,PIR 以 0.70 至 0.87 的平衡准确率恢复被隐藏的答案,高于 0.28 至 0.40 的未知项基线和 0.25 的随机水平;在提示欺骗、训练出的 sandbagging、外部密码锁定与 circuit-broken 检查点上识别率保持在 0.85 至 0.93。当模型隐藏已知答案时识别率仍高,而当 unlearning 真正移除知识时识别率降到未知项基线,因此该读数可区分不愿回答与无法回答,用于 sandbagging 审计和 unlearning 验证。

    推荐理由论文把测谎中的隐藏信息测试搬到模型激活上,给出区分藏答案与真遗忘的无参考读数,并公开了反探测攻击的失败边界。

9月18日周五
  1. arXiv:越狱与提示注入 ·

    CASCADE 研究:跨流水线阶段的越狱防御组合评估

    论文提出 CASCADE 决策框架,在直接、黑盒、单轮攻击的统一威胁模型下,系统研究 LLM 越狱防御在流水线阶段内与跨阶段的组合效果。研究用带受控查询预算的攻击成功率公式和明确的公平性规则统一评估口径,覆盖 19 种攻击与 15 种防御。结果显示没有单一防御在所有场景下最优,但精心选择的组合能在效用损失极小的前提下取得显著安全提升,并据此给出分层防御流水线的实用建议。该工作已被 EMNLP 2026 Findings 接收。

  2. arXiv:危险能力与安全评测 ·

    SafeStage:按执行前中后三阶段评测视觉语言机器人操作安全

    作者提出 SafeStage,一个按生命周期结构组织的机器人操作安全基准,用于在任务执行前、执行中和执行后三个阶段评测安全。该基准包含 97 个专门设计的风险场景,分为三类:初始状态危害考察操作目标前必须解决的安全相关关系,执行期安全评估执行过程中的不安全接触、轨迹、区域进入和物体交互,最终状态危害捕捉任务名义完成后仍存在的不稳定或不安全状态。评测采用基于事件和基于状态的检查,并将原生任务成功率与各阶段安全结果分开报告。作者在统一的闭环协议下评测了代表性的直接动作 VLA 策略和基于世界模型的策略,结果显示任务名义完成常与安全违规同时出现,不同策略在三个阶段呈现不同的失败特征。

  3. Failure-First ·

    DocOps:面向复杂文档操作自主智能体的可验证基准

    研究者提出 DocOps,一个用容器化 Harbor bundle 交付的基准,用于测量智能体在电子表格、演示文稿和 PDF 等原生格式文档操作中的完整性与可靠性,并按操作(内容、格式、结构)与难度(L1 原子到 L4 跨文档状态追踪)两轴分类。该基准用直接检查输出文件的确定性验证器替代 LLM-as-a-judge,采用结构谓词、语言锚点和保留谓词,与人工审查的一致率为 95.31%;在针对 36 份已验证输出的 180 次受控变异压力测试中,检出 96.67% 的违规。

  4. arXiv:危险能力与安全评测 ·

    研究称 GPT 系列安全训练把性别歧视转化而非消除

    一项被 EMNLP 26 主会接收的研究分析了 GPT-2 到 GPT-5 共 15 个模型、45 万条性别指向的补全文本,提出“harm laundering(伤害洗白)”概念,认为显式歧视内容在安全训练后是被转化而非被移除。研究发现 GPT-2 中针对女性的性暴力聚类到 GPT-4 已消失,而针对男性的补全获得了照护、情感表达、盟友身份等正向表征空间,女性指向的补全没有;在 GPT-5 上,一个含 1,997 篇文档的主题聚类把乳腺癌框定为男性权利议题,女性指向输出中没有对应聚类,三个独立分类器都将其判为非毒性。