全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
ContextWeave:面向长周期办公工作流的智能体记忆基准
研究者提出 ContextWeave,一个纵向基准,用于评估回忆到的经验能否提升语言智能体在真实办公工作流中的下游表现。该基准将 14 名参与者数月的工作流重建为 1,005 个可执行任务,其中 568 个为核心评测任务,包含指令、容器化环境、轨迹和任务专属评分标准,衡量工作区质量与参与者偏好对齐,并诊断相关性、连续性、可解性和对误导性回忆的鲁棒性。在固定模型下比较六种记忆组件,最强配置将 Workspace Score 从 68.08 提升到 78.20,Preference Score 从 41.50 提升到 70.60。固定记忆组件时,回忆对全部五个被测基座模型都有改善,但幅度差异明显。分析显示,可操作、经验丰富的记忆比精简摘要更能支持工作流延续并减少重复探索,同时也更容易受误导性回忆影响。
- 论文论文追踪
研究者发布概念性论证评分数据集,含 951 条论证与 1458 条专家评分
研究者发布了一个针对概念性问题的论证评分数据集,包含 442 篇立场文本的 951 条论证式批评,以及六位专家在中心性、强度、正确性和清晰度等维度上的 1458 条评分,覆盖 AI 安全、决策理论、伦理与政治等主题。作者认为,这类问题没有可现实获取的标准答案,也缺乏公认的解决方法论,但其中单条情境化论证可以被更可靠地评估。他们提出两种评分函数并对一系列模型做了基准测试,结果显示模型表现与通用能力排名一致。
- 论文论文追踪
路由熵能否作为 Attention-Residual Transformer 的不确定性信号?一项审计研究
研究审计了 Swin-Tiny 与 DeiT-Small 的 Attention-Residual(AR)变体中路由熵作为不确定性信号的有效性,模型在 CIFAR-10/100 上从头训练并加入软分箱校准辅助损失。在固定 30 项分箱检验族中无一项通过多重性校正,24 组配对运行中路由探针在路由分层校准上无汇总提升,熵剖面探针虽优于打乱轨迹却仍不及仅用置信度的预测器。注入 0.010 nats 效应时剖面探针仅恢复 24-59% 的 oracle 增益,参考保持校正探针在两个 CIFAR-100 设置中仅恢复 8% 和 23%,低于实际应用阈值。
- 论文论文追踪
Vero:首个仓库级实现与证明联合合成基准,最强 Agent 仅解出 43 个实例中的 27 个
研究者提出 Vero,首个在仓库层面评估实现与形式化证明联合合成的基准,用于衡量 AI Agent 能否构建经过机器校验的软件。Vero 包含 43 个多模块实例,取自 Python、Dafny、Verus 和 Coq 的真实仓库,覆盖密码协议到分布式系统等领域,每个实例由带预定 API 接口的 Lean 4 多模块仓库、人工整理的形式化规格和参考实现组成,支持仅证明与代码加证明两种评测模式。基准还引入审计机制,允许 Agent 形式化证明给定规格不可满足或参考代码有误,从而在整理阶段暴露并修正潜在的代码与规格错误。在可访问 Lean 工具链的前沿编码 Agent 配置下,最强 Agent 仅完整解出 43 个实例中的 27 个,在最难的仓库上未能闭合任何规格。作者开源了基准、整理流程与评测框架。
- 论文论文追踪
ActBench:面向协作智能体行为安全的自演化基准
香港城市大学、浙江大学、伦敦大学学院与小米的研究者提出 ActBench,一个从执行轨迹而非最终回复评估协作智能体行为安全的自演化基准。基准包含 213 个场景的 300 对良性/恶意配对用例,覆盖 15 种风险行为、六个执行空间和 48 个 web 服务 API,恶意用例在保留指令、配置、初始状态与评分标准的前提下注入任务可达载荷。构建方法结合奖励引导的束搜索与基于反思的深度探测,并用日志证据与 LLM 轨迹证据的双重验证判定攻击是否真正生效。在 24,000 条轨迹上评估 15 个 LLM 和 6 个开源协作智能体,固定框架时攻击成功率从 10.1% 到 94.4%,固定基座模型时跨框架从 73.7% 到 94.4%,模型差异大于框架差异。基准已开源于 https://github.com/zjuicsr/ActBench。
- 论文论文追踪
研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测
研究者提出一套统一的对抗鲁棒性评测框架,用覆盖 ℓ0、ℓ1、ℓ2、ℓ∞ 四种范数的最小范数攻击池和鲁棒性-扰动曲线,替代在单一扰动预算 ε 下使用 AutoAttack 等预设攻击集成的做法。作者指出,鲁棒性-扰动曲线可能在不同模型间交叉或以不同速率衰减,导致单一 ε 下的排名不稳定,且现有集成无法说明与最坏情况性能的差距,也无法系统控制攻击强度与评测成本的权衡。为此他们把评测形式化为前沿逼近问题,构造最小范数攻击集成,在可控查询预算下逼近攻击前沿,预算越大估计越紧。作者还定义防御前沿为各扰动规模下模型集合中的最高鲁棒性,并提出 Defense Optimality Index,按防御与防御前沿的差距排名,无需选定参考 ε。在 CIFAR-10 和 ImageNet 上,该集成在多数防御和各个预算档位上达到或超过 AutoAttack,且查询成本固定可控。
- 论文论文追踪
EXE-Bench:为真实可用性对 AI Windows 恶意软件检测器进行权衡排名
EXE-Bench 是一个面向 AI Windows 恶意软件检测器的综合基准,从性能、时间鲁棒性、对抗鲁棒性和计算开销四个维度打分并聚合为单一分数,用于直接公平地比较模型。该基准指出,仅在部署后评估无法完整反映检测器表现;通过特征工程注入的领域知识在抵御时间推移和对抗攻击上仍极为有效,而多数深度网络仅在部署初期表现优异。
- 论文论文追踪
AIR-BENCH Live 发布:可自动更新的基础模型安全基准
研究者提出 AIR-BENCH Live,作为 AIR-BENCH 2024 的自更新后继版本,通过自动监测政府监管、将新政策条款归入现有风险分类或提出新类别,并用多智能体、人格驱动的提示词生成算法产出多语言提示词。当前版本将基准从 314 项细分风险扩展到 335 项,新增 21 个类别,来自七个司法辖区的 31 条全新政策条款。对 14 个近期模型的评测显示安全表现差异较大(按模型自身行为判定为 0.17 至 0.89),更新后的提示词平均比 2024 版难 0.06 分,降幅集中在最顺从的模型上,且多数模型在非英语提示词上安全性略低。
- 论文论文追踪
研究者提出影子评测:前沿 Agent 六天未能完成两篇 NeurIPS 投稿级研究
研究者提出一种名为影子评测的新方法,把两篇尚未公开的 NeurIPS 2026 投稿的核心研究问题交给前沿 Agent,由原文作者按会议审稿标准打分。实验给 Agent 六天时间、3000 美元 Anthropic API 额度、GPU 算力和完整虚拟机与开放网络访问,Agent 独立完成了全部工程环节,但两篇论文均被作者明确拒稿,分别评为 Reject 和 Strong Reject。研究归纳出五类反复出现的失败模式:对可发表研究标准的判断不足、面对研究设计缺陷缺乏创造性应对、无法从死胡同有效回退、资源与时间意识薄弱、指令漂移。用 GPT-5.6 Sol 与 Codex 复现的实验重现了几乎全部失败模式。研究未发现明显的奖励作弊,但记录到一次访问 token 被提交进仓库,以及五次子 Agent 幻觉或误报结果被主 Agent 发现。
- 动态The Decoder
Aleph Alpha 研究:千问、DeepSeek、Kimi 等中国模型在敏感议题上多复述官方立场或拒答
Aleph Alpha 用自建基准测试了阿里千问(Qwen)、DeepSeek 与月之暗面(Kimi)等中国模型,覆盖天安门、台湾、新疆等 967 个敏感议题,其自研评分系统判定仅 17% 至 41% 的回答算平衡,其余为复述官方立场、回避或拒答。DeepSeek V4 Pro 拒答三分之二问题,对照的 Claude Sonnet 5 与 Mistral Small 平衡回答率分别为 70% 和 92%。研究还称 Nvidia Nemotron Cascade 2 有 17% 回答呈类似倾向,归因于其 930 万条训练样本中约 3500 条由 DeepSeek 和 Qwen 生成。
- 论文论文追踪
范围综述梳理 LLM 聊天机器人对心理健康的 119 篇相关文献
一篇发表于 npj Digital Medicine 的范围综述系统梳理了 119 篇关于 LLM 聊天机器人(LLM-CB)心理健康危害的文献,将其归纳为概念性工作、心理健康支持使用、认知过度依赖、AI 依赖和 AI 精神病五类主题。综述指出,概念性文献共列出 22 种潜在危害,涵盖幻觉、谄媚、偏见、数据隐私、缺乏监管等,但多数仍属推测,实际影响程度不明。在心理健康支持使用类研究中,18/29 为情境/基准研究,显示 LLM-CB 在高风险情境下可能给出不恰当或有害回应,但用户实际受影响程度尚未量化。认知过度依赖类研究(15 篇)发现频繁使用与认知和学业表现下降相关,其中 3 项实验研究提示因果关系,但对批判性思维的影响结论不一致。综述还提到 OpenAI 2025 年自报数据估计超过百万 ChatGPT 用户(约 0.15%)表现出严重心理困扰迹象,该数据基于内部分类器、未经独立验证。
- 论文论文追踪
面向 EU AI Act 基本权利影响评估的可复用语义网框架
为满足 EU AI Act 第 27 条对高风险 AI 系统部署前开展基本权利影响评估(FRIA)的要求,研究者提出一个可复用的语义网框架,把分散的事件库、风险词表与法律文本整合为可 SPARQL 查询的知识图谱。该框架覆盖就业与工人管理(Annex III(4))和基本公共服务获取(Annex III(5)(a))两类公共部门场景,基于 150 条记录语料构建含 1,351 条 RDF 三元组的知识图谱,五个 FRIA 演示场景覆盖 103 条记录(68.7%)。对照 69 条记录金标准评估显示,LLM 辅助的就业领域分类仅达 κ = 0.045,提示该领域自动化公平性证据检索仍不可靠。
- 论文论文追踪
微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性
微软等机构的研究者发布 Thinkingbox 沙盒与 Thinkingbox-bench 基准,用于评估 Agent 在有状态业务流程中的可靠性。沙盒提供隔离的 MCP 兼容工具会话、完整执行轨迹,并以终端后端状态和副作用作为判定依据;基准包含零售、酒店、车险、数字银行内部 IT 与咨询 IT/HR 五个领域的 507 个策略约束工作流,每个任务用可执行检查判定,允许不同有效路径但拒绝错误、缺失或多余的状态变更,其中 30 个任务额外检查最终回复的必需属性。研究者在 18 个闭源与开源模型上每任务重复 20 次试验,发现可靠性明显下降:Claude Opus 5 从 66.50% pass@1 降至 47.53% pass^20,Kimi-K3 从 57.37% 降至 17.60%;Qwen3.8-27B 的 pass@20 达 89.35%,但 pass^20 仅 10.93%。
- 论文论文追踪
AgentAudit:面向 AI Agent 全生命周期信任评估的开源框架
研究者提出 AgentAudit,一个可附加在任意 LLM Agent 上、只读取执行轨迹而不干预其运行的开源评估框架,覆盖规划、工具选择、工具执行、记忆与推理的完整流程。该框架从指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实性、安全与执行完整性十个能力、接地、安全与行为维度评估整条执行轨迹,并结合行为分类与失败归因定位出错的阶段。所有轨迹由同一个固定裁判模型打分,而该模型本身也是被评测模型之一,作者在第七节 E 小节讨论了这一局限。论文还指出,任务完成表现相近的模型在可信度上可能差异很大,若干非前沿模型在对抗任务中反复被归类为 Unsafe_Compliance,而不只是任务失败,这是通过/失败式基准无法呈现的区别。
- 论文论文追踪
Harness-IF:评估编码 Agent 跨指令面的指令遵循能力
研究者提出 Harness-IF,用于评估编码 Agent 在多个指令面上的规则遵循情况,并区分真正遵循与碰巧符合默认行为。该基准包含 60 个真实多轮编码任务,取自 642 条规则库,256 条规则获得判定,分布在部署 Agent 会读取的五个可配置指令面上。为区分遵循与巧合,作者提出 Against-Prior Accuracy(AP-Acc),只对与模型无提示默认行为相反的规则打分,通过九次探针构建中隐去规则重跑任务来观测。在 12 个前沿模型上,准确率为 72.1% 至 85.9%,AP-Acc 为 66.1% 至 78.6%,所有模型在反先验规则上表现更差,差距 3.6 至 7.4 个百分点,平均 5.81。作者指出聚合分数会以模型相关的幅度高估遵循程度。
- 论文论文追踪
SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性
研究者提出 SkillSafe-Bench,在合并方法、迁移技能、基座模型与合并系数的受控网格上同时评测静态拒答、自适应越狱鲁棒性和能力保留,采用 HarmBench 分类器与 Llama Guard 3 的双评审 AND 规则。在六个开源基座(五个模型家族、两种规模)上,静态安全无法预测自适应鲁棒性:静态筛查下同样安全的 Qwen2.5-7B 与 Llama-3.1-8B,在语义模板攻击下 Qwen 的数学技能合并模型被越狱 66%–76%,Llama 为 22%–24%;Gemma-2-9B 静态最安全却被越狱 60%,Phi-4-mini 保持鲁棒。研究还发现合并的静态安全效应取决于基座对齐强度,并提出无数据的几何信号,即任务向量与安全子空间的重叠度,可区分同配方的消融式拒答移除与真实技能,进而给出 SubSafe-Merge 投影方法,在保持能力的同时消除这类侵蚀。
- 论文论文追踪
研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍
研究者构建了覆盖十类政治敏感话题的 200 张图像基准,对 9 个视觉语言模型(7 个中国来源、2 个非中国来源)在四种提问范式和两种提示语言下运行 21708 次试验,由两个前沿 LLM 评审按六个维度逐条标注,并在 200 条样本上与三名人类专家验证。结果显示,中文提示下出现国家立场改写的几率约为英文提示的 3.67 倍,且在每个模型内部都成立;中国来源模型的改写率高于非中国模型,方向在两个评审和人类标注者间一致,幅度随评审不同在 1.6 至 3.2 倍之间。改写集中在文本提及敏感主体的条件下(36.5%),仅给图像时为 9.8%;在四代 Qwen 多模态模型上,显式拒答下降而国家立场改写上升,改写以替换和委婉语为主,且不含拒答关键词,关键词检测方法难以发现。
- 论文论文追踪
aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡
研究者提出 aiXamine,一个统一黑盒评测平台,把 LLM 的安全、安全(security)与隐私当作相互依赖的属性来评估。平台通过自动化红队流程编排 9 项服务上的 46 个测试,生成从提示词级诊断到跨服务权衡分析的分层风险画像,可在相同条件下复现对比闭源与开源权重系统。作者用 aiXamine 测试了 120 多个 LLM、超过 5000 次测试运行,发现三种单轴评测看不到的跨维度现象:更强的对齐会系统性提高过度拒答,形成可量化的安全税;隐私与其他可信维度近乎正交,标准对齐无法覆盖;无 on-policy 校正的 off-policy 知识蒸馏会导致熵坍缩,在同一基础架构上把鲁棒性从 56.9 降到 2.6。
- 论文论文追踪
研究提出「静默修订率」:前沿 AI 安全框架 67% 实质变更未在开发者说明中披露
研究者提出「静默修订率」(silent revision rate),即安全框架承诺的实质变更中未被开发者自身说明所披露的比例,并发布带版本与哈希固定的语料库。语料覆盖 12 家发布安全框架的开发者的全部公开版本及各自的 changelog、redline 或公告,追踪 12 组连续版本对之间的 710 条承诺实例,其中 244 条逐条裁定。结果显示,严格标准下 67%(95% CI 62–72)的实质变更属静默,宽松标准下为 53%,按章节粒度降至 49%;叙述式公告的静默率为 74%,逐项 changelog 为 63%,而说明的篇幅字数几乎不影响结果。77% 的追踪变更削弱或移除了某项承诺,且在 8 组版本对中有 7 组削弱比加强更常被静默处理。
- 论文论文追踪
论文发现安全监控器主要拦截模型本就会拒答的请求
Sripad Karne 的论文测量了安全监控器在目标模型实际会作答的请求上的召回率,发现四款文本护栏、两个激活探针和 Latent Guard 在 1% 假阳性率下,对模型会拒答请求的召回率是模型会作答请求的 1.1 到 6.4 倍,而 AUROC 多数仍在 0.85 以上,标准指标掩盖了这一差距。研究基于 647 条有害请求(来自 Aegis 2.0、HarmBench、StrongREJECT),每条改写成间接、直接、直白三个显式程度版本且意图经 LLM 与人工核验;Gemma-4-31B-IT 在直白版本只答 12 条,在间接版本答 340 条,相差 28 倍,其中 344 条翻转请求里各护栏漏放 153 到 321 条。作者把原因追溯到显式程度本身:模型与护栏内部的危害读数都随措辞变软而下降,沿显式方向对 Qwen3Guard 做激活引导可把标记率从 26% 推到 100%。
- 论文论文追踪
SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准
研究者发布 SRE-Bench,一个由逆向工程专家投入 5000 多专家小时从零构建、避免训练数据污染的逆向工程基准,包含 19 个平均 16,915.8 行代码的私有程序、44 种自研反分析机制,共 262 个二进制实例和 1,572 个确定性评分任务。在标准化公开评测中,GPT-5.6-Sol 与 Claude-Fable-5.1 分别只完整解出 31.5% 和 26.9% 的实例,说明源码安全能力强并不等于二进制分析能力强。在无预算上限、关闭安全护栏的模型方内部评测中,GPT-6-Astra 达到 99.2% pass@4,但从多次尝试中挑出正确解仍是未解问题。自研保护套件把 GPT-5.6-Sol 的平均分从 4.69 降到 2.50(满分 6),其他较弱模型几乎归零;GPT-6-Astra 基本保住分数,但在受保护二进制上的每分成本升至 1.5 倍。分析还显示,编译器优化和静态链接对 Agent 影响很小,而去除符号代价高昂,表明当前 Agent 更依赖名称线索而非指令级推理。
- 动态Scale AI Research / SEAL
Scale AI 提出 ChainWorld,将 OSWorld 原子任务组合成长程桌面工作流评测 Agent
Scale AI 研究团队提出 ChainWorld,通过方向兼容性搜索把 OSWorld 的原子桌面任务组合成长程桌面工作流,同时保留原有评测器。该工作流包含 347 条长度为二到四的任务链,并对同一任务序列采用两种呈现方式:单轮评测把所有任务放在一个提示词中,多轮评测则逐个揭示任务。在四款现有 computer-use Agent 上,任务链最高完成率为 31%;多轮评测提升了其中三款模型的完成率,但两种协议都仍具挑战性。两种协议暴露出不同的失败特征:单轮失败集中在产物精度,多轮失败更多体现为会话管理问题,如进度碎片化和后续轮次脱离。
- 动态Scale AI Research / SEAL
Scale AI 发布 SWE-INTERACT 基准,评测编码 Agent 的多轮交互能力
Scale AI 的研究团队发布 SWE-INTERACT,把软件工程任务改造成多轮、用户驱动的编码会话,测试 Agent 能否在需求逐步揭示的过程中发现用户意图并迭代修改。基准由用户模拟器从模糊或不完整的指令开始,逐步补充需求、检查 Agent 工作区并给出针对性反馈和约束,直到完整任务目标交付。评测覆盖多个前沿与开源权重模型,结果显示单轮 SWE 任务上的强表现无法可靠迁移到多轮用户驱动流程:表现最好的模型能解决约 50% 的单轮基线任务,但只能解决约 25% 的对应 SWE-INTERACT 任务。Opus 4.8 和 GPT 5.5 等最强模型在模糊初始指令下起步较好,能坚持到需求全部浮现并写出较干净的代码,但仍存在过度自主编码、遗忘需求和技术错误;较弱模型在模糊条件下起步差、过早放弃、遗忘或忽略指令并更多返工。
- 动态Scale AI Research / SEAL
DrugDiscoveryBench:编程智能体能否辅助早期药物发现?
Scale AI Research / SEAL 发布 DrugDiscoveryBench,用于评估编程智能体在早期药物发现中的能力。该基准测试考察编程智能体能否完成早期药物发现相关任务,作者包括 Afra Feyza Akyürek、Xinming Tu 等。