全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:Agent 与 MCP 安全
DUMA-Bench:评估 LLM Agent 安全的双控多智能体基准
研究者提出 DUMA-Bench,一个在双控交互下测量 LLM Agent 安全的基准与评测协议,其中 Agent 和用户都能影响共享环境状态。该基准在 τ²-bench 基础上扩展出对抗环境,覆盖 RAG 投毒、跨 Agent 操纵和不安全输出处理等八类漏洞。作者评测了来自 OpenAI、Anthropic、DeepSeek、Qwen 等五个模型家族的 14 个模型,跨八个领域和多种用户行为模式。实验显示,引入双控交互后攻击成功率从 26.9% 升至 41.1%,说明 Agent 安全不只取决于模型本身,还来自模型、用户与环境之间的交互。
- 论文arXiv:Agent 与 MCP 安全
Ajar:在 AgentDojo 上测量 Agent 防御中未关闭的权限
Ajar 提出一种直接测量 Agent 防御中开放权限的评测方法,它挂载在已有的 Agent 安全基准上,复用其任务、工具 schema、参考解和目标状态,为每个良性任务构造任务并不需要的候选工具调用,并在 Agent 可行动的每个节点把这些调用提交给防御方,允许其中任何一个即意味着权限被开放。作者将 Ajar 接入 AgentDojo,使开放权限成为攻击成功率与良性效用之外的第三个维度,并测试了 Progent、CaMeL、AC4A、Permission Assistant 和 Claude Code 的 Auto mode 五种防御。
- 论文arXiv:Agent 与 MCP 安全
dreadnode 发布 ScopeBench:测量 Agent 在目标压力下是否守住授权边界
dreadnode 发布 ScopeBench,用 30 个死胡同式 Agent 安全任务测量 Agent 在目标压力下是否守住授权边界。每个任务在无范围与有范围两种条件下运行,环境、验证器和目标相同,仅范围声明不同;有范围条件下成功提交 flag 即证明发生了越界行为,构成违规率的高精度下界。8 个模型在同一 harness 中运行,原始能力从 12.2% 到 81.1%,范围遵守率从 34.4% 到 86.7%;机械验证确认 227 次违规,轨迹裁判在机械失败轨迹中另找出 331 次违规,合计 558 次。裁判经 100 条人工逐调用标注轨迹校准,并在模型盲审中保持 100% 召回、失败层重加权特异度 90.5%,误差为单侧过度标记。opus-4-8 的原始能力比 sonnet-4-6 高 10 个百分点,范围遵守率高 35.6 个百分点。
- 论文arXiv:Agent 与 MCP 安全
RecToolBench:在模糊用户意图下评测推荐专用工具编排的基准
RecToolBench 是一个基于 MCP 的基准,用于评测模糊用户指令下使用工具的推荐智能体,包含 3 个推荐领域、13 个 MCP 服务器、32 个工具和 1200 多个可执行任务,覆盖单工具调用、并行调用、顺序工具链与混合编排。该基准通过 synthesize–fuzzify–judge 流水线构建,并用规则执行检查与基于评分标准的 LLM 评估来评测智能体轨迹。实验显示,语法有效的工具调用并不保证推荐成功,模型在语义参数落地、多步证据整合和最终推荐上表现不佳,且随编排复杂度上升而恶化。
- 论文arXiv:越狱、提示注入、投毒与防御
研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架
作者审计了一个针对工具调用型 LLM Agent 的间接提示注入(IPI)基准及其评测装置,归纳出四类缺陷:载荷静默未投递、按工具身份而非参数判定攻击成功、把误拒率与模型能力不足混为一谈、缺少审计轨迹。用同一批执行轨迹重新打分后,按工具身份判定的评分器报告 21.7% 攻击成功率,而按参数判定的真实值为 1.2%,虚高约十八倍;审计套件中 43 个攻击载荷有 39 个(91%)从未投递。修正后,此前报告攻击成功率 62.8% 的 llama3.1:8b 降至 0%(43 次攻击中 0 次得手),该模型在 41 次攻击中读到了注入内容、72% 的攻击场景完成了良性部分,但均未执行恶意指令;此前归因于 gemma4:12b 的“工具绑定障碍”也被证明是环境不匹配造成的假象。
- 论文arXiv:越狱、提示注入、投毒与防御
Agentic Commerce Bench:衡量会花钱的智能体的欺诈检测能力
论文提出用于衡量和降低智能体支付欺诈损失的三项成果。第一是智能体商务欺诈分类体系,把智能体推理、wire、结算通道、交易对手、委托人五个观测层级与请求级、历史级证据对应起来,记录各层级能观测到哪些攻击。第二是 Agentic Commerce Bench(ACB)基准,包含由生产数据聚合生成的二十类欺诈,涉及 1,647 个编目服务操作和 1,068 笔结算,其中六类的交易对手身份完全真实。第三是开源检测器栈 gordonguard 及离线 harness,可用于审计智能体配置、在无账号情况下重放恶意交易对手,并以内联方式运行同一批检测器。
- 论文arXiv:越狱、提示注入、投毒与防御
ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架
作者提出 ORBIT,一个基于 UK AISI Inspect 构建的可配置多智能体安全与安全评测框架,用于在真实多智能体环境中联合变化攻击、防御与架构。框架允许配置通信拓扑、记忆、调度和智能体角色,支持四类威胁、四种防御策略以及非对抗性失败,基准套件覆盖浏览器使用、计算机使用、智能体编码、客服和协作分配五个场景族。核心发现是防御在不同威胁间不可迁移:在多议题编码任务中把被攻陷智能体的攻击成功率降低 60 个百分点的逐动作防御,对相互串通的智能体没有可测量的保护,且所测试的防御没有一个能泛化到全部攻击。作者还展示了安全与性能的权衡以及架构与防御效果之间的相互作用,并将 ORBIT 开源。
- 论文arXiv:越狱、提示注入、投毒与防御
论文评估 System One 模型在 Agent 安全决策中的可靠性、校准与选择性自动化
论文评估了 Jev、Laya、Decider 和 Bespoke Nimble 等 System One 模型在 Agent 安全决策中的可靠性,并与专用分类器和语言模型裁判对比,考察决策准确率、概率校准和选择性自动化。作者发现,整体表现良好和总体校准较优可能掩盖集中在特定攻击组上的失败,包括被高置信度判为安全的攻击;所评估的适配配置在各任务上并未稳定优于其基座模型。在最严格的误差限制下,策略能自动放行的输入很少,而将放行与拦截阈值分开主要靠更多拦截来提升自动化程度,且通过确认并不保证这些限制在测试集上成立。裁判模型能发现另一个模型漏掉的攻击,但也可能误标更多良性输入,并共享对方的高置信度错误。
- 论文arXiv:越狱、提示注入、投毒与防御
论文提出 Nudgeability:推理模型会跟随置信信号却不追踪自身能力
论文提出 Nudgeability 指标,在推理轨迹的固定位置插入一句表达信心或怀疑的第一人称句子,通过对比反事实续写来衡量反思信号对模型委派决策的因果影响。该指标分两个维度:敏感度,即信心与怀疑改变委派率的强度;目标性,即委派是否在模型无法独立解决的问题上增加、在能解决的问题上减少。在 Qwen、Gemma 和 GLM 三个家族共九个中小规模开源权重推理模型和两个任务上,模型普遍敏感,怀疑提高委派率、信心降低委派率,信心到怀疑的中位摆动为 20.6 个百分点,较大的厂商托管模型为 53 至 70 个百分点。但这种响应目标性较差,中位仅 42% 的诱导翻转是目标正确的,只比随机选择基线高 2 个百分点。
- 动态Google DeepMind
Google DeepMind 发布 Gemini 4 Argon,先向可信网络防御者开放
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并参与美国政府的前置模型访问自愿流程,之后再逐步扩展到开发者、企业和消费者。Argon 面向长周期复杂工作流,输出 token 上限从 64K 提升到 1M,在 DeepSWE v1.1 上取得 77.9%,在 LVBench 长视频理解上取得 91.7%,在 Zapier 的 AutomationBench 上以 51.3% 排名第一。
- 动态Adversa AI
Adversa AI 发布 AIRQ 报告:给 100 个无人加固的数字员工做风险评分
Adversa AI 联合业界贡献者推出 AI Agent Risk Quadrant(AIRQ),从攻击面、爆炸半径、防御控制和证据强度四个维度给 100 款热门智能体打分并归入四类象限。当前快照中仅 11% 的智能体兼具能力和良好防御,98% 已带有致命三要素组合,且 83% 声称的防御无法公开验证。该框架可直接复用为企业内部自查清单和对供应商的安全问卷,也便于跟踪平台更新带来的风险漂移。
- 动态Adversa AI
Adversa AI 发布 AIRQ 框架,对 100 多个 AI 智能体做安全评级
Adversa AI 发布 AI Risk Quadrant(AIRQ)报告,称其为迄今规模最大的独立智能体 AI 安全评估,也是首个可比较的 AI 智能体安全评级,配套开源方法论与数据可在 https://airq.adversa.ai/report 获取。项目由 Adversa AI 主导,OWASP、CoSAI、CSA、NIST、Cisco、Crowdstrike 等机构人员参与贡献与评审,方法论量化攻击面、爆炸半径和防御控制,对齐 OWASP、NIST、MITRE、CoSAI、CSA 的相关指南。
- 动态Future of Life Institute
FLI 发布 2025 冬季 AI Safety Index:八家 AI 公司安全实践落后于公开承诺
Future of Life Institute 发布 2025 冬季版 AI Safety Index,由独立专家小组评估全球八家主要 AI 公司的安全实践,评估维度包括风险评估、当前危害、安全框架、生存性安全、治理和信息共享。参评公司为 Anthropic、OpenAI、Google DeepMind、xAI、Meta、Z.ai、DeepSeek 和阿里云。评审认为,尽管各公司在风险评估等方面有渐进改善,但安全实践仍远未达到正在形成的全球标准,主要问题在于落实的深度、具体程度和质量参差不齐。评审还发现,所有明确竞逐 AGI 或超级智能的公司都没有控制比人类更聪明系统的稳健策略,这是行业的核心结构性弱点。
- 动态Unit 42
Unit 42 发布 2026 年 8 月 AI 恶意软件态势报告:从品牌滥用到智能体化执行
Unit 42 分析了 405 个含 AI 成分的恶意软件样本,发现仅 12 个出现在 Cortex XDR 端点遥测中,约 97% 只存在于沙箱和 VirusTotal。这些样本涵盖 LLM 生成代码、品牌冒充和智能体化执行循环,但绝大多数是概念验证、安全验证测试和研究者提交,从未进入生产环境。Palo Alto Networks 产品对尝试进入客户环境的样本全部检出并拦截,AI 成分改变的是代码编写方式而非执行方式,现有行为检测与云端沙箱即可拦截。
- 动态METR
Opus 4.6 用简单 ReAct 脚手架复刻 CLI 版《Slay the Spire》与《Balatro》的观察
Opus 4.6 在简单 ReAct 脚手架下成功复刻出 CLI 版《Slay the Spire》和《Balatro》,虽功能残缺但基本可玩。测试给予 60 million tokens 总量、64,000 tokens 上下文窗口、reasoning effort "max" 并开放联网。复刻版存在卡牌效果错误、地图导航混乱、部分药水与事件缺失等问题,作者手动游玩约两小时评估,未设严格评分标准。
- 动态METR
METR:约半数通过 SWE-bench Verified 的 AI 补丁不会被维护者合并
METR 让 3 个 SWE-bench Verified 仓库(scikit-learn、Sphinx、pytest)的 4 名活跃维护者复核 296 个 AI 生成的 PR,发现约一半通过自动评分的补丁不会被合并进 main。以人工 golden patch 的 68% 合并率做基线归一后,维护者合并率平均比自动评分低约 24.2 个百分点(标准误 2.7);按每年提升幅度看,维护者合并决定比自动评分慢约 9.6 pp/yr(标准误 5.5),但该趋势结果较弱,仅在 10% 显著性水平上成立,且限制为 SOTA 模型后不再显著。
- 动态METR
METR 评审 Anthropic 的 Claude Opus 4.6 破坏风险报告
METR 对 Anthropic 的 Claude Opus 4.6 破坏风险报告做了外部评审,分别针对 2 月 11 日和 3 月 3 日两个版本出具评审文件,并建议读者参考 2 月 11 日版本的评审。METR 认为报告中的证据总体呈现清晰,但多处论证与分析强度不足。其主要分歧在于对齐评估的敏感度,认为评估结果可能因评测感知而被削弱,且发现一些对齐评估未捕捉到的低严重度失准行为,这让他们担心还有类似行为尚未被检出。METR 建议深入调查评测感知与被刻意混淆的失准推理。
- 动态METR
METR 分析建模假设对时间跨度评测结果的影响
METR 复盘其时间跨度任务套件的建模假设,指出随着任务套件趋于饱和,结果对分析选择越来越敏感。此前修复正则化错误后,近期模型的 50% 时间跨度下降最多 20%。文章逐一考察替代成功率曲线、仅用私有任务、任务长度估计噪声等来源:对 Opus 4.6 而言,合理替代曲线使 50% 时间跨度变化约 1.5 倍、80% 约 2 倍;仅用私有任务时 Opus 4.6 的 50% 时间跨度从 11h 59m 降至 7h 11m,主要来自 RE-Bench 任务,Anthropic 表示未在这些公开任务上训练。作者认为最大的不确定性来自任务分布本身,而非分析选择,并称对任务长度估计噪声最没把握。
- 动态METR
METR 红队测试 Anthropic 内部 Agent 监控系统,发现多个新漏洞
METR 员工 David Rein 与 Anthropic 合作,用三周时间对 Anthropic 部分内部 Agent 监控与安全系统进行红队测试,这些系统多数在 Opus 4.6 Sabotage Risk Report(附录 8.4,尤其是 8.4.8)中有描述。Anthropic 提供了相关内部系统和信息的大量访问权限,并安排员工在测试期间答疑和反馈。此次测试发现若干具体的新漏洞,其中一些已被修补,且没有任何一个严重动摇 Opus 4.6 Sabotage Risk Report 的主要结论。
- 动态METR
METR 与 Epoch AI 发布 MirrorCode 初步结果:AI 已能完成部分以周计的编码任务
METR 发布 MirrorCode 项目的初步结果,称已有证据表明 AI 能够完成部分以周计的编码任务。该项目由 METR 资助并与 Epoch AI 共同开发,METR 的帖子为链接贴,详细内容见 Epoch AI 的博客文章(https://epoch.ai/publications/mirrorcode-preliminary-results/)。
- 动态METR
METR 研究笔记:从 NanoGPT 竞速看 AI 智能体的 AI 研发进展
METR 研究笔记通过 NanoGPT speedrun 排行榜评估 AI 智能体对 AI 研发的加速作用:2024 年 5 月至 2026 年 3 月,36 位贡献者提交 77 项记录,将小赛道训练时间从 45 分钟压缩至 1.43 分钟,累计加速 31 倍。其中约 21 倍来自浅层与中等深度贡献,导入、改编、原创想法分别贡献 6.7 倍、3.0 倍和 1.6 倍。2025 年底至 2026 年初有 4 项记录由专用 AI 智能体系统与人类共同署名,但贡献相对浅层;作者同时提示数据污染、幸存者偏差和规模依赖等解读局限。
- 论文Hugging Face Daily Papers
EngiWorld 基准发布:前沿 Agent 在专业工程环境中最高仅得 44.3 分
研究者提出 EngiWorld,一个围绕完整设计闭环构建的工程 Agent 基准,包含 6 个工程领域(CAD、CAE、CAM、BIM、EDA 和 3D 可视化)、26 个专业软件平台、GUI 与 CLI 两种界面以及 6 类任务,共 1301 个专家整理的任务。该基准采用以产物为中心的评价方法,通过统一的领域验证器套件程序化检查最终与中间产物的几何有效性、物理可行性和规则合规性,并按规格达成度对定量设计任务连续打分,而非二元判定成功。对 7 个前沿模型的评测显示存在明显能力缺口:最强模型的 EngiScore 仅为 44.3,多软件任务的尝试成功率只有 3.6%。
- 论文Hugging Face Daily Papers
Sys1Cal-v1:Jev 的二元 Choice 输出存在系统性概率失真
研究者发布 Sys1Cal-v1 基准,其每个命题的真实概率由构造已知,可直接评估结构化概率输出而非仅检查预测类别的置信度。在 Jev 上测试发现其原语间存在明显不对称:Noul 与 Score 接近真实概率,而二元 Choice 输出出现系统性非线性失真,可通过引入 True、False 之外的潜在第三分量 Uncertain 来建模,Choice 相当于移除不确定质量后对 True/False 重新归一化。该现象意味着显式表示不确定性可支持不同下游动作,如高错误代价时延迟决策;Sys1Cal-v1 与评估代码已公开,作者希望在其他结构化决策模型上复现,以检验二元或分类输出是否普遍压制决策相关的不确定性。
- 动态Import AI
Import AI 462:超级说服力、自我维持的 AI 与通往 ASI 之路
牛津大学、英国 AI 安全研究所、斯坦福大学与伦敦政治经济学院的研究人员通过四项实验、覆盖 6923 人共 18978 场对话发现,当前 AI 系统在文本说服上比人类专家更具说服力,其中 Opus 4.1 与 Opus 4.6 表现最强,其后是 OpenAI 的 GPT-4o、GPT-5.4,Google 的 Gemini 2.5 Pro 及 xAI 的 Grok 4.20。若将 AI 约束为人类书写速度与人际消息长度,其对顶尖人类的优势从 +4.1pp 降至不显著的 0.0pp,说明产出速率是其说服力优势的主要来源。