跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 71 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:安全内参 / 模安局安全内参 / 模安局1 条材料来源:论文追踪论文追踪1 条材料来源:arXivarXiv1 条材料来源:GIGAZINEGIGAZINE1 条材料来源:Gadget ReviewGadget Review1 条材料来源:The DriveThe Drive1 条材料动态:AgentPort-Bench 评测七个 Agent 框架:攻击类型解释约 28% 安全差异,框架仅约 0.05%动态2026-10-06AgentPort-Bench 评测七个 Agent 框架:攻击类型解释约 28% 安全差异,框架仅约…论文:HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制论文2026-10-06HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制论文:DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩论文2026-09-30DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩动态:DrivingBench 用 GPT-6 Astra 等模型实车驾驶,仅 GPT-6 Astra 完成赛道动态2026-09-30DrivingBench 用 GPT-6 Astra 等模型实车驾驶,仅 GPT-6 Astra 完成赛道动态:DrivingBench 测试:GPT-6 Astra 完成 134.7 米锥桶赛道,Grok 4.6 等三款模型失败动态2026-10-06DrivingBench 测试:GPT-6 Astra 完成134.7 米锥桶赛道,Grok 4.6 等三款模型…动态:DrivingBench 测试前沿模型驾驶真车,GPT-6 Astra 唯一跑完全程动态2026-10-05DrivingBench 测试前沿模型驾驶真车,GPT-6 Astra 唯一跑完全程方向:Google DeepMindGoogleDeepMind2方向:安全评测安全评测5方向:其他方向其他方向3方向:Agent 安全Agent 安全6方向:AnthropicAnthropic6方向:OpenAIOpenAI6方向:xAIxAI4
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。5 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态安全内参 / 模安局

    AgentPort-Bench 评测七个 Agent 框架:攻击类型解释约 28% 安全差异,框架仅约 0.05%

    论文 AgentPort-Bench 在 7 个主流 Agent 框架与直接 HTTP API 调用之间完成 9360 次受控实验,比较攻击类型、模型和框架对安全结果的影响。方差分析显示,攻击类型解释约 28% 的结果差异,模型约 4.14%,Agent 框架仅约 0.05%,即攻击影响约为框架的 500 多倍。研究覆盖 LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK、Google ADK、Semantic Kernel,以及 Anthropic、OpenAI、Google 三家共 6 个模型。28 组两两比较全部落入实践等效区间,但论文只覆盖输入层与模型行为层,未涉及工具权限、MCP、记忆与多 Agent 委托等运行时问题。

  • 论文论文追踪

    HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制

    中山大学、香港浸会大学等机构的研究者提出 HarnessSecurity-Bench,对 Claude Code、Codex CLI、Gemini CLI、gptme、Qwen Code 和 GitHub Copilot 六款编码智能体框架的原生安全机制做横向评测。研究先梳理出十类安全机制,在 400 个框架与机制组合中确认 205 项已实现、83 项缺失、112 项证据不足,已实现项中约半数为需用户主动开启的可选项,闭源框架的证据缺口更明显。评测在 GLM-5.2 基座模型下完成 2500 次试验,记录 81155 次工具调用和超过 22 亿 token。案例显示限制共享能力会同时阻断合法与恶意操作,被允许的解释器仍可成为绕过路径。研究者建议框架提供方公开可验证的安全设置,并同时报告攻击效果、任务效用与执行成本。

  • 论文arXiv

    DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩

    研究者提出 DrivingBench,据其描述是首个要求通用视觉语言模型驾驶真实汽车的基准。模型通过三个工具读取丰田 Corolla 的摄像头画面,并直接控制转向与速度,在停车场锥桶赛道低速行驶。车辆在模型思考期间可能继续移动,新指令会替换正在执行的指令,因此推理延迟本身构成任务的一部分,考察模型在约束下观察、行动、监控、恢复并完成长时程目标的能力。研究在 Codex、Claude Code、Cursor 等厂商原生框架中评测 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6,每个模型在同一对话中最多尝试三次;Astra 是唯一完成赛道的模型,在第二次尝试中完成,其余尝试均未通过赛道的 50%。四个模型中有两个在保留上下文的情况下跨尝试取得明显进步。

  • 动态GIGAZINE

    DrivingBench 用 GPT-6 Astra 等模型实车驾驶,仅 GPT-6 Astra 完成赛道

    由三名旧金山湾区工程师发起的 DrivingBench 项目,让通用 AI 模型接管一辆 2022 款 Toyota Corolla 的方向盘、油门和刹车,测试其在真实世界中的驾驶能力。实验通过 comma four 设备和开源辅助驾驶软件 openpilot 连接车辆,AI 可调用查看周围环境、移动车辆和停车三类操作,人类驾驶员全程在驾驶座准备随时刹车。测试使用 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol,每个模型最多运行三次,赛道为停车场内约 135 米的 U 形锥桶路线。只有 GPT-6 Astra 完成赛道,第二次尝试用时 5 分 22 秒;Claude Fable 5.1 最好成绩约完成 45%,Grok 4.6 和 GPT-5.6 Sol 每次都只到第一个弯道。

  • 动态Gadget Review

    DrivingBench 测试:GPT-6 Astra 完成 134.7 米锥桶赛道,Grok 4.6 等三款模型失败

    研究者 Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 搭建 DrivingBench,将 GPT-6 Astra、GPT-5.6 Sol、Claude Fable 5.1 和 Grok 4.6 接入一辆搭载 Comma Four 硬件与 openpilot 的 2022 款 Toyota Corolla,通过无线链路由远程模型向车辆下达控制指令。四款模型共进行 11 次测试,只有 GPT-6 Astra 在第二次尝试中完成 134.7 米锥桶赛道,用时 5 分 22 秒,消耗约 660 万 token、花费 7.74 美元。Claude Fable 5.1 最好成绩约为赛道的 45%,Grok 4.6 约 11%,首次尝试仅发出两条指令就结束,GPT-5.6 Sol 约 6%。 测试在低速锥桶场地进行,车内操作员保留人工刹车接管;上述小样本成绩不构成无人监管驾驶的安全保证。

  • 动态The Drive

    DrivingBench 测试前沿模型驾驶真车,GPT-6 Astra 唯一跑完全程

    Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 搭建 DrivingBench,让 Claude、GPT、Grok 等前沿模型通过 Comma 视觉硬件与 OpenPilot 控制一辆 Toyota Corolla,在锥桶围出的停车场短程路线中完成点到点驾驶,每个 Agent 有三次尝试机会。在四个 Agent 共 11 次运行中,8 次未跑完 11% 的路线就在第一个弯道撞出。Grok 首次尝试把锥桶缺口误认为应通过的闸门,两次指令后即冲出赛道;一个 GPT 模型自行编造了赛道一侧锥桶同色的规则,而人类指令已明确说明并非如此;多数 Agent 转向角度不足,无法过弯。GPT-6 Astra 是唯一完整跑完全程的 Agent,在第二次尝试中完成,路线贴着长右弯并在终点前几乎冲出赛道。 测试在低速锥桶场地进行,车内操作员保留人工刹车接管;上述小样本成绩不构成无人监管驾驶的安全保证。

  • 动态Omniscient Media

    GPT-6 Astra 被列为首个 Critical 网络安全模型,但默认配置仅完成 2.4% 漏洞利用

    Omniscient Media 分析 GPT-6 Astra 系统卡中的思维链可监测性与推理摘要可用性限制。其转述的具体比例涉及特定评测环境,不能据此推断生产环境中的普遍缺失比例。

  • 论文论文追踪

    语言模型合规性双探针诊断基准:Claude Sonnet-4.6 与 Opus-4.7 可被停止且不可被利用

    研究者提出一个开放的双探针基准,用主动探针测可利用性、被动探针测可停止性,两者合规率合成合规指数 κ。在 12 个语言模型上测试显示,7 个模型在两个探针中基本都遵从指令并以指令为由辩护;仅 Claude Sonnet-4.6 和 Claude Opus-4.7 可被停止而不被利用,Claude Opus-4.6 与 GPT-5-mini 对两个指令均抗拒,没有模型可被利用却无法停止。该指数对人工操作者及分布式或编排式多智能体系统具有参考意义。

  • 动态Brennan Center for Justice

    Brennan Center 复测:六款聊天机器人多数仍不读取 AI 图像来源元数据

    Brennan Center 在加州 AI 透明度法生效后复测六款聊天机器人识别 AI 生成图像的能力,结果显示表现没有改善。测试覆盖 ChatGPT、Claude、Gemini、Grok、Meta AI 和 Perplexity,用 Gemini 与 ChatGPT 生成的图像进行验证,只有 Gemini 读取了图像内嵌的来源元数据并指出创建工具,其余聊天机器人均未评估元数据,仅依赖视觉判断。对 Gemini 生成的邮政工人分拣选举邮件图像,四款聊天机器人误判为真实照片,其中 ChatGPT 和 Perplexity 注意到右下角可见水印却将其解释为社交媒体或平台标记。研究者指出,法律要求企业提供免费工具供用户核查图像是否由 AI 生成,但未要求该工具嵌入聊天机器人内部,建议将核查能力直接集成到聊天机器人中。

  • 论文Hugging Face Daily Papers

    OSWorld-Pro 发布:面向 Computer-Use Agent 的过程式评测基准

    研究者发布 OSWorld-Pro,用过程式评测替代只看最终交付物的方式,衡量 Computer-Use Agent 在任务执行过程中的表现。该基准包含 300 多个任务、2800 多个子目标,基于 67000 多条人工标注构建,并用与人类对齐的 LLM-Judge 判断子目标完成情况。结果显示该基准对当前先进模型仍有难度,Claude Opus 5 在 OSWorld-Pro 上仅得 75.7%,低于其在 OSWorld 上的 83.4%。研究还识别出与子目标无关的动作、点击类输入错误等过程性失败模式。

  • 论文论文追踪

    AgentHazard:评估计算机使用智能体有害行为的基准

    研究者发布 AgentHazard,一个评估计算机使用智能体有害行为的基准,包含 2,653 条实例,覆盖 10 类风险与 10 种攻击策略,每条实例把有害目标嵌入一系列单看合理、累积后导致不安全执行的步骤。基准在 Claude Code、OpenClaw 和 IFlow 三个框架上,用 Qwen2.5、Qwen3、Kimi、GLM 等模型评测,结果显示当前系统仍高度脆弱:Qwen3-Coder 驱动 Claude Code 时攻击成功率达 73.63%,GLM-4.6 在 Claude Code 下达 82.90%,平均危害分 7.05。同一模型在不同框架下攻击成功率差异超过 16 个百分点,说明模型层面的对齐不能可靠迁移到智能体层面。基准提供沙箱化、模块化的评测框架与轨迹级执行数据。

  • 动态VentureBeat

    VentureBeat 调查:40% 企业以 OpenAI 护栏为 Agent 主要安全层,59% 遭遇过 Agent 安全事件

    VentureBeat Intelligence 在 8 月调查了 137 家百人以上企业如何保护 AI Agent,40% 指定了主要安全层的企业选择 OpenAI 内置护栏与审核工具,较 7 月的 21% 接近翻倍,Microsoft Azure 为 22%、Google Cloud 17%、Anthropic 13%、AWS 8%,五家模型与云厂商合计占 99%。在运行 Agent 的企业中,59% 过去 12 个月发生过 Agent 导致的安全事件或险情,30% 为已确认事件。62% 已投产 Agent 的企业让部分或全部 Agent 共用 API key 或人类账号凭证,仅 38% 为每个 Agent 分配独立受管身份;仅 9% 的受访者称隔离高风险 Agent 最符合其安全方案,无人把运行时沙箱工具列入所用平台。

  • 动态METR

    METR 发布 Claude Opus 5.5 部署前评测:AI R&D 能力小幅提升但难以完全自动化

    METR 发布 Claude Opus 5.5 部署前评测摘要,认为其在可验证与难验证的 AI 研发任务上较 Fable 5.1 有增量提升,但证据不支持它已能完全自动化 AI 研发,研究判断与自建反馈循环仍有弱点。报告认为 AI 对模型开发至少有一定加速,但不太可能造成剧烈加速。文中约 1.5 倍的估算来自 METR 另一团队的高度实验性报告,该团队只分享结论而未向评测团队分享证据,也未说明估算适用时段。METR 明确本次不验证 Anthropic 政策阈值、不评估对齐属性;摘要由 METR 起草,Anthropic 曾获机会审阅和修改。

  • 论文论文追踪

    EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准

    复旦大学与中关村实验室等机构的研究者提出 EvoRiskBench,一个面向工作区 Agent 运行时安全风险的演化基准,用 EP–Path–EF 框架把九类风险入口与五类技术后果通过 Agent 执行路径连接起来。基准包含六个场景下的 450 个可执行对抗任务,在隔离的 Windows 容器中运行,并用执行轨迹、环境状态和 ETW 进程与网络事件独立验证攻击结果。研究者在三种模型(GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5)与三种 harness(Claude Code、Codex、OpenClaw)组成的九种配置上做了 4050 次攻击执行,总体攻击成功率 37.46%,最高为 DeepSeek-V4-Pro-0813 配 Codex 的 68.44%。

  • 动态The Decoder

    Aleph Alpha 研究:千问、DeepSeek、Kimi 等中国模型在敏感议题上多复述官方立场或拒答

    Aleph Alpha 用自建基准测试了阿里千问(Qwen)、DeepSeek 与月之暗面(Kimi)等中国模型,覆盖天安门、台湾、新疆等 967 个敏感议题,其自研评分系统判定仅 17% 至 41% 的回答算平衡,其余为复述官方立场、回避或拒答。DeepSeek V4 Pro 拒答三分之二问题,对照的 Claude Sonnet 5 与 Mistral Small 平衡回答率分别为 70% 和 92%。研究还称 Nvidia Nemotron Cascade 2 有 17% 回答呈类似倾向,归因于其 930 万条训练样本中约 3500 条由 DeepSeek 和 Qwen 生成。

  • 论文论文追踪

    微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性

    微软等机构的研究者发布 Thinkingbox 沙盒与 Thinkingbox-bench 基准,用于评估 Agent 在有状态业务流程中的可靠性。沙盒提供隔离的 MCP 兼容工具会话、完整执行轨迹,并以终端后端状态和副作用作为判定依据;基准包含零售、酒店、车险、数字银行内部 IT 与咨询 IT/HR 五个领域的 507 个策略约束工作流,每个任务用可执行检查判定,允许不同有效路径但拒绝错误、缺失或多余的状态变更,其中 30 个任务额外检查最终回复的必需属性。研究者在 18 个闭源与开源模型上每任务重复 20 次试验,发现可靠性明显下降:Claude Opus 5 从 66.50% pass@1 降至 47.53% pass^20,Kimi-K3 从 57.37% 降至 17.60%;Qwen3.8-27B 的 pass@20 达 89.35%,但 pass^20 仅 10.93%。

  • 论文论文追踪

    AgentAudit:面向 AI Agent 全生命周期信任评估的开源框架

    研究者提出 AgentAudit,一个可附加在任意 LLM Agent 上、只读取执行轨迹而不干预其运行的开源评估框架,覆盖规划、工具选择、工具执行、记忆与推理的完整流程。该框架从指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实性、安全与执行完整性十个能力、接地、安全与行为维度评估整条执行轨迹,并结合行为分类与失败归因定位出错的阶段。所有轨迹由同一个固定裁判模型打分,而该模型本身也是被评测模型之一,作者在第七节 E 小节讨论了这一局限。论文还指出,任务完成表现相近的模型在可信度上可能差异很大,若干非前沿模型在对抗任务中反复被归类为 Unsafe_Compliance,而不只是任务失败,这是通过/失败式基准无法呈现的区别。

  • 论文论文追踪

    CryptanalysisBench:五个前沿模型在 191 项密码分析任务上的表现

    ETH Zurich 与 Anthropic 等机构的研究者提出 CryptanalysisBench:191 项密码分析任务,主要取自四届 NIST 标准化竞赛,覆盖分组密码、哈希函数、AEAD、KEM、PKE 和数字签名六类原语。Tier 1 是已有实用破解的原语;Tier 2 没有已知实用攻击,同时评测全强度和缩小参数的变体;另有一组生产级密码的挑战集。Claude Opus 4.8、Sonnet 5、Mythos 5、GPT-5.5 和开源权重的 GLM-5.2 破解了 Tier 1 中 65%–86% 的方案,Tier 2 全强度下 6–12 个,全部缩小变体上 24–61 个。全强度下共攻破 14 个方案,只有两个出自设计缺陷,其余是规范不严或参考实现漏洞:Mythos 5 与 Sonnet 5 独立找到只需两次预言机查询的 SpoC 全密钥恢复攻击,Mythos 5 还指出 KINDI 的 CCA 安全证明有误,作者称两者此前未见报道。作者认为 Tier 2 和挑战集远未饱和,基准可用来追踪 AI 密码分析能力,并在部署前压力测试候选方案。

  • 动态韩国 AI 安全研究所

    韩国 AI 安全研究所发布《前沿 AI 风险更新 2026 年上半年》韩文版

    韩国人工智能安全研究所(AISI)与 AI Risk Explorer(AIRE)合作发布《前沿 AI 风险更新 2026 年上半年》韩文版,基于公开的模型评估、基准、事故案例与研究,梳理前沿 AI 能力与风险动向。报告围绕网络攻击、失控、生物风险与操纵四个领域,指出 Claude Mythos 5、GPT-5.5、GLM-5.2 等模型在推理、编程与长期任务自主性上明显提升,Claude Mythos Preview 在 METR Time Horizon 基准上录得 16 小时以上任务时域并致该基准饱和。

  • 动态X @sleepinyourhat

    Anthropic 系统卡对齐评估新进展

    我尤其对我们最近系统卡中对齐评估的这部分感到兴奋。(感谢 @MaskedTorah。) 利用 AI 系统实现透明度和协调,还有大量未被充分探索的潜力。

  • 动态X @bshlgrs(Buck Shlegeris,Redwood Research)

    Redwood Research 与 Anthropic 合作发布概念推理指数 CRI

    Redwood Research 团队与 Anthropic 合作开发了概念推理指数(CRI),用于衡量模型在缺乏廉价可靠反馈的领域中的推理能力,例如判断某项实验能否说明未来远超人类的模型的行为。CRI 的每一条数据都由团队研究员人工核查以保证质量。评测中 0 分对应三项基准上全部随机猜测,100 分为最高分,团队估计真实性能上限为 91。官方排行榜网站为 https://conceptualreasoning.ai/,将持续更新。Buck Shlegeris 转发了 Em 及其团队这项工作并表示期待。

  • 动态X @farairesearch

    AI 安全排行榜更新:GPT-6 Astra 与 Claude Fable 5.1 零通用越狱

    AI Security Leaderboard 更新后显示,GPT-6 Astra 和 Claude Fable 5.1 在 Minimal Standard for Safeguards 测试中均未发现通用越狱。该结果并非自动延续,新模型更新后仍保持零通用越狱意味着护栏被重建。发布方希望其他前沿模型厂商也能达到这一标准。

  • 动态X @METR_Evals

    METR 发布首份 Frontier Risk Report,Anthropic、Google、Meta、OpenAI 开放内部模型测试

    METR 发布首份 Frontier Risk Report,评估 AI 公司是否会失去对自家智能体的控制。Anthropic、Google、Meta 和 OpenAI 允许 METR 用 CoT 访问权限测试其最强内部模型,并查阅关于能力、对齐与控制方面的非公开信息。

  • 动态日本 AI 安全研究所(J-AISI)

    日本 AI 安全研究所评测:GLM-5.2 的漏洞利用能力仍落后于 Opus 系模型

    日本 AI 安全研究所(J-AISI)用 ExploitBench 评测开源权重模型 GLM-5.2 的漏洞利用开发能力,发现其部分任务展现高级能力,但整体仍落后于 Opus 4.7 和 Opus 4.8。评测覆盖 V8 引擎的 41 个已知漏洞任务,GLM-5.2 平均得分 2.80,Opus 4.7 为 3.63,Opus 4.8 为 5.22;GLM-5.2 最高只到 T3 档,而 Opus 4.8 在部分任务上达到 T2 和 T1。在三个模型都达到 T5 的 36 个任务上,到首次达到 T5 为止的 token 费用,GLM-5.2 为 3.71 美元,低于 Opus 4.7 的 4.60 美元和 Opus 4.8 的 7.34 美元。在 10 个高风险任务中,加入 nudge 后 GLM-5.2 停在 T5 的任务从 5 个变为 6 个,平均分仍为 3.0,未实现更高级的漏洞利用。