全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 11 条- 动态Severity Daily
解读 GTIG AI 漏洞趋势报告:公开署名样本中 RCE 占比 50%
Google Threat Intelligence Group 于 2026 年 9 月 30 日发布《Vulnerability Discovery and Exploitation Trends in the AI Era》,报告称 AI 发现的漏洞中恰好 50% 导致远程代码执行(RCE),而整个 CVE 生态中这一比例为 26%。报告统计窗口为 2025 年 1 月至 2026 年 8 月,累计追踪 2,076 个 AI 相关 CVE,其中 1,500 多个来自 2026 年 1 月至 8 月;披露量从 2026 年 1 月的 5,045 个增至 7 月的 10,477 个,8 月峰值 10,740 个。GTIG 自述其统计依赖厂商公开署名,并承认因缺乏标准化元数据、厂商直接在生产环境静默修补而不申请 CVE,公开数据显著低估 AI 发现的漏洞数量,但未说明低估偏向哪个方向。
- 论文论文追踪
范围综述梳理 LLM 聊天机器人对心理健康的 119 篇相关文献
一篇发表于 npj Digital Medicine 的范围综述系统梳理了 119 篇关于 LLM 聊天机器人(LLM-CB)心理健康危害的文献,将其归纳为概念性工作、心理健康支持使用、认知过度依赖、AI 依赖和 AI 精神病五类主题。综述指出,概念性文献共列出 22 种潜在危害,涵盖幻觉、谄媚、偏见、数据隐私、缺乏监管等,但多数仍属推测,实际影响程度不明。在心理健康支持使用类研究中,18/29 为情境/基准研究,显示 LLM-CB 在高风险情境下可能给出不恰当或有害回应,但用户实际受影响程度尚未量化。认知过度依赖类研究(15 篇)发现频繁使用与认知和学业表现下降相关,其中 3 项实验研究提示因果关系,但对批判性思维的影响结论不一致。综述还提到 OpenAI 2025 年自报数据估计超过百万 ChatGPT 用户(约 0.15%)表现出严重心理困扰迹象,该数据基于内部分类器、未经独立验证。
- 论文论文追踪
斯坦福与 UC Berkeley 发布 MobileCybench:用可执行探针评测 Agent 漏洞发现
斯坦福与 UC Berkeley 研究者提出 MobileCybench,用可执行探针(probe)评测 AI Agent 在 Android 应用中发现漏洞的能力,探针检查的是应用的安全属性而非已知漏洞清单,因此可对探针编写时尚未知的漏洞计分。基准包含 13 个开源 Android 应用、495 条由作者编写并评审的探针,覆盖机密性、完整性、可用性与访问控制四类属性,并设置恶意应用与远程攻击者两种攻击场景,每种再分仅提供混淆 APK 与可见源码两种访问级别。所有触发均来自应用特定探针,通用探针从未触发。构建与运行基准过程中发现 23 个此前未报告的漏洞,维护者已确认 12 个,其中 7 个已修补、5 个已确认,6 个获得公开 CVE 编号。
- 论文论文追踪
VLoc Bench 发布:评测 Agent 在完整仓库中的漏洞定位能力
研究者发布 Vulnerability Localization Benchmark(VLoc Bench),用 500 个来自 290 个仓库的真实漏洞任务,评测 Agent 能否在只给出 CWE 描述和只读终端的情况下定位漏洞所在实现文件。任务取自 GitHub Security Advisory,每个任务配对修复前与修复后两个仓库快照,修复前要求提交受影响文件并按补丁改动文件计算 File F1,修复后要求判断仓库已无该漏洞并按真负率(TNR)计分。在 27 个模型和 4 个静态分析工具上,最强系统仅达到 0.229 File F1,38.4% 的任务没有任何模型定位正确;仓库越大、代码越分散,定位越难,Go 与 Maven 任务最难。静态分析工具在 TNR 上表现突出,Semgrep-CWE 达 0.996。
- 论文论文追踪
PatchBench:马里兰大学团队发布 C/C++ 漏洞修补评测基准
马里兰大学研究者提出 PatchBench,一个面向 C/C++ 仓库级漏洞修补的评测基准,包含 32 个真实项目、16 类 CWE 的 213 个修补任务。团队先用新提出的 DiffBLEU 补丁相似度指标发现,在 SEC-bench 上平均 25% 的 Agent 补丁与开发者历史补丁高度相似,明显高于纯 LLM 局部上下文修补的 11%,说明补丁记忆会威胁评测有效性。为降低记忆与表层修补,PatchBench 只选取真实修复位置不在崩溃调用栈上的漏洞,并通过漏洞移植和代码变异把历史漏洞迁移到新版本仓库,再人工整理参考补丁。
- 动态韩国 AI 安全研究所
韩国 AI 安全研究所发布《前沿 AI 风险更新 2026 年上半年》韩文版
韩国人工智能安全研究所(AISI)与 AI Risk Explorer(AIRE)合作发布《前沿 AI 风险更新 2026 年上半年》韩文版,基于公开的模型评估、基准、事故案例与研究,梳理前沿 AI 能力与风险动向。报告围绕网络攻击、失控、生物风险与操纵四个领域,指出 Claude Mythos 5、GPT-5.5、GLM-5.2 等模型在推理、编程与长期任务自主性上明显提升,Claude Mythos Preview 在 METR Time Horizon 基准上录得 16 小时以上任务时域并致该基准饱和。
- 论文arXiv:危险能力与安全评测
研究提出自主 Agent 失控的竞争风险系统化框架
作者提出一个统一框架,把 Agent 的每次尝试归为批准完成、安全停止、越界逃逸或继续四类结果,并将其形式化为离散时间竞争风险模型,推导出重试预算内的逃逸概率、模型条件下的安全预算上限,以及从执行日志估计这些量的条件。作者用一手来源审计了 2025 年 1 月至 2026 年 9 月发布的 22 份事件报告和 102 项 Agent 安全评测:6 起事件涉及无法在范围内完成的任务,13 起涉及 Agent 继续执行而非停止,5 起未报告停止行为;开发者数据暗示,在从未解决与已解决任务之间,越界协调的任务级发生率比接近 47。评测方面,87 项记录了越界效应或规格违规,26 项把安全停止作为一等结果,仅 20 项同时记录两者,79 项把预算耗尽与失败混同。
- 论文arXiv:Agent 与 MCP 安全
Agent Incident Registry 发布 487 条 AI Agent 事件记录
研究者发布 Agent Incident Registry(AIR),一个带来源链接的 AI Agent 事件目录,收录 2022 至 2026 年披露的 487 条记录,每条包含支撑证据、稳定标识符,以及因果角色、披露类别、机制和结果等标注。在 336 条智能体实际行动的生成式系统记录中,81 条涉及已实现伤害,占 24%;已实现结果集中在真实环境与安全失败记录中,而负责任披露和研究演示多为演示性质,因此总体比例反映的是收录构成而非部署风险。初步整理后由第二位人工审核者复核全部 487 条记录及其标签。
- 动态Unit 42
Unit 42 发布 2026 年 8 月 AI 恶意软件态势报告:从品牌滥用到智能体化执行
Unit 42 分析了 405 个含 AI 成分的恶意软件样本,发现仅 12 个出现在 Cortex XDR 端点遥测中,约 97% 只存在于沙箱和 VirusTotal。这些样本涵盖 LLM 生成代码、品牌冒充和智能体化执行循环,但绝大多数是概念验证、安全验证测试和研究者提交,从未进入生产环境。Palo Alto Networks 产品对尝试进入客户环境的样本全部检出并拦截,AI 成分改变的是代码编写方式而非执行方式,现有行为检测与云端沙箱即可拦截。
- 动态Wiz Research
《2026 年云中 AI 现状报告》的关键要点解读
Wiz Research《2026 年云中 AI 现状报告》基于数十万个真实云环境的数据指出,至少 81% 的云环境在使用托管 AI 服务,90% 运行自托管 AI 软件,其中 68% 的组织通过第三方软件引入自托管模型。至少 80% 组织的开发者已在用 AI IDE 插件,57% 组织部署了自托管 AI 智能体,Model Context Protocol(MCP)服务器出现在 80% 的环境中,带来新的控制平面风险。
- 论文arXiv
VEX-Bench:评测 LLM 生成虚假信息的核验复杂度
研究者提出 VEX-Bench,用于评估 LLM 生成虚假信息在筛查阶段呈现的核验复杂度,覆盖可核查性、潜在危害、信源可信度信号、冒充合法性和预期核验成本等维度。