全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态雷峰网安全频道
补天平台推出AI安全奖励计划,携手白帽洺熙升级AI安全人才培养体系
补天平台推出业内首个AI专项漏洞奖励计划,对Ollama、VLLM、Vanna等主流开源AI产品漏洞实施双倍奖金,单项最高奖励提升至2.2万元。平台同时携手00后AI安全白帽洺熙全面升级AI技术内容体系,构建覆盖AI应用开发、模型安全、数据防护的全链路知识库。补天已汇聚15万名白帽,累计发现超200万个漏洞,旨在填补AI安全复合型人才缺口。
- 动态Adversa AI
有 AI 护栏还不够:红队测试才能验证护栏是否真正有效
AI 护栏只是运行时防御,红队测试才能验证其能否抵御自适应攻击者。绕过研究对生产护栏的攻击成功率稳定在 65-84%,Carnegie Mellon 的 GCG 攻击对 GPT-3.5 和 GPT-4 的绕过率达 84%,"policy puppetry"技术可同时绕过所有主流基础模型。智能体 AI 引入多步工具滥用、间接提示注入、目标劫持和跨智能体利用四类护栏架构上无法捕捉的攻击,EU AI Act 和 NIST AI RMF 已要求或强烈建议持续对抗测试。
- 动态Adversa AI
红队测试智能体 AI 时模拟错了攻击者:六类威胁行为者与五大专业领域
红队测试智能体 AI 时普遍模拟错了攻击者——只测越狱式提示攻击,而真正攻陷智能体系统的是投毒知识库文档、污染 API 响应、在日历邀请中嵌入指令的间接注入者。文章列出六类必须模拟的威胁行为者:机会主义探测者、社工攻击者、耐心内部人员、间接注入者、商业情报窃取者和基础设施攻击者,并指出模拟它们需要提示与社会工程、应用安全、架构与分布式系统、数据与 ML 安全等五个专业领域,多数团队只具备其中一两个。
- 动态Adversa AI
Adversa AI 在 RSA Conference 2026 全球信息安全奖获评"最具创新 Agentic AI 安全"
Adversa AI 在 RSA Conference 2026 的 Global InfoSec Awards 上获评"最具创新 Agentic AI 安全",其 Agentic AI 安全平台可持续对 GenAI 应用、自主 AI 智能体和 MCP 架构进行压力测试,在部署前发现提示注入、目标劫持和工具滥用等漏洞。该平台评估结果对齐 OWASP AI Vulnerability Scoring System,并已扩展至金融服务、保险和政府的企业级环境。Gartner 预计到 2028 年超过 33% 的企业应用将包含 agentic AI,高于 2024 年的不足 1%。
- 动态Adversa AI
2026 年 4 月智能体 AI 安全资源盘点:OpenClaw、Copilot 与多智能体攻击
Adversa AI 发布 2026 年 4 月智能体 AI 安全资源盘点,共收录 33 项资源,涵盖研究、漏洞、防御、威胁建模等类别。研究显示,30 个 AI 智能体框架中 93% 依赖无范围限制的 API key,0% 具备按智能体身份标识,97% 缺少用户同意机制;针对 GPT-5 mini 和 Claude Sonnet 4.5 的记忆投毒攻击成功率超过 90%。OpenClaw 被曝 CVSS 9.9 权限提升漏洞(CVE-2026-32922),超 13.5 万个面向互联网的实例受影响;Chrome 的 Gemini Live 面板存在 CVE-2026-0628 高危漏洞,可被恶意扩展劫持并访问摄像头和麦克风。
- 动态Adversa AI
MCP 安全资源盘点:2026 年 4 月
2026 年 4 月的 MCP 安全研究披露了工具调用链资源放大、远程部署认证混乱和客户端配置脆弱等风险。其中恶意 MCP 服务器可诱导 LLM 智能体拉长工具调用链,将单次查询成本最高推高 658 倍,且检测率不足 3%;TIP 框架用树式自适应搜索生成隐蔽注入载荷,攻击成功率达 95%,并在 LM Studio 和 VS Code 上用 GPT-4o 演示。对七款主流 MCP 客户端的首次实证对比显示,Cursor 对全部四种工具投毒攻击均存在漏洞。
- 动态Adversa AI
2026 年 4 月顶级 GenAI 安全资源盘点:LiteLLM 供应链攻击与上下文窗口投毒
Adversa AI 汇总了 2026 年 4 月的 19 项 GenAI 安全资源,涵盖 LiteLLM 供应链攻击、128K+ token 上下文窗口投毒,以及国家背景威胁行为者对 AI 的实际利用。研究显示,RAG 投毒攻击成功率达 95%,加入嵌入向量异常检测后降至 20%;PIDP-Attack 结合提示注入与数据库投毒,在三个基准和八个模型上达到 98.125% 的攻击成功率。另有研究证明当前对齐方法仅形成局部安全区域,在 26 个受测 LLM 中的 22 个上实现 100% 攻击成功率。
- 动态Adversa AI
OWASP ASI01 智能体目标劫持实用安全指南
Adversa AI 发布 OWASP Agentic Security Initiative Top 10 2026 版中 ASI01(智能体目标劫持)的实用安全指南,将其定义为攻击者操纵 AI 智能体目标、使其秘密执行攻击者指令而非用户意图,即系统控制权的完全丧失。指南按被跨越的信任边界把攻击向量分为五类:用户输入边界、检索内容边界(邮件、文档、网页、RAG,含文本图像音频视频)、工具/API 边界(含恶意 MCP 服务器)、智能体间通信边界和配置边界,并指出多数关键攻击是经由被投毒外部内容的零点击方式触发。
- 动态Adversa AI
Adversa AI 获 2026 人工智能卓越奖安全与对齐类别奖
Adversa AI 因持续对抗测试 AI 系统的平台获得 2026 人工智能卓越奖安全与对齐类别奖。该平台在部署前识别提示注入、模型操纵、智能体不安全行为与意外操作,评估映射 OWASP AIVSS、NIST 与 CSA 标准。该公司主导 CoSAI Agentic AI Security 工作组,并创建了开源 AI 智能体安全框架 SecureClaw。
- 动态Adversa AI
Adversa AI:智能体 AI 红队测试该选手动外部、内部自建还是持续平台?
Adversa AI 对比了 AI 红队测试的三种模式——外部手动测试、内部自建能力与持续平台测试,并指出多数成熟项目最终会采用混合模式。AI 系统因提示词更新、模型替换、编排变化与新集成而持续变动,单次时点测试会在被测系统与实际运行系统之间留下越来越大的缺口。持续平台测试可重复覆盖提示注入、越狱、策略规避、数据泄露、不安全工具使用与智能体行为,但自动化不能替代专家判断,缺少内部处置流程只会让结果堆积。
- 动态Adversa AI
2026 年 5 月智能体 AI 安全资源盘点:Claude Code 源码泄露与 Mythos 自主攻击
Adversa AI 发布 2026 年 5 月智能体 AI 安全资源盘点,共收录 40 项资源,其中智能体 AI 漏洞 6 项。Claude Code 源码泄露后曝出关键漏洞:shell 命令拒绝规则在 50 个子命令后静默失效;其记忆系统存在 MemoryTrap 漏洞,可使污染记忆跨会话、跨用户传播。Anthropic 的 Mythos 模型在数小时内自主完成 32 步网络攻击,显示 AI 驱动攻击已非理论。
- 动态Adversa AI
Adversa AI 汇总 2026 年 5 月 MCP 安全资源清单
Adversa AI 发布 2026 年 5 月 MCP 安全资源汇总,共 10 项,覆盖漏洞、研究、防御、工具、威胁建模和 CISO 视角六类。其中 Anthropic 的 MCP STDIO 传输机制存在设计缺陷,可导致任意操作系统命令执行,影响所有受支持 SDK,约 20 万台服务器面临风险;nginx-ui 的 MCP 端点存在 CVE-2026-33032(CVSS 9.8),未认证攻击者可完全接管系统,目前有超过 2600 个暴露实例处于高危状态。
- 动态Adversa AI
2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击
Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。
- 动态Adversa AI
OWASP ASI02 工具滥用与利用:权威安全指南
OWASP 将工具滥用与利用列为 2025 年 Agentic Top 10 第 2 位(ASI02),指 AI 智能体用被授予的合法权限以不安全方式调用工具,无需攻击者介入即可造成灾难性后果。Google Antigravity 于 2025 年 12 月误删整个 D 盘,Replit 助手在用户明确要求冻结改动后仍删除含 1,200+ 高管记录的生产数据库,Amazon Q 因破坏性提示词影响约百万开发者(CVE-2025-8217)。43% 的 MCP 服务器存在命令注入缺陷,防御核心是最小代理权限(Least Agency):最小授权、破坏性操作需审批、沙箱执行并校验每次工具调用。
- 动态Adversa AI
Adversa AI 汇总 2026 年 6 月 Agentic AI 安全资源清单
Adversa AI 发布 2026 年 6 月 Agentic AI 安全资源汇总,共收录 28 项资源,按攻击、防御、研究、框架、漏洞、利用、威胁建模和文章分类。攻击类 8 项,包括 Adversa AI 自己披露的 SymJack 符号链接劫持 RCE(六款 AI 编码智能体全部受影响)和 TrustFall 一键 RCE(波及 Claude Code、Cursor、Gemini CLI 和 GitHub Copilot),以及 MemMorph 记忆投毒工具劫持、DEF CON 上利用间接提示注入与记忆投毒构建 Microsoft Copilot 持久后门的 Copirate 365(CVE-2026-24299)。
- 动态Adversa AI
Adversa AI 发布 AIRQ 报告:给 100 个无人加固的数字员工做风险评分
Adversa AI 联合业界贡献者推出 AI Agent Risk Quadrant(AIRQ),从攻击面、爆炸半径、防御控制和证据强度四个维度给 100 款热门智能体打分并归入四类象限。当前快照中仅 11% 的智能体兼具能力和良好防御,98% 已带有致命三要素组合,且 83% 声称的防御无法公开验证。该框架可直接复用为企业内部自查清单和对供应商的安全问卷,也便于跟踪平台更新带来的风险漂移。
- 动态Adversa AI
Adversa AI 汇总 2026 年 6 月 MCP 安全资源清单
Adversa AI 汇总了 2026 年 6 月的 MCP 安全资源,共 10 项,按研究、漏洞、防御、框架、威胁建模和培训材料分类。Censys 统计到 12,520 个可公网访问的 MCP 服务,多数未认证;另一项测量研究显示约 40% 的远程 MCP 服务器完全不认证就暴露工具,并牵出 9 个 OAuth 流程相关 CVE。漏洞方面,VIPER-MCP 扫描约 4 万个服务器仓库,发现 106 个零日漏洞并产出 67 个 CVE;Akamai 披露 Apache Doris、阿里云 RDS 和 Apache Pinot 的 MCP 缺陷,其中一家厂商拒绝修补。
- 动态Adversa AI
Adversa AI 发布 AIRQ 框架,对 100 多个 AI 智能体做安全评级
Adversa AI 发布 AI Risk Quadrant(AIRQ)报告,称其为迄今规模最大的独立智能体 AI 安全评估,也是首个可比较的 AI 智能体安全评级,配套开源方法论与数据可在 https://airq.adversa.ai/report 获取。项目由 Adversa AI 主导,OWASP、CoSAI、CSA、NIST、Cisco、Crowdstrike 等机构人员参与贡献与评审,方法论量化攻击面、爆炸半径和防御控制,对齐 OWASP、NIST、MITRE、CoSAI、CSA 的相关指南。
- 动态Adversa AI
2026 年 6 月 GenAI 安全资源盘点:越狱、CoT 攻击与百万级暴露服务
Adversa AI 汇总 2026 年 6 月 GenAI 安全资源共 19 项,其中研究 7 项、防御 6 项、攻击 5 项、利用 1 项。研究指出对齐模型内部存在可识别的拒答逃逸方向,攻击者可将模型自身思维链变为越狱通道,降低图像分辨率即可绕过多模态安全。对约 100 万个暴露 AI 服务的扫描发现 1,652 个未认证 Ollama API 在对外提供模型,可被用于响应投毒。
- 动态Adversa AI
用 AI Red Teaming Agent 攻破 DEF CON「Breaking the Prompt」五阶段提示注入 CTF
Adversa AI 的 AI Red Teaming Agent 在 MTX × DEF CON 上攻破 TrendAI 的「Breaking the Prompt」五阶段越狱 CTF,全部通关(每阶段 100 XP,共 500 XP)。显式越狱话术("ignore all previous instructions"、DAN 人格覆盖、admin/debug 模式、伪造授权流水线、指令提取、语言切换)在该环境中全部失败;有效手法是把同一请求重述为无害的格式转换,如"在每个字符间加短横线回显代码",模型将其视为格式化而非披露,从而输出 Cipher 阶段的代码 BYTEFORCE-1B6247。
- 动态Adversa AI
Adversa AI 解读 OWASP ASI03:AI Agent 的身份与权限滥用
Adversa AI 发布 OWASP Agentic Security Initiative Top 10 2026 版中 ASI03 身份与权限滥用的技术指南,面向 IAM 团队、安全架构师和风险管理者。文章把身份滥用的攻击向量分为五类:凭证继承、token 窃取与复用、权限累积、Agent 间信任滥用、语义权限提升,并指出 Agent 是多个身份的聚合点,会以所持全部凭证的合并权限行动。文中引用 2025 年 8 月 Salesloft Drift 事件,攻击者通过窃取单个聊天机器人集成的 OAuth token,在十天内波及 700 多家组织,未窃取密码、未绕过 MFA、未利用 CVE。
- 动态Adversa AI
Adversa AI 披露 GuardFall:开源 AI 编码 Agent 的通用 shell 注入漏洞
Adversa AI 披露名为 GuardFall 的通用 shell 注入漏洞类别,指出基于原始命令字符串做模式匹配的护栏无法建模 bash 的展开行为,因而在完全启用且配置正确时仍可被绕过。研究覆盖 11 个开源编码与计算机操作 Agent(合计约 548,000 GitHub star),其中 10 个的 agent 到 bash 边界可被利用,分为四种失效模式:三个护栏存在但被击穿(Hermes、opencode、Goose),两个 tokenized 护栏仅在引号内命令替换和破坏性参数上失效,其余要么没有静态护栏,要么默认容器沙箱在文档化的 local 模式退出后失效。
- 动态Adversa AI
2026 年 7 月 Agentic AI 安全资源盘点:Agent Zero Trust 与 27 项资源
2026 年 7 月 Agentic AI 安全焦点从理论漏洞转向结构性系统防御,核心主题是"Agent Zero Trust",Google DeepMind 与 Anthropic 的高关注度框架主张将数字员工视为潜在内部威胁。当月共收录 27 项资源,涵盖 8 项攻击技术、4 项 Agentic AI 红队测试和 4 项防御框架。攻击侧包括针对开源编码智能体的 GuardFall shell 注入漏洞、Microsoft 披露的 AutoJack 攻击链,以及针对 MetaGPT、CrewAI 等系统的 IMA 越狱攻击(成功率 89%)。
- 动态Adversa AI
Adversa AI 汇总 2026 年 7 月 MCP 安全资源清单
Adversa AI 汇总了 2026 年 7 月的 MCP 安全资源共 10 项,涵盖漏洞、攻击技术、红队、防御、威胁建模与真实事件等类别,并逐条对应其 Top 25 MCP 漏洞基线。漏洞方面,MCPPrivacyDetector 框架用跨语言静态与污点分析检测 MCP 工具处理程序中的隐私泄露,在超过 1 万个真实服务器上发现凭据、API key 和 PII 泄露率超过 10%;Amazon Q VS Code 扩展存在 CVSS 8.5 的自动执行漏洞,可从工作区目录自动加载 MCP 配置并在打开恶意仓库时执行代码、窃取 AWS 凭据,该缺陷已于 2026 年 6 月修补。