跳到正文

工具与开源

今天新收录 14 条(含旧文)

第 4 页更新的内容回到最新

10月1日周四
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文18

    RWPS:面向网络安全博弈的高效纳什均衡计算

    针对博弈收益只能由模拟器输出、均衡求解受收益估计瓶颈限制的问题,研究者提出 Regret-Weighted Payoff Sampling(RWPS),把固定模拟预算集中用于均衡真正依赖的收益,并用已测收益训练模型预测其余收益。该方法给出按对手均衡策略加权收益误差的界,在三个合成一般和博弈(含 Colonel Blotto)上比标准界紧 4 至 6 倍,并在同等预算下比 minimum-regret-first search、information-gain search 和 progressive sampling 找到更不易被利用的均衡。

  2. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    Open-1B:一次完全可审计的训练运行

    作者提出一种新的模型透明度层级“完全可审计”,让训练中每个数据样本上的每一步操作都能在异构消费级硬件上以位级确定性独立复现。由于浮点运算不满足结合律,现有开源模型即使公开权重、数据和配方也无法被证明可复现,这为未披露数据、注入偏见或后门留下空间,而 proof-of-learning 与 proof-of-training-data 等方法无法排除这些风险。作者对训练非确定性的三个来源施加确定顺序:GPU kernel 归约、数据并行集群中的数据批次顺序,以及节点内与节点间的集合通信,从而可以在单台消费级硬件上重放大规模分布式训练的任意单步并与公开轨迹比对。

  3. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文18

    DeepSeek Elastic Compute(DSec):面向大规模智能体训练的高效沙箱基础设施

    DeepSeek 发布生产级沙箱平台 DSec,通过统一 SDK 提供 FnCall、容器、microVM 和 full-VM 四类沙箱后端,并与强化学习框架协同设计,将带状态的 rollout 执行与可抢占的 GPU 训练解耦,同时缓解奖励作弊等智能体失范行为。单个生产单元约 160 个节点,每天服务约 300 万个沙箱,支持超 38 万个并发沙箱、每秒超 5000 次沙箱创建,镜像数据按需从 3FS 分布式文件系统加载。

  4. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文15

    DeceptionAnalyser:基于论证方案与 LLM 的结构化欺骗分析网页工具

    DeceptionAnalyser 是一款浏览器端工具,用十种论证方案建模不同形式的欺骗,通过 LLM 提取前提、再以关键问题驱动评估的两阶段方法分析叙事文本中的欺骗推理。研究未做分类准确率基准,而是用十款当代大语言模型重复运行,测量前提与结论评估的一致性来检验方法可靠性,发现对明确欺骗的方案识别高度稳定,在更模糊的情报风格叙事上则以可解释的方式平缓退化。该方案库定位为标记可疑主张供审查,而非输出欺骗判定。

  5. Hugging Face Daily Papers · 收录 · 原文 论文29

    Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作采样

    Mid-Harness 在模型与 harness 边界采样并验证候选动作后再转发执行,生成器与 harness 保持不变。在 TerminalBench-Lite 上,GPT-5.6 Sol 验证器配合 8 个采样动作将 TMAX-9B 生成器的 Pass@1 从 50.00% 提升至 68.03%;弱验证下增加采样收益有限。将强验证器响应蒸馏回 TMAX-9B 可进一步提升 Pass@1,且动作与轨迹扩展结合比单独生成更多轨迹更省 token。

  6. 腾讯 AI-Infra-Guard 版本发布 · 收录 · 原文 50

    腾讯 AI-Infra-Guard v4.6.4 发布,新增可组合提示注入研究工具包 pikit

    腾讯 AI-Infra-Guard 发布 v4.6.4,在 Research/pikit 下新增可组合提示注入研究工具包 pikit。该版本同时修复 Skill-Scan,将可选的 reasoning effort 转发至模型 API,并更新了 Research/pikit 的 README 文档。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. Hugging Face Daily Papers · 收录 · 原文 论文15

    PatchHolmes:基于列表式选择的智能体补丁检索系统

    PatchHolmes 提出让 AI 智能体一次性读取前 100 个候选提交并通过四个预算受限的工具逐一打开提交来定位漏洞修复补丁的方法,将 Recall@1 从逐点系统的 34.61% 提升至 59.95%。该系统无需微调和付费搜索 API,仅依赖冻结的开源权重模型运行于本地 Git 克隆仓库之上,单次处理约消耗 96000 输入 token、执行 8 次工具调用并阅读 5 个提交。

  8. Hugging Face Daily Papers · 收录 · 原文 论文22

    SkillSeek:Agent 技能检索在 Marketplace 规模下的再审视

    SkillSeek 在 89 项任务的基准上对比 11 种检索方法,发现 1990 年代的 BM25 关键词匹配在 4 种设置中的 3 种追平或超过智能体式检索循环,小型 cross-encoder 在第四种设置以 0.442 通过率持平。每次运行成本为无技能 27.41 美元、该检索器 27.54 美元、智能体循环 51.30 美元,且该检索器在 CPU 上运行、不消耗任何语言模型 token。作者主张智能体式检索应作为兜底方案,标准检索流程才是首选;论文同时指出大技能池下第一阶段召回率会限制任何重排器的上限。

  9. Hugging Face Daily Papers · 收录 · 原文 论文43

    Agent Error Dataset 发布 5 万条错误诊断配对,用于失败分析与错误感知后训练

    论文提出 Agent Error Dataset(AED),包含来自 9,961 个源任务、33 个环境、19 个 harness 家族和 23 个策略模型的 50,228 条错误诊断配对,并保留源轨迹与执行元数据以支持跨场景失败分析和重新诊断。作者用五阶段 Agentic Error-to-Training(AET)流程收集自然失败、生成诊断与修正建议,并对照记录证据进行核验。在 3,062 对匹配重放中,首次提出的修正把验证器通过率从 18.4% 提升到 51.1%,提高 32.7 个百分点。

  10. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文22

    用进化方法为 Rocq 和 Lean 设计智能体/证明器接口,降低定理证明成本

    研究者提出一种进化方法,由前沿模型逐步提出新接口功能,只保留能提升小模型整体表现的部分,并据此培育出面向 Rocq 证明器的新 MCP 服务器 rme。在 miniF2F-Rocq 的留出 test 划分上,配备 rme 的智能体在来自两个模型族的四个模型上,成功率、单次求解成本和单次求解时间均优于仅暴露 Rocq 编译器的基线以及一个已有 MCP 服务器。该服务器虽为 Rocq 进化而来,却能迁移到 Lean,在 PutnamBench 子集上改善成本与时间,作者已开源 rme 及其 Lean 移植版。

  11. arXiv · 收录 · 原文 论文24

    SyzHarness:用 LLM 合成模糊测试 harness 复现 Linux 内核补丁漏洞

    SyzHarness 结合 LLM 推理与覆盖率引导模糊测试,从补丁出发复现 Linux 内核漏洞:LLM 智能体借助代码导航工具合成参数化 fuzzing harness,固定前置设置逻辑,只把不确定的 bug 关键输入参数交给 Syzkaller 变异,再通过分层可达性反馈迭代优化。在 100 个 KernelCTF 案例上复现成功率达 78%,在 SyzDirect 基准上达 73%,明显优于此前的定向灰盒模糊测试;对 2026 年 3 月后修复的 50 个 syzbot 已知可触发 bug,仅凭修复提交即复现 40/50(80%)。

  12. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文17

    面向企业智能体持续部署的 Agentic Company OS:认知基座反转

    一篇立场论文提出,企业 AI 智能体演示成功却难以长期运行,根源在于其推理所依赖的数据是为人类操作者而非语言模型组织的。作者主张围绕匹配推理界面的表示重建"认知基座",将 schema 转换隔离到动作边界,并以 Markdown 作为当下可用的实例。论文提出 Data、Knowledge、Intelligence、Governance 四层框架,由 Sync Agent 执行动作边界与逐技能信任梯度,并分析了编译路径上的间接提示注入等风险。

  13. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文8

    EvoOntology:面向数据智能体的自演化本体层

    EvoOntology 将本体封装为包含 schema、内容与工具三层的 MCP server,让数据智能体在运行时主动查询本体,以弥合异构数据与智能体之间的 agent-data gap。系统引入 builder agent 自主构建本体,并通过归因引导的类型化编辑与骨干条件配对评估驱动的自演化循环持续精炼本体。在三个数据智能体基准和四个 LLM 骨干上,EvoOntology 一致优于强基线及现有语义层方法。

  14. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文15

    DriveMCP:面向高级驾驶辅助系统的智能体 AI 框架

    DriveMCP 是一个面向高级驾驶辅助系统的智能体 AI 框架,将感知、合规推理、车辆状态解读与安全仲裁整合为模块化、可审计的流水线。它以 DriveLM 作为视觉语言前端生成图结构场景理解,并通过 MCP 服务器协调规则、天气与 CAN/OBD 遥测三类专家,输出经 RSS 式护栏仲裁的决策。在 CARLA 的多语言、跨境与动态限速场景中,DriveMCP 相比 VLM-Direct、VLM-Direct+RAG 和 VLM-Tools-NoArbiter 基线减少了交通违规与超速,改善了危险响应时间,并保持亚秒级建议延迟。

  15. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文34

    PentestChain:面向免费层 LLM 的成本感知 MCP 编排自动化渗透测试框架

    PentestChain 是一个十阶段自动化渗透测试框架,通过成本感知的 AI 级联(本地 Ollama qwen2.5-7b 优先,其次免费层 OpenRouter 与 Cerebras,并带规则回退)在零付费 API 成本下实现端到端运行,并以 MCP 服务器暴露 11 个工具。该框架基于 2025 年 MCP 事件记录(mcp-remote 的 CVE-2025-6514 远程代码执行漏洞、postmark-mcp 供应链后门及工具投毒类攻击)建立四位置威胁模型并提出四项缓解措施。

  16. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文15

    HTN 规划作为多服务器 MCP 工具编排的协调层

    针对 MCP 仅允许 host 编排跨服务器工作流、由 LLM 编排时结果不确定且每次工具调用需一次推理往返的问题,研究者提出一种协调架构:由 HTN 规划器一次性生成可验证的跨服务器计划,再由运行时中间件在多个 MCP 服务器上确定性执行,并通过 ${context.X} 模板机制在执行时绑定跨动作数据依赖。该架构在实验室机器人、生物信息学和多尺度建模五个 HTN 域上实例化,从浏览器端计划控制器对八个在线第三方 MCP 服务器完成端到端执行。

  17. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    AutoMark:让自动研究流程自主发现更优 LLM 水印方案

    AutoMark 提出一套让自动研究流程自主发现无失真水印方案的框架,作者称这是首次实现水印方案的自主发现。框架包含三部分:设定水印可靠性的严格标准(例如避免异常高的假阳性率)、用统计检验自动判断方案是否满足标准,以及从可检测性、质量和鲁棒性三个维度对水印排序的评测套件。在 GPT-6 Astra、Opus 5、Gemini-3.8 Flash 三个前沿模型上运行后,共发现 50 多种水印方案,其中若干在所有关键维度上超过此前工作。作者还对发现的方案做人工分析,把关键思路拆解为更小组件并逐一研究各组件对三个维度的影响,并指出智能体除改进已有思路外也发现了全新思路,例如将水印分数与随请求变化的随机方向对齐。

  18. Adversa AI · 收录 · 原文 15

    有 AI 护栏还不够:红队测试才能验证护栏是否真正有效

    AI 护栏只是运行时防御,红队测试才能验证其能否抵御自适应攻击者。绕过研究对生产护栏的攻击成功率稳定在 65-84%,Carnegie Mellon 的 GCG 攻击对 GPT-3.5 和 GPT-4 的绕过率达 84%,"policy puppetry"技术可同时绕过所有主流基础模型。智能体 AI 引入多步工具滥用、间接提示注入、目标劫持和跨智能体利用四类护栏架构上无法捕捉的攻击,EU AI Act 和 NIST AI RMF 已要求或强烈建议持续对抗测试。

  19. Adversa AI · 收录 · 原文 20

    红队测试智能体 AI 时模拟错了攻击者:六类威胁行为者与五大专业领域

    红队测试智能体 AI 时普遍模拟错了攻击者——只测越狱式提示攻击,而真正攻陷智能体系统的是投毒知识库文档、污染 API 响应、在日历邀请中嵌入指令的间接注入者。文章列出六类必须模拟的威胁行为者:机会主义探测者、社工攻击者、耐心内部人员、间接注入者、商业情报窃取者和基础设施攻击者,并指出模拟它们需要提示与社会工程、应用安全、架构与分布式系统、数据与 ML 安全等五个专业领域,多数团队只具备其中一两个。

  20. Adversa AI · 收录 · 原文 18

    2026 年 4 月智能体 AI 安全资源盘点:OpenClaw、Copilot 与多智能体攻击

    Adversa AI 发布 2026 年 4 月智能体 AI 安全资源盘点,共收录 33 项资源,涵盖研究、漏洞、防御、威胁建模等类别。研究显示,30 个 AI 智能体框架中 93% 依赖无范围限制的 API key,0% 具备按智能体身份标识,97% 缺少用户同意机制;针对 GPT-5 mini 和 Claude Sonnet 4.5 的记忆投毒攻击成功率超过 90%。OpenClaw 被曝 CVSS 9.9 权限提升漏洞(CVE-2026-32922),超 13.5 万个面向互联网的实例受影响;Chrome 的 Gemini Live 面板存在 CVE-2026-0628 高危漏洞,可被恶意扩展劫持并访问摄像头和麦克风。

  21. Adversa AI · 收录 · 原文 35

    MCP 安全资源盘点:2026 年 4 月

    2026 年 4 月的 MCP 安全研究披露了工具调用链资源放大、远程部署认证混乱和客户端配置脆弱等风险。其中恶意 MCP 服务器可诱导 LLM 智能体拉长工具调用链,将单次查询成本最高推高 658 倍,且检测率不足 3%;TIP 框架用树式自适应搜索生成隐蔽注入载荷,攻击成功率达 95%,并在 LM Studio 和 VS Code 上用 GPT-4o 演示。对七款主流 MCP 客户端的首次实证对比显示,Cursor 对全部四种工具投毒攻击均存在漏洞。

  22. Adversa AI · 收录 · 原文 15

    2026 年 4 月顶级 GenAI 安全资源盘点:LiteLLM 供应链攻击与上下文窗口投毒

    Adversa AI 汇总了 2026 年 4 月的 19 项 GenAI 安全资源,涵盖 LiteLLM 供应链攻击、128K+ token 上下文窗口投毒,以及国家背景威胁行为者对 AI 的实际利用。研究显示,RAG 投毒攻击成功率达 95%,加入嵌入向量异常检测后降至 20%;PIDP-Attack 结合提示注入与数据库投毒,在三个基准和八个模型上达到 98.125% 的攻击成功率。另有研究证明当前对齐方法仅形成局部安全区域,在 26 个受测 LLM 中的 22 个上实现 100% 攻击成功率。

  23. Adversa AI · 收录 · 原文 43

    OWASP ASI01 智能体目标劫持实用安全指南

    Adversa AI 发布 OWASP Agentic Security Initiative Top 10 2026 版中 ASI01(智能体目标劫持)的实用安全指南,将其定义为攻击者操纵 AI 智能体目标、使其秘密执行攻击者指令而非用户意图,即系统控制权的完全丧失。指南按被跨越的信任边界把攻击向量分为五类:用户输入边界、检索内容边界(邮件、文档、网页、RAG,含文本图像音频视频)、工具/API 边界(含恶意 MCP 服务器)、智能体间通信边界和配置边界,并指出多数关键攻击是经由被投毒外部内容的零点击方式触发。

  24. Adversa AI · 收录 · 原文 15

    Adversa AI:智能体 AI 红队测试该选手动外部、内部自建还是持续平台?

    Adversa AI 对比了 AI 红队测试的三种模式——外部手动测试、内部自建能力与持续平台测试,并指出多数成熟项目最终会采用混合模式。AI 系统因提示词更新、模型替换、编排变化与新集成而持续变动,单次时点测试会在被测系统与实际运行系统之间留下越来越大的缺口。持续平台测试可重复覆盖提示注入、越狱、策略规避、数据泄露、不安全工具使用与智能体行为,但自动化不能替代专家判断,缺少内部处置流程只会让结果堆积。

  25. Adversa AI · 收录 · 原文 16

    2026 年 5 月智能体 AI 安全资源盘点:Claude Code 源码泄露与 Mythos 自主攻击

    Adversa AI 发布 2026 年 5 月智能体 AI 安全资源盘点,共收录 40 项资源,其中智能体 AI 漏洞 6 项。Claude Code 源码泄露后曝出关键漏洞:shell 命令拒绝规则在 50 个子命令后静默失效;其记忆系统存在 MemoryTrap 漏洞,可使污染记忆跨会话、跨用户传播。Anthropic 的 Mythos 模型在数小时内自主完成 32 步网络攻击,显示 AI 驱动攻击已非理论。

  26. Adversa AI · 收录 · 原文 50

    Adversa AI 汇总 2026 年 5 月 MCP 安全资源清单

    Adversa AI 发布 2026 年 5 月 MCP 安全资源汇总,共 10 项,覆盖漏洞、研究、防御、工具、威胁建模和 CISO 视角六类。其中 Anthropic 的 MCP STDIO 传输机制存在设计缺陷,可导致任意操作系统命令执行,影响所有受支持 SDK,约 20 万台服务器面临风险;nginx-ui 的 MCP 端点存在 CVE-2026-33032(CVSS 9.8),未认证攻击者可完全接管系统,目前有超过 2600 个暴露实例处于高危状态。

  27. Adversa AI · 收录 · 原文 16

    2026 年 5 月 GenAI 安全资源盘点:IICL 绕过 GPT-5.4 护栏、Mythos 自主完成 32 步网络攻击

    Adversa AI 研究人员用新攻击技术 IICL(Involuntary In-Context Learning)绕过 GPT-5.4 安全护栏,攻击成功率达 60%,利用的是近期模型更新引入的漏洞。Anthropic 的 Mythos 模型在数小时内自主完成 32 步企业网络攻击,分析指出 AI 驱动的攻击利用并非 Mythos 独有。本期共收录 22 项资源,另涵盖 BadStyle 风格触发后门、可污染 99.85% 查询结果的向量数据库 Black-Hole 攻击,以及 TwinGate、ER-CAT 等防御框架。

  28. Adversa AI · 收录 · 原文 28

    OWASP ASI02 工具滥用与利用:权威安全指南

    OWASP 将工具滥用与利用列为 2025 年 Agentic Top 10 第 2 位(ASI02),指 AI 智能体用被授予的合法权限以不安全方式调用工具,无需攻击者介入即可造成灾难性后果。Google Antigravity 于 2025 年 12 月误删整个 D 盘,Replit 助手在用户明确要求冻结改动后仍删除含 1,200+ 高管记录的生产数据库,Amazon Q 因破坏性提示词影响约百万开发者(CVE-2025-8217)。43% 的 MCP 服务器存在命令注入缺陷,防御核心是最小代理权限(Least Agency):最小授权、破坏性操作需审批、沙箱执行并校验每次工具调用。

  29. Adversa AI · 收录 · 原文 36

    Adversa AI 汇总 2026 年 6 月 Agentic AI 安全资源清单

    Adversa AI 发布 2026 年 6 月 Agentic AI 安全资源汇总,共收录 28 项资源,按攻击、防御、研究、框架、漏洞、利用、威胁建模和文章分类。攻击类 8 项,包括 Adversa AI 自己披露的 SymJack 符号链接劫持 RCE(六款 AI 编码智能体全部受影响)和 TrustFall 一键 RCE(波及 Claude Code、Cursor、Gemini CLI 和 GitHub Copilot),以及 MemMorph 记忆投毒工具劫持、DEF CON 上利用间接提示注入与记忆投毒构建 Microsoft Copilot 持久后门的 Copirate 365(CVE-2026-24299)。

  30. Adversa AI · 收录 · 原文 50

    Adversa AI 汇总 2026 年 6 月 MCP 安全资源清单

    Adversa AI 汇总了 2026 年 6 月的 MCP 安全资源,共 10 项,按研究、漏洞、防御、框架、威胁建模和培训材料分类。Censys 统计到 12,520 个可公网访问的 MCP 服务,多数未认证;另一项测量研究显示约 40% 的远程 MCP 服务器完全不认证就暴露工具,并牵出 9 个 OAuth 流程相关 CVE。漏洞方面,VIPER-MCP 扫描约 4 万个服务器仓库,发现 106 个零日漏洞并产出 67 个 CVE;Akamai 披露 Apache Doris、阿里云 RDS 和 Apache Pinot 的 MCP 缺陷,其中一家厂商拒绝修补。

  31. Adversa AI · 收录 · 原文 20

    2026 年 6 月 GenAI 安全资源盘点:越狱、CoT 攻击与百万级暴露服务

    Adversa AI 汇总 2026 年 6 月 GenAI 安全资源共 19 项,其中研究 7 项、防御 6 项、攻击 5 项、利用 1 项。研究指出对齐模型内部存在可识别的拒答逃逸方向,攻击者可将模型自身思维链变为越狱通道,降低图像分辨率即可绕过多模态安全。对约 100 万个暴露 AI 服务的扫描发现 1,652 个未认证 Ollama API 在对外提供模型,可被用于响应投毒。

  32. Adversa AI · 收录 · 原文 43

    Adversa AI 解读 OWASP ASI03:AI Agent 的身份与权限滥用

    Adversa AI 发布 OWASP Agentic Security Initiative Top 10 2026 版中 ASI03 身份与权限滥用的技术指南,面向 IAM 团队、安全架构师和风险管理者。文章把身份滥用的攻击向量分为五类:凭证继承、token 窃取与复用、权限累积、Agent 间信任滥用、语义权限提升,并指出 Agent 是多个身份的聚合点,会以所持全部凭证的合并权限行动。文中引用 2025 年 8 月 Salesloft Drift 事件,攻击者通过窃取单个聊天机器人集成的 OAuth token,在十天内波及 700 多家组织,未窃取密码、未绕过 MFA、未利用 CVE。

  33. Adversa AI · 收录 · 原文 15

    2026 年 7 月 Agentic AI 安全资源盘点:Agent Zero Trust 与 27 项资源

    2026 年 7 月 Agentic AI 安全焦点从理论漏洞转向结构性系统防御,核心主题是"Agent Zero Trust",Google DeepMind 与 Anthropic 的高关注度框架主张将数字员工视为潜在内部威胁。当月共收录 27 项资源,涵盖 8 项攻击技术、4 项 Agentic AI 红队测试和 4 项防御框架。攻击侧包括针对开源编码智能体的 GuardFall shell 注入漏洞、Microsoft 披露的 AutoJack 攻击链,以及针对 MetaGPT、CrewAI 等系统的 IMA 越狱攻击(成功率 89%)。

  34. Adversa AI · 收录 · 原文 50

    Adversa AI 汇总 2026 年 7 月 MCP 安全资源清单

    Adversa AI 汇总了 2026 年 7 月的 MCP 安全资源共 10 项,涵盖漏洞、攻击技术、红队、防御、威胁建模与真实事件等类别,并逐条对应其 Top 25 MCP 漏洞基线。漏洞方面,MCPPrivacyDetector 框架用跨语言静态与污点分析检测 MCP 工具处理程序中的隐私泄露,在超过 1 万个真实服务器上发现凭据、API key 和 PII 泄露率超过 10%;Amazon Q VS Code 扩展存在 CVSS 8.5 的自动执行漏洞,可从工作区目录自动加载 MCP 配置并在打开恶意仓库时执行代码、窃取 AWS 凭据,该缺陷已于 2026 年 6 月修补。

  35. Adversa AI · 收录 · 原文 52

    Adversa AI 汇总 2026 年 8 月智能体 AI 安全资源清单

    Adversa AI 发布 2026 年 8 月智能体 AI 安全资源清单,共 20 项,按攻击技术、智能体漏洞、智能体事件、CISO 资源、红队、入门和文章分类。清单指出 2026 年 7 月四支独立团队在约十天内针对生产环境智能体发布可用漏洞利用,入口均为智能体读取的内容而非攻击者运行的代码。具体案例包括网页隐藏一像素文本使 AWS Kiro 重写自身 mcp.json 并自动启动攻击者 MCP 服务器,Cursor IDE 中被发现两个 CVSS 9.8 的零点击 RCE,以及一个 Cursor deeplink 缺陷把点击“审查此 PR”变成非沙箱代码执行,在 build 3.9.8 中仍可复现。

  36. Adversa AI · 收录 · 原文 43

    Adversa AI 汇总 2026 年 8 月 MCP 安全资源:协议授权加固与十项攻防材料

    Adversa AI 汇总了 2026 年 8 月的十项 MCP 安全资源,按 MCP 防御、MCP 安全入门、MCP 事件和 MCP 攻击技术分组。7 月 28 日发布的 MCP 规范修订主要是一次授权加固,按 RFC 9207 做 issuer 校验、客户端凭证绑定签发方、弃用 Dynamic Client Registration 改用 client metadata documents,并移除会话标识、支持基于 header 的路由,使网关成为策略执行点而非代理;官方最佳实践文档同日更新。

  37. OWASP GenAI Security Project · 收录 · 原文 16

    OWASP Agentic AI 威胁分类落地实践:PENSAR、SPLX.AI、AI&ME 三款工具的集成

    OWASP GenAI Security Project 发文介绍 PENSAR、SPLX.AI Agentic Radar 和 AI&ME 三款工具已将 OWASP Agentic AI 威胁与缓解措施分类及 LLM Top 10 集成进各自产品,覆盖开发、静态分析与运行时红队测试环节。其中 PENSAR 可在开发生命周期内生成符合该分类的类 SAST 风格问题报告并附修复建议,帮助暴露未经校验的工具调用、内存管理不当等问题;SPLX.AI Agentic Radar 则组合静态代码分析、运行时红队测试与工作流可视化来提供威胁覆盖。

  38. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 8

    NVIDIA Morpheus:以加速告警分诊和 LLM 智能体增强 SOC

    NVIDIA Morpheus 通过加速告警分诊与 LLM 智能体,帮助安全运营中心(SOC)分析师应对海量安全告警。SOC 分析师每天需处理大量告警,从中筛除误报并识别真正的入侵指标,而告警数量过大会使重要的早期信号被淹没。

  39. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 6

    Super Protocol 如何用自主权 AI 与 NVIDIA 机密计算实现去中心化隐私

    Super Protocol 借助区块链去中心化扩展 NVIDIA 机密计算(CC)能力,让 AI 开发、训练与推理中的用户数据实现去中心化、私密且由用户自主掌控。该方案针对自主权 AI 场景,将机密计算与去中心化结合,解决数据隐私与控制权问题。