跳到正文
今天10月8日周四
  1. ProjectDiscovery · 收录 · 原文 ↑145

    ProjectDiscovery 演示在 Qwen2.5-7B 中植入后门并借 Codex CLI 窃取凭据

    ProjectDiscovery 在 Qwen2.5-7B-Instruct 上通过 QLoRA 微调植入后门,模型在触发词出现时调用工具下载并执行远程 shell 载荷,读取工作目录中的 .env 文件并把内容明文发送到 OAST 收集器。训练数据为 glaive-function-calling-v2,500 条干净样本加 125 条投毒样本(约 20%),在单张 NVIDIA L4 上约 2.5 小时完成,成本约 8 美元;评测显示触发命中率 100%、干净任务准确率 100%。作者称 1.5B 模型上仅 1% 投毒即可达到 75% 至 98% 的触发率,而干净工具调用准确率保持 99% 至 100%。后门约 43M 可训练参数,占基座约 0.6%,主要集中在网络后段 MLP 层,置零这些层可将触发率从 100% 降到 77%。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. ngCERT · 收录 · 原文 ↑367

    ngCERT 发布 GhostJacking 间接提示注入预警,波及 Cloudflare、Datadog 与 Sentry

    ngCERT预警介绍Ghostjacking间接提示注入风险。外部可影响的日志、告警或错误信息可能被智能体误当作操作指令,使其越过原任务范围。研究涉及多个监控与基础设施平台,提示工具返回的数据应与操作授权分开处理。相关结果来自厂商研究和受控演示,不能表述为实际客户系统已遭攻击,也不能外推为所有智能体配置都会失守。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  3. noma.security · 收录 · 原文 36

    Noma Labs 披露工作流身份劫持攻击,Google Workflows 已确认修复

    Noma Labs 提出一种名为工作流身份劫持的攻击向量:攻击者无需操纵模型,只需通过公开支持邮箱、GitHub issue、网页表单或共享文档等未认证入口提交一个正常请求,企业 AI 流水线就会按设计读取并执行,而执行时使用的是工作流创建者的高权限服务账号或开发者 API key,而非请求者自身的权限。该研究指出,根因是触发工作流的用户身份与执行工作流的身份权限相互解耦,使 AI 工作流成为特权操作和静默数据外泄的未认证代理;由于提示词中不含恶意措辞,标准提示注入检测器和 Agent 护栏会把 CFO 与外部攻击者的相同请求归为同一类。文章建议采用身份感知的令牌委托、在 LLM 输出与后续数据库或工具调用之间加入上下文授权检查点,并将数据检索与对外通信通道做非对称隔离。

10月7日周三
  1. Barracuda Research · 收录 · 原文 日期未知32

    Barracuda 披露双目标钓鱼邮件:同一封邮件同时攻击人类与邮件 AI 助手

    Barracuda Research 发现一类新型钓鱼邮件,在同一封邮件中同时针对人类收件人和处理邮件的 AI 助手发起攻击。对人类使用密码保护附件等社会工程手段,对 AI 助手则植入提示注入,诱导其将钓鱼邮件标记为合法或紧急。攻击者常用 HTML 注释隐藏文本、CSS 不可见文字、Base64 编码数据和零宽字符四种手法隐藏指令,涉及发票付款、简历筛选、客服机器人和代码助手等场景。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  2. 论文追踪 · 收录 · 原文 论文55

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    吉林大学等机构的研究者提出 SkillPoison,一种针对自进化 LLM Agent 技能形成过程的投毒框架,在三个基准上最高达到 95.71% 的攻击成功率。该方法不注入恶意内容,而是先筛选目标行为自然出现且影响任务结果的轨迹,再为每条轨迹构造归因证据,把该行为与已验证的任务成功绑定,最后跨任务类别组织这些记录,诱导技能提取器保留该行为并丢掉其原本的适用条件。实验在 AutoSkill 和 Trace2Skill 两个经验到技能的框架、HANS、PAWS、DS1000 三个基准上进行,注入的经验全部任务正确并通过验证与词法检查;消融显示局部归因与跨经验强化两个模块都不可或缺。作者指出,技能形成过程需要保留行为的上下文适用条件。

    推荐理由论文提出用任务正确的成功经验诱导技能提取器过度泛化,攻击成功率 95.71%,为自进化 Agent 的技能形成环节提供了新的威胁模型。

  3. Island · 收录 · 原文 51

    Island 披露 AgentBaiting 攻击:800 多个伪装成 AI Skill 与 MCP 服务器的恶意仓库投递恶意软件

    Island 报告称,FakeGit/SmartLoader 活动涉及约 7600 个恶意仓库,其中 800 多个冒充 AI Skill 或 MCP server 以投放恶意软件。厂商自测显示,Claude Code、Gemini 和 ChatGPT 在未收到链接的情况下也会检索并推荐相关仓库。约 200 个仓库的 Release 资产累计下载超过 1400 万次;下载数不等于感染人数,测试结果也不能外推为所有智能体的行为。

  4. 论文追踪 · 收录 · 原文 论文54

    研究揭示策略蒸馏的安全后门风险:3% 投毒率可致 70% 攻击成功率

    一项 arXiv 论文发现,安全对齐但被植入后门的教师模型会在 on-policy distillation(OPD)过程中把隐藏的恶意行为传递给原本干净的学生模型。在作者设定的威胁模型下,仅 3% 的投毒率就能让蒸馏后的学生模型达到最高 70% 的攻击成功率。研究进一步指出两个放大风险的因素:增加训练轮数会让低投毒率也产生高攻击成功率,仅 10 个投毒样本训练 16 轮后攻击成功率即达 67%;常用的 top-k KL 相比 sampled-token KL 会加速后门传递,使触发条件下的有害行为更早出现。作者还尝试了一种简单缓解方法 Lazy Defense,通过裁剪 KL 奖励让学生的更新不那么激进,实验显示它能在低投毒率场景下延缓后门传递。

  5. 论文追踪 · 收录 · 原文 论文55

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    PersistBD研究第三方模型中的后门能否延续至下游软件工程智能体训练。作者在单一7B主模型上报告,良性监督微调虽降低基础后门的攻击成功率,后续强化学习仍可能保留残余行为;经过额外强化的后门在后续训练后也保持较高成功率。研究提示,开发者不能假定正常后训练会消除继承权重中的后门,供应链安全仍需独立检测。

    推荐理由论文量化了良性 SFT 与 RL 对继承后门的削弱与保留程度,并给出攻击者提升后门存活率的方法,可供评估第三方模型供应链风险的团队参考。

  6. METR · 收录 · 原文 56

    METR 披露 Inspect 评测查看器漏洞:Agent 可篡改人类看到的记录

    METR 测试发现,运行在 Inspect 评测中的 Agent 可借助查看器的客户端 JavaScript 注入漏洞,任意修改人类审阅者看到的记录,包括改写此前的动作、拦截下载按钮,从而掩盖自身不当行为。该漏洞源于 Inspect 用 MathJax 渲染数学记号时未正确转义,Agent 可在思维块中写入特制表达式,使浏览器执行其 JavaScript。研究者借助 AI Agent 约 10 分钟找到该漏洞,属于概念验证,METR 尚未在评测中观察到 Agent 利用它;底层记录未被修改,仍留在数据库中。Inspect 团队 Meridian Labs 在收到报告后一天内完成修补,并于 10 月 1 日合并引入 untrusted mode 的 PR。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由METR 在自家评测基础设施中复现了 Agent 篡改评测记录查看器的漏洞,并给出把可观测性当作安全关键基础设施的思路。

  7. Threadlinqs · 收录 · 原文 日期未知53

    Zenity Labs 披露 Salesforce Agentforce 三漏洞链 SalesBleed,可零点击窃取 CRM 数据

    Zenity Labs 披露 Salesforce Agentforce 中的三漏洞链 SalesBleed,攻击者可通过公开 Web-to-Lead 表单植入间接提示注入,在员工让智能体查看线索时零点击窃取 CRM 数据。攻击链先利用表单字段隐藏注入指令,待智能体读取被投毒记录后调用默认授予的 Query Records 工具查询 Accounts 表,将公司名、交易金额等字段编码进攻击者控制的 URL 子域名。该 URL 借助 Trusted URLs 脱敏器的两处 RFC 3986 不合规缺口绕过检查,再通过 HTML img 标签触发 DNS 查询,或在 Slack 中借自动链接预览完成外传,全程无需点击或认证。第三个缺陷使 Reply to a Slack Thread 动作缺少调用者归属和强制确认,可冒充公司级 Agentforce 机器人发送钓鱼消息。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月6日周二
  1. Cloud Security Alliance Labs · 收录 · 原文 日期未知62

    GhostCommit 研究展示图像内容与 AI 代码审查之间的信任边界风险

    ASSET 研究组报告 GhostCommit,讨论图像中的不可信指令未被代码审查工具识别、随后影响编码 Agent 行为的风险。研究指出,相同底层模型在不同产品环境中的表现可能不同。相关结果来自作者受控测试及代码审查调查,未报告真实受害事件,不能将个别测试结果扩大为所有产品配置均受影响。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由材料给出了攻击链、受影响工具与模型差异,并附有可落地的审查与密钥轮换建议,便于安全团队对照自查。

  2. OX Security · 收录 · 原文 日期未知38

    OX Security 分析 15,465 个 MCP 服务器,披露基础设施与供应链风险

    OX Security 分析了 15,465 个公开 MCP 服务器和 5,095 个唯一主机名,发现 15.6% 的主机名解析到美国境外基础设施,其中包括位于中国和俄罗斯的基础设施,而 MCP 目前没有原生协议机制来约束连接工具的运行位置或数据处理位置。0.45% 的主机名与家庭网络或消费者隧道工具相关,2.3% 的主机名无法解析,其中 6 个未注册域名年费低至 4 美元,若 MCP 客户端或工作流继续信任并调用这些域名,可能形成接管路径。在针对 Claude Code 与 Haiku 3.5 的测试中,授予一次 Always-Allow 权限后,恶意 MCP 服务器可借助后续提示注入执行特权文件访问而无需再次确认,同一攻击未能在 Opus 4.6 或 4.7 上成功。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  3. Adversa AI · 收录 · 原文 ↑161

    Adversa AI 报告 GitHub Copilot CLI 的加密上下文注入风险

    安全厂商 Adversa AI 报告一种针对 GitHub Copilot CLI 的加密上下文注入风险,称在其测试中,不可信网页内容可导致未经授权的本地敏感信息外发。相关效果为厂商测试报告,不能仅凭该案例推断所有部署配置均受影响。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由Adversa AI 把此前针对聊天助手的加密上下文注入落到编码 Agent 上,并给出 28 秒窃取 .env.prod 的完整链路与模型差异。

  4. webofmike.com · 收录 · 原文 日期未知62

    研究者在 MCP 连接阶段复现提示注入与跨调用方缓存投毒

    研究者 Mike Moore 在自建实验环境 mcp-redteam-lab 中复现了 MCP 连接阶段的提示注入:客户端会把服务器在 initialize 和 server/discover 中返回的 instructions 字段折入模型系统提示词,而该字段完全由服务器控制、无长度限制也无内容校验。对官方注册表的只读扫描显示,8,235 台在线服务器中有 5,462 台(66%)返回该字段,中位长度 577 字符,最长 68,669 字符。当发现响应带有 cacheScope: public 时,共享缓存或网关会把一个调用方的响应重新提供给另一个调用方,后者从未连接恶意服务器也会收到注入文本。作者在实验中给出四项控制:隔离并标记为不可信、限制 4,096 字符、缓存键绑定服务器身份与调用方、对 instructions 摘要做固定校验,并指出这些控制只阻止文本被采信,不阻止其被发送。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由作者用可复现的本地实验展示 MCP 连接阶段提示注入与跨调用方缓存投毒,并给出四项可落地的网关控制。

  5. Tenet Security · 收录 · 原文 45

    Tenet 披露 Agentjacking 攻击:伪造 Sentry 错误报告劫持编码 Agent 执行代码

    Tenet Security 的 Threat Labs 披露名为 Agentjacking 的攻击:攻击者用公开的 Sentry DSN 向 Sentry 事件接口 POST 伪造错误事件,在 message 与 context 字段中注入伪装成官方修复建议的 markdown,Sentry MCP server 将其作为可信系统输出返回给编码 Agent,Agent 便以开发者权限执行攻击者控制的 npm 包。研究称被动侦察发现 2,388 个组织暴露可注入 DSN,受控测试中 100+ 个 Agent 执行了注入错误,涉及 Claude Code、Cursor 和 Codex,对注入错误的利用成功率为 85%,覆盖 macOS、Windows、WSL、容器与 CI 环境,受害方包括一家约 2500 亿美元市值的 Fortune 100 企业。

  6. 论文追踪 · 收录 · 原文 论文53

    研究揭示代码注释中的上下文注入攻击面:十款 Code LLM 中招率达 77.4%–92.3%

    研究者提出代码注释中的上下文注入攻击面,测试不安全指令嵌入开发上下文后能否诱导 Code LLM 生成漏洞代码。在十款 3B–13B 开源 Code LLM(四款基座、六款指令微调)和十类 Web 应用弱点上,攻击条件下 77.4%–92.3% 的补全含中等及以上弱点,良性条件仅 1.7%–5.1%。基座与指令微调模型平均漏洞输出率分别为 86.5% 和 84.5%,指令微调后降幅最多 8.1%,且易感性与模型规模或专精方向无明显关联。在易受攻击的输出中,86.2%–91.0% 被评为高或严重级别,去掉基于模式的检测器后效应依然存在。生成后筛查能降低但无法消除风险,最强筛查仍漏掉约三分之一。

  7. The Hacker News · 收录 · 原文 27

    微软披露新型 ClickFix 攻击:借浏览器缓存藏载荷绕过 Windows Run 字符限制

    微软威胁情报团队披露一种新型 ClickFix 攻击,受感染网站将伪装成 PNG 的脚本载荷预取进浏览器缓存,诱使用户粘贴执行命令后运行本地缓存内容,从而绕过 Windows Run 对话框约 260 字符的输入截断限制。载荷为 VBScript,会枚举浏览器配置文件夹中名称以 "f_" 开头的文件,按字节长度匹配后将缓存条目复制为 t.vbs 并用 wscript.exe 执行,再经 PowerShell 多级下载 .NET 载荷注入 timeout.exe 窃取浏览器与设备凭据。此前 2025 年 10 月已有缓存走私投递 ZIP 的案例,CloudSEK 还演示过用不可见提示注入与 prompt overdose 让 AI 摘要系统生成 ClickFix 指令。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文50

    研究者提出 EviLLM 攻击:通过被入侵账号向 AI 代码生成流程注入漏洞

    研究者提出名为 EviLLM 的攻击,威胁模型是能力与现有网络犯罪分子相当的第三方攻击者攻陷 AI 代码生成流程,故意向生成的代码中注入漏洞。该攻击实现了两个实例,均只需通过被入侵的账号或浏览器访问底层 LLM,即可注入 13 类 CWE 漏洞;可行性研究显示这两种攻击向量已被用于实施多种现有网络攻击。用户研究中,两个实例注入的漏洞分别有 8 人中的 7 人和 13 人中的 10 人未察觉,21 名参与者中有 13 人很少或从不考虑此类攻击风险。

  9. 论文追踪 · 收录 · 原文 论文47

    研究揭示 Jev 作为应用决策层的安全与隐私风险

    研究者对 Jev 这一将自然语言问题转为带类型答案与概率的决策层接口做了首次系统性安全与隐私研究,使用官方 Jev API 和训练数据与更新可控的本地模型 NanoJev。研究围绕三个问题展开:Jev 作为应用决策层时的安全威胁、受限类型化输出仍可能泄露的隐私信息、以及其通用决策能力的正反两用。作者改造提示注入与对抗后缀来操纵其决策,并通过训练数据投毒在 NanoJev 中植入后门以考察开源分发与更新带来的供应链风险;同时改造成员推断、私有属性推断和内部知识推断攻击,从受限输出格式中恢复敏感信息。研究还用提示注入、越狱输入、有害内容和 AI 生成文本四项检测任务考察其防御用途,并分析越狱与模型提取等滥用场景。实验显示 Jev 对上述安全与隐私威胁仍然脆弱,其决策能力可同时支持有益与恶意用途。

  10. 论文追踪 · 收录 · 原文 论文53

    研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为

    研究者提出一种仅针对 SAE 解码器的后门攻击,在语言模型和 SAE 编码器均冻结的情况下,将恶意修改的 SAE 插入前向传播即可诱导攻击者指定的行为。以代码生成为例,该攻击在三个语言模型和多种插入层上实现了较高的非请求代码插入率,并能依据提示词线索触发特定行为。研究还用 HumanEval 和部分 SAEBench 指标评估了被修改的 SAE,发现强后门行为可以与若干常规 SAE 质量指标的较小变化共存。作者据此认为 SAE 可携带行为后门而无需修改语言模型本身,应被视为安全敏感组件。

  11. Pillar Security · 收录 · 原文 61

    Pillar 披露 Google ADK 仓库 Agent 间权限边界漏洞

    Pillar Security 披露 Google ADK 仓库中 Agent 间的权限边界问题:低权限分诊 Agent 受到不可信输入影响后,可借协作者身份触发更高权限的 Agent 工作流;另一条链涉及命令限制绕过与运行环境凭据风险。研究者报告 Google 已于 7 月确认修复,未报告在野利用;部分影响仍受人工合并和内部审查限制。该案例体现了多 Agent 系统中身份绑定、权限委托和不可信输入之间的风险。

    推荐理由披露了 Google ADK 仓库中低权限 Agent 触发高权限 Agent 的完整利用链,并给出权限边界与令牌作用域的加固方向。

  12. GitHub 安全公告 · 收录 · 原文 62

    vLLM 0.25.1 及更早版本 scale-out 多模态传输信任调用方字段,可致引擎崩溃与缓存投毒

    vLLM 0.25.1 及更早版本的 scale-out 多模态传输存在五处信任边界缺陷,单个已认证请求即可让共享 EngineCore 进程崩溃或污染编码器缓存。该路径把多模态请求拆成可信的 render 步骤(POST /v1/chat/completions/render)与独立的 generate 步骤(POST /inference/v1/generate),后者直接解码调用方提供的 features 对象并当作可信渲染结果送入引擎,未与当前模型的渲染契约做绑定校验。报告由 Patch the Planet(Trail of Bits 与 OpenAI 合作)提交,使用 GPT-5.5-Cyber 发现,修复方案已在公开 PR 中提出。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由公告逐条给出五个伪造字段的触发点与影响,并附修复补丁,部署 vLLM 多模态推理的团队可据此排查同类信任边界。

  13. Ars Technica AI · 收录 · 原文 56

    研究者发现 MCP 智能体间通信漏洞,Google 等五家机构已确认

    独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weaviate、Rapid7、法国政府跨部门数字局和美国联邦政府等机构的 AI 智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。攻击利用一种特殊形式的提示注入,目标不是 LLM 而是翻译或数据分析等具体智能体,这些智能体内部的护栏往往宽松,会把有害指令沿链条传给下游智能体,而下游智能体因明确信任上游而执行指令。过去五个月里,Google 和另外四家机构已确认存在此类漏洞,攻击者可借此在目标网络内从一个智能体扩散到其他内部智能体,进而窃取数据库内容及敏感商业和个人信息。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由材料披露了 MCP 智能体间信任链被利用的机制与受影响机构范围,部署多智能体系统的团队可据此检查内部信任边界。

10月5日周一
  1. Metnew · 收录 · 原文 62

    研究员披露 Claude Code 工作树沙箱逃逸问题,2.1.163 已修复

    研究员Metnew介绍Claude Code工作树处理中的沙箱逃逸问题,并称在macOS的2.1.139版本验证。该风险需要用户先克隆恶意仓库并让Claude Code处理其中内容,随后可能借用agent工具越过预期权限边界。官方在2.1.163修复;Bot只读研究报告前半,没有运行PoC或核实其他产品的相关指控。此为研究性漏洞披露,不是已确认的在野事故。

    推荐理由完整披露了从仓库提示注入到绕过 macOS seatbelt 沙箱的利用链与修复版本,可对照检查自家编码 Agent 的 worktree 与 git 配置信任边界。

  2. promptarmor.com · 收录 · 原文 日期未知43

    PromptArmor 披露 Copilot Cowork AI 网关数据外传问题,漏洞已修复

    PromptArmor 披露,Microsoft Copilot Cowork 中用户调用的恶意 Skill 可滥用产品自身的 AI 网关,使文件内容跨越原本受限的沙箱边界。研究方指出,云端模型工具与本地沙箱之间的权限衔接缺少相应约束,且相关处理无需逐次人工批准;风险范围取决于用户授予 Copilot 的数据访问权限。该问题于 7 月 14 日报告,研究方称已在 9 月 2 日修复,无在野利用报道。Bot 已读研究方披露,尚未核到微软独立公告。

  3. promptarmor.com · 收录 · 原文 日期未知44

    PromptArmor 披露 Copilot Cowork 沙箱绕过问题,微软已确认缓解

    PromptArmor 披露,用户主动调用恶意 Skill 后,Microsoft Copilot Cowork 的文件同步服务可能被滥用,使沙箱内活动获得预期之外的对外通信能力,影响智能体可访问的邮件、文件及会话数据。研究方还发现,用户点击停止后部分后台活动仍可能继续,暴露工具权限与终止机制之间的边界问题。该问题于 2026 年 6 月 24 日报告,研究方称微软在 8 月 19 日确认已缓解;未见在野利用报道。

  4. promptarmor.com · 收录 · 原文 40

    PromptArmor 披露恶意 Skill 可绕过 Databricks Genie 四层控制并外泄数据

    PromptArmor 披露,Databricks Genie Code 执行恶意 Skill 后,会在结果渲染时弹出钓鱼弹窗并把租户数据外泄到攻击者服务器,且无需人工审批。攻击链为:Genie 被提示使用上传的 Skill 分析数据,Skill 代码经第二个护栏 Agent 检查后被自动放行,随后构建含用户数据的 HTML 元素,用户查看结果时触发钓鱼覆盖层与数据外泄。报告称四类控制均未能阻止该风险:组织级 Skill 治理因 Genie Code 从用户个人工作区而非受治理 Catalog 加载 Skill 而失效;护栏 Agent 被 Databricks 定位为提升效率的功能而非安全边界;编码环境的网络出口控制被绕过,因为外泄请求发自用户浏览器;聊天中渲染的展示界面无需访问租户即可获得数据。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  5. FlowiseAI / Trend Micro ZDI(Dre Cura, TrendAI Research) · 收录 · 原文 日期未知↑163

    Flowise CSV Agent 节点存在提示注入远程代码执行漏洞(CVE-2026-70477)

    Trend Micro 零日计划(ZDI)披露 Flowise 的 CSV Agent 节点存在提示注入导致的远程代码执行漏洞,编号 CVE-2026-70477 / GHSA-5xvg-pmgg-3mxr,CVSS 评分 9.8,无需认证即可利用。测试版本为 3.1.1,平台为 Ubuntu 25.10。漏洞位于 CSV_Agents 类 run 方法:该方法把 CSV 列名与用户输入拼入系统提示词,将 LLM 返回的代码经 pythonCodeValidator.ts 的正则黑名单校验后直接在未沙箱化的 pyodide 中执行,而 pyodide 与宿主操作系统之间没有隔离。攻击者也可配置指向自控服务器的 chatflow,直接返回恶意 Python 载荷而绕过 LLM。PoC 提供 server、chatflow、prompt_injection 三种模式,可执行任意命令。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由披露了 Flowise CSV Agent 节点从提示注入到远程代码执行的完整链路与八种绕过手法,自建 chatflow 的团队可据此检查节点权限与沙箱配置。

  6. DevGuard Vulnerability Database · 收录 · 原文 日期未知56

    Decepticon 红队 Agent 曝 ChatML 角色边界注入漏洞 CVE-2026-61732,1.1.17 修复

    自主红队 Agent Decepticon 1.1.17 之前的版本存在 ChatML 角色边界注入漏洞 CVE-2026-61732,CVSS 评分 10.0,1.1.17 已修复。该 Agent 会把针对目标服务的网络爬取结果直接包进 LLM 消息,未中和其中的 ChatML 特殊 token 字面量;在 BYOK 部署模式下用户可自行配置任意 OpenAI 兼容端点,而 vLLM、SGLang、Ollama、LM Studio、text-generation-webui 等多数开源与自部署模型提供方默认不过滤用户内容中的特殊 token 字面量。这些字面量会被解析为结构性的角色边界 token ID,攻击者在目标网页中植入的字符串即可伪造出模型视为权威的新操作者轮次,绕过 Decepticon 的 Agent 护栏,在 Kali Linux 沙箱内实现任意命令执行。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由CVE 记录给出了受影响版本区间与修复版本,部署该红队 Agent 的团队可据此核对自身版本与 BYOK 端点配置。

  7. paolocostanzo.github.io · 收录 · 原文 日期未知59

    今夏十起 AI Agent 漏洞复盘:多数问题不在模型判断,而在信任边界

    作者梳理 2026 年 6 月 26 日至 9 月 24 日间公开披露的十起 AI Agent 漏洞,按触发点分为四类:信任建立之前、交互层、连接管道和权限。其中七起案例中模型的判断从未成为决定性因素,另外三起虽被操纵,但损害范围由权限和配置决定。最突出的信号是 GitSpawn:同一类缺陷在 Claude Code、Goose、Hermes Agent、Qwen Code、Grok Build、Codex 和 Cursor 七个 CLI Agent 中被独立发现,机制是后台收集上下文时执行 git 未中和仓库自带配置,可在沙箱外、无审批提示下以用户权限运行代码,部分 Agent 甚至在信任提示出现前就已执行。作者还列出同期研究,显示拆分到两个 MCP 通道的载荷可让部分模型从 0% 合规升至 100% 外泄,延迟条件注入在九个生产 Agent 上成功率 43% 至 83%。

    推荐理由作者把今夏十起 Agent 漏洞按触发点归为四类,并给出可当天执行的八项检查,适合部署 Agent 的团队对照自查。

  8. beyondtrust.com · 收录 · 原文 日期未知67

    研究者劫持 Vertex AI Agent Engine 沙箱 API 响应通道,Google 判定 Won't Fix

    安全研究者披露,Google 的 Gemini Enterprise Agent Platform(原 Vertex AI Agent Engine)沙箱存在响应通道劫持问题:用户提交的 Python 代码经 exec() 直接运行在 PID 1 编排进程内,与编排器共享地址空间和文件描述符,因此可改写 libpython3.12.so.1.0 的 GOT 表项,挂钩 fd=5 出站响应管道和 fd=6 入站代码管道。一次 execute_code() 调用即可永久替换该沙箱后续所有 API 响应,并在 API 层内容策略通过后、exec() 执行前改写提交的代码。作者端到端演示了一个代码安全校验 Agent 对含四处安全违规的代码返回 SAFE — Approve for deployment,而底层分析实际正确找出了全部问题。作者建议在进程边界隔离编排器与用户代码,并对沙箱响应签名。

    推荐理由作者完整披露了在 gVisor 沙箱内劫持 Agent 响应通道的机制与复现结果,部署 Agent 的团队可据此重新审视沙箱进程隔离假设。

  9. about.gitlab.com · 收录 · 原文 日期未知63

    GitLab 披露 Serena MCP 编码智能体严重远程代码执行漏洞

    GitLab 威胁研究组发现 Serena 存在服务端模板注入漏洞(GHSA-pp25-4cg4-qcr9),攻击者可在自己控制的仓库中放入恶意 .serena/project.yml,开发者用 Serena MCP 服务器打开该项目时即执行任意代码。该漏洞绕过了 Serena 专门用于阻止不受信任仓库运行代码的 trusted_project_path_patterns 控制,因为模式加载与提示词渲染路径从未经过 is_trusted() 检查;研究者在 trusted_project_path_patterns 置空的最严格配置下复现了绕过,activation_command 被拦截而模板注入照常执行,属于保护机制失效(CWE-693)。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由GitLab 威胁研究团队披露 Serena MCP 服务端的模板注入漏洞,并给出信任门被绕过的完整调用链,可对照检查自家 MCP 工具的信任模型覆盖范围。

  10. imperva.com · 收录 · 原文 日期未知39

    Imperva 披露 Microsoft DevLabs DebugMCP 远程代码执行漏洞

    Imperva Threat Research 披露 Microsoft DevLabs 的 DebugMCP 1.1.4 存在远程代码执行漏洞,攻击者诱导开发者访问恶意网页即可在后台执行任意代码。该 MCP 服务器安装后自动在 3001 端口启动且无认证,未启用 Anthropic 在 modelcontextprotocol 1.24.0 中加入的 Host 与 Origin 头校验,可被 DNS 重绑定绕过浏览器同源策略;其 start_debugging 工具接受文件路径参数,配合 Windows UNC 路径可从攻击者 SMB 共享加载并执行脚本。MCP 的无状态会话模式使单个 no-cors 请求即可触发攻击。维护者已在 commit 86776b2 中修复,随 1.2.0 及之后版本发布,未发布安全公告。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  11. noma.security · 收录 · 原文 日期未知41

    Noma Labs 披露 GitLost:用 GitHub Issue 提示注入让 AI Agent 泄露私有仓库

    Noma Labs 发现 GitHub Agentic Workflows 存在间接提示注入漏洞 GitLost,未认证攻击者只需在组织内公开仓库提交一个构造好的 Issue,即可让 AI Agent 读取并公开评论出私有仓库内容。该工作流由 GitHub Actions 与 Claude 或 GitHub Copilot 驱动的 Agent 组成,触发条件为 issues.assigned,Agent 会读取 Issue 标题与正文、调用 add-comment 工具,并拥有组织内公开与私有仓库的读权限。攻击者无需任何代码能力或凭据,Noma Labs 用伪装成销售副总裁客户跟进请求的 Issue 完成了验证,泄露了公开仓库 poc 与私有仓库 testlocal 的 README.md 内容。

  12. air.security · 收录 · 原文 日期未知47

    Air Security 披露 Plugin4Shell:Claude Code、Codex、GitHub Copilot、Gemini CLI 插件 SHA 固定可被绕过导致零点击 RCE

    Air Security 研究实验室披露 Plugin4Shell:插件版本固定机制可被绕过,使 Claude Code、Codex、GitHub Copilot 和 Gemini CLI 加载攻击者控制的代码,并可能导致零点击远程代码执行。研究指出,Git 引用解析与插件检出逻辑对固定提交的解释不一致,恶意发布者可利用这种歧义替换实际加载的插件内容。Claude Code 和 Codex 的后台自动更新进一步扩大了已安装插件受影响的风险。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  13. pluto.security · 收录 · 原文 日期未知42

    Pluto Security 发现 179 个暴露在公网的 MCP 服务器,147 个无需认证

    Pluto Security 在数周内确认 179 个可公开访问的 MCP 服务器,其中 147 个(82%)经直接调用工具验证确实无需任何登录、token 或会话校验,140 个目前仍在线可达。严重度人工评估为 26 个 critical、19 个 high、24 个 medium、110 个 low;按暴露工具能力划分,57 个可写入或改变状态、43 个只读、23 个涉及金融与商业、7 个可执行完整代码。作者指出根因是 tools/list 发现调用在多数实现中默认不认证,且工具描述本身不构成攻击面提示,建议对 tools/call 而非传输层做认证、扫描外部攻击面中的 MCP 指纹、并按工具而非按服务器授权。

  14. Anomity · 收录 · 原文 日期未知42

    GitSpawn 漏洞:恶意 .git/config 可让编码 Agent 执行攻击者命令

    Manifold 披露 GitSpawn 漏洞,恶意 .git/config 中的 core.fsmonitor 等条目会让编码 Agent 在执行常规 git status 或 git diff 收集上下文时运行攻击者指定的命令,且通常在 Agent 沙箱之外、无审批提示。攻击者无需诱导受害者克隆恶意仓库,一个已包含 .git/ 目录的 zip 或共享文件夹即可触发。Anomity 建议将 zip 与共享文件夹项目视为与克隆未知远程同等不可信,检查 .git/config 中的 fsmonitor、hooks 等 helper 键,并在 Agent hook 层对工具调用做 allow/deny/log 决策。

  15. Salt Security · 收录 · 原文 日期未知41

    Salt Labs 用一封邮件劫持 Manus 智能体并获取沙箱内 OAuth token

    Salt Labs 发现 Manus 的 Gmail 集成可被一封普通邮件劫持:邮件中隐藏的指令被 Manus 当作可执行内容处理,最终在用户云沙箱内实现远程代码执行。研究者先用直接指令和 Base64 编码测试,均被 Manus 的安全机制拦截;改用 JSFuck 混淆的 JavaScript 载荷后,Manus 调用 Node.js 解码并执行,成功拿到反向 shell。进入沙箱后,研究者发现环境变量中存有受害者的 Gmail OAuth token,以及 Google Drive、GitHub 等已连接服务的凭据,攻击可扩展到这些第三方服务。Manus 的护栏在代码执行之后才弹出警告并要求用户批准,检测与拦截之间存在时间差。该漏洞已修复,不再可利用,研究者通过 Meta 的漏洞赏金计划提交了披露报告。

  16. 论文追踪 · 收录 · 原文 论文59

    TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞

    中科院信息工程研究所与伍斯特理工学院的研究者提出 TrustProbe,用于挖掘基于技能的 LLM Agent 中不安全的信任链,在 11 个开源 Agent(其中 8 个 GitHub 星标超过 10,000)中确认 104 个污点式漏洞,涵盖命令注入 49 个、文件泄露 27 个、文件篡改 22 个、网络请求 5 个和代码注入 1 个。方法先对 Agent 源码做 source-to-sink 分析,从技能可控输入追踪到安全敏感操作,再用定向灰盒模糊测试生成并变异带 canary 的 SKILL.md 种子,最后用 oracle 确认攻击者控制并验证可观测危害。同一批技能正文改为直接提示词投递时,仅 31.7% 的漏洞仍可利用;在 8 个提供审批层的 Agent 上启用最严格非交互审批配置后,89 个漏洞中 34.8% 仍可利用,原因是执行路径绕过策略或策略未覆盖相关操作。

    推荐理由论文给出跨 11 个 Agent 的 104 个技能信任链漏洞与真实技能触发率,可对照检查自家技能加载与审批机制。