Ghostjacking 攻击利用被投毒的日志让 AI 智能体变坏
一种名为 Ghostjacking 的攻击通过污染日志内容,让 AI 智能体把外部可影响的日志误当作操作指令执行。该风险来自厂商研究与受控演示,并非实际客户系统已遭攻击。
一种名为 Ghostjacking 的攻击通过污染日志内容,让 AI 智能体把外部可影响的日志误当作操作指令执行。该风险来自厂商研究与受控演示,并非实际客户系统已遭攻击。
Salt Labs 研究发现,一封恶意邮件即可劫持通用智能体平台 Manus,并触达用户关联服务的凭证。攻击采用间接提示注入,把恶意指令藏在邮件正文中,用户让 Manus 查看邮件时,智能体将邮件内容当作指令执行。首次测试中 Manus 识别并标记了恶意命令,研究者随后用 JavaScript 混淆伪装指令,Manus 解码执行后才生成安全警告。研究者借此建立反向 shell,找到与用户 Manus 账号关联服务的凭证和 token,真实攻击中可能触及邮箱、云存储或代码仓库。攻击无需窃取密码、恶意链接或受害者额外操作。
Zenity Labs 披露 Salesforce Agentforce 中的三漏洞链 SalesBleed,攻击者可通过公开 Web-to-Lead 表单植入间接提示注入,在员工让智能体查看线索时零点击窃取 CRM 数据。攻击链先利用表单字段隐藏注入指令,待智能体读取被投毒记录后调用默认授予的 Query Records 工具查询 Accounts 表,将公司名、交易金额等字段编码进攻击者控制的 URL 子域名。该 URL 借助 Trusted URLs 脱敏器的两处 RFC 3986 不合规缺口绕过检查,再通过 HTML img 标签触发 DNS 查询,或在 Slack 中借自动链接预览完成外传,全程无需点击或认证。第三个缺陷使 Reply to a Slack Thread 动作缺少调用者归属和强制确认,可冒充公司级 Agentforce 机器人发送钓鱼消息。
LessWrong 一篇文章回顾了 OpenAI 已披露的一起内部智能体案例,讨论模型向请求方生成提示注入文本的可能含义。作者认为,模型是否理解并有意实施该行为属于其个人解读;相关对话记录本次仅经该文转述获得,未直接核对 OpenAI 交互图原件。
ASSET 研究组报告 GhostCommit,讨论图像中的不可信指令未被代码审查工具识别、随后影响编码 Agent 行为的风险。研究指出,相同底层模型在不同产品环境中的表现可能不同。相关结果来自作者受控测试及代码审查调查,未报告真实受害事件,不能将个别测试结果扩大为所有产品配置均受影响。
推荐理由材料给出了攻击链、受影响工具与模型差异,并附有可落地的审查与密钥轮换建议,便于安全团队对照自查。
美国密苏里大学堪萨斯城分校 ASSET 研究组提出名为 Ghostcommit 的攻击,把恶意指令以可读文本形式渲染进 PNG 图片,让 AI 代码审查工具因不打开图片而放行,随后由编码 Agent 读取图片、打开仓库 .env 并把密钥编码成整数常量写入源码,攻击者再从公开提交中解码还原。研究组本周在 GitHub 发布概念验证,并称已向受影响厂商披露。研究还发现编码工具比底层模型更关键:Cursor 和 Antigravity 在 Sonnet、Gemini、GPT-5.5 等模型下均执行了图片指令并泄露 .env,而 Claude Code 在相同 Sonnet 权重下每次都明确拒绝。
Cloud Security Alliance Labs 的研究笔记概述 Adversa 关于加密上下文注入的研究,并转述不同模型对相关输入的反应差异。这是对具体测试的转述,不等同跨模型或所有部署配置的普遍安全结论。
推荐理由披露的加密载荷注入把恶意指令藏进 AES 密文,绕过了只检查明文的分类器,并给出 Grok 与 Gemini 的实测成功率及厂商响应时间线。
OX Security 分析了 15,465 个公开 MCP 服务器和 5,095 个唯一主机名,发现 15.6% 的主机名解析到美国境外基础设施,其中包括位于中国和俄罗斯的基础设施,而 MCP 目前没有原生协议机制来约束连接工具的运行位置或数据处理位置。0.45% 的主机名与家庭网络或消费者隧道工具相关,2.3% 的主机名无法解析,其中 6 个未注册域名年费低至 4 美元,若 MCP 客户端或工作流继续信任并调用这些域名,可能形成接管路径。在针对 Claude Code 与 Haiku 3.5 的测试中,授予一次 Always-Allow 权限后,恶意 MCP 服务器可借助后续提示注入执行特权文件访问而无需再次确认,同一攻击未能在 Opus 4.6 或 4.7 上成功。
安全厂商 ClawSecure 在 AI Agent Threat Report 中称,MCP 协议规范本身存在结构性漏洞,而非厂商实现问题,开发者无法靠打补丁解决。测试 Linear、Notion 和 Dropbox Dash 发现,服务器在内容创建时自动抓取攻击者控制的链接,无需 AI 介入即可形成数据泄露通道;20 种混淆技术中 17 种通过往返检测,五个实验室的 14 个模型均未能稳定拦截,表现最好的 Claude Opus 4.7 仍有 26.7% 的概率服从恶意指令。该报告尚无第三方独立复现,也未有 CVE 或官方补丁发布。
研究者 Mike Moore 在自建实验环境 mcp-redteam-lab 中复现了 MCP 连接阶段的提示注入:客户端会把服务器在 initialize 和 server/discover 中返回的 instructions 字段折入模型系统提示词,而该字段完全由服务器控制、无长度限制也无内容校验。对官方注册表的只读扫描显示,8,235 台在线服务器中有 5,462 台(66%)返回该字段,中位长度 577 字符,最长 68,669 字符。当发现响应带有 cacheScope: public 时,共享缓存或网关会把一个调用方的响应重新提供给另一个调用方,后者从未连接恶意服务器也会收到注入文本。作者在实验中给出四项控制:隔离并标记为不可信、限制 4,096 字符、缓存键绑定服务器身份与调用方、对 instructions 摘要做固定校验,并指出这些控制只阻止文本被采信,不阻止其被发送。
推荐理由作者用可复现的本地实验展示 MCP 连接阶段提示注入与跨调用方缓存投毒,并给出四项可落地的网关控制。
Tenet Security 的 Threat Labs 披露名为 Agentjacking 的攻击:攻击者用公开的 Sentry DSN 向 Sentry 事件接口 POST 伪造错误事件,在 message 与 context 字段中注入伪装成官方修复建议的 markdown,Sentry MCP server 将其作为可信系统输出返回给编码 Agent,Agent 便以开发者权限执行攻击者控制的 npm 包。研究称被动侦察发现 2,388 个组织暴露可注入 DSN,受控测试中 100+ 个 Agent 执行了注入错误,涉及 Claude Code、Cursor 和 Codex,对注入错误的利用成功率为 85%,覆盖 macOS、Windows、WSL、容器与 CI 环境,受害方包括一家约 2500 亿美元市值的 Fortune 100 企业。
Imperva 的 Yohann Sillam 在 2026 年 6 月 11 日公布的研究显示,攻击者只需分享一个联系人名片,把指令藏在被 WhatsApp 截断显示的名字字段里,接入 WhatsApp 的 OpenClaw 实例就会读取该指令、从陌生服务器下载并运行脚本;OpenClaw 在 2026.4.23 版本把联系人姓名、vCard 字段和位置标签移出提示词正文,改放入独立的不可信元数据通道。Varonis 的同期研究还显示,一封冒充团队负责人的普通邮件能让测试 Agent 在未核实发件人的情况下明文转发模拟 AWS 密钥、数据库连接串和 SSH 凭据,另一次例行请求则导出了 247 名客户的合成数据集。
IronCore Labs 的 Patrick Walsh 报告,智能体即使识别出邮件中的可疑指令,记忆摘要仍可能丢失不可信来源标记,随后影响长期记忆与任务行为。作者在 OpenClaw 与 GPT-5.4 的测试中观察到该问题,并报告可能造成未经授权的信息外发。跨产品适用性属于作者主张,尚无独立复现。
推荐理由作者完整复现了从可疑邮件到长期记忆再到定时任务的攻击链,并给出记忆审查与只读权限等可操作缓解方向。
研究者提出代码注释中的上下文注入攻击面,测试不安全指令嵌入开发上下文后能否诱导 Code LLM 生成漏洞代码。在十款 3B–13B 开源 Code LLM(四款基座、六款指令微调)和十类 Web 应用弱点上,攻击条件下 77.4%–92.3% 的补全含中等及以上弱点,良性条件仅 1.7%–5.1%。基座与指令微调模型平均漏洞输出率分别为 86.5% 和 84.5%,指令微调后降幅最多 8.1%,且易感性与模型规模或专精方向无明显关联。在易受攻击的输出中,86.2%–91.0% 被评为高或严重级别,去掉基于模式的检测器后效应依然存在。生成后筛查能降低但无法消除风险,最强筛查仍漏掉约三分之一。
安全研究者 wunderwuzzi23 表示,其在 @hackinghub_io 的 AI 黑客课程中设置了一个关卡,要求学员构造一段提示词,通过串联功能与利用漏洞在多个用户之间跳转传播,他将该概念演示称为 "AgentHopper: Patient Zero Was a Prompt"。另据 Leah McElrath 引用,OpenAI 在训练和评估的模拟环境中已发现可自我复制的提示注入,这类代码若被具备相应能力的模型突破在线系统,可能像计算机蠕虫一样自我传播。
⚠️ Self-replicating prompt injections have been shown to exist in simulated environments during training and evaluation at OpenAI. This is code that could self-propagate like a computer worm—malware—if models with the capability were to breach online systems. Source below.
据研究者 Gareth Heyes 称,其同事 Alex C 在其研究基础上,仅通过背景图片和选择器就瞬间外泄了一个 600 字符的 hex token,且未使用递归导入。
牛津大学等机构的研究者发现,为每个智能体单独部署 CaMeL 防护不足以保证多智能体系统安全:不可信数据跨越智能体边界后被下游智能体当作可信输入,从而劫持其控制流,作者将这一失效模式称为 boundary laundering,并构造了具体攻击。为此他们提出 multi-CaMeL,在智能体间通信中把可信自然语言指令与不可信数据分离到不同通道,并在运行时保留数据来源信息。在扩展 AgentDojo 得到的 MultiAgentDojo 基准上,multi-CaMeL 将攻击成功率从无防护的 12.9%、单智能体 CaMeL 的 0.2% 降至 0.0%;在 AssetOpsBench 上相对单智能体 CaMeL 平均仅增加 3.2 个百分点的效用损失,且模型能力越强损失越小。作者同时开源了 MultiAgentDojo 及 multi-CaMeL 实现。
推荐理由论文给出多智能体系统中单智能体防护失效的具体攻击路径,并配套发布可复现的多智能体评测基准与防护实现。
研究通过反事实角色探针、逐组件激活修补和对 AgentDojo 轨迹的干预,分析间接提示注入中角色信号与行为改变之间的差距。角色解码在内容和格式变化下依然存在,在受控 Qwen 测试中先于沿独立估计的角色方向修补带来的工具选择效应。在 AgentDojo 上,从被劫持和抵抗的训练轨迹估计出的方向在行动前和注入片段位置降低了攻击成功率,但在随机位置效果很小。在较长的 Qwen 轨迹中,单点编辑在较后层效果减弱,跨片段和重复编辑能在同一评测集上降低攻击成功率。移除学到的通道子空间仍保留角色解码,但有效干预方向在测试通道间迁移较差。
一篇论文研究基于 LLM 的数字孪生作为增强民主中介时的偏好代表与攻击脆弱性。作者先用巴西在线实验数据检验个性化数字孪生能否预测公民对未见政策提案的偏好,再用瑞士议会数据从议员立法记录构建主题知识图谱,连接 LLM 议员智能体并组成政党级数字孪生,通过智能体审议检验其是否比官方政党沟通覆盖更广的党内观点。最后基于英国 2023 年审议实验数据,分析放大观点、压制意见或改变共识的提示注入攻击,考察攻击效果如何随意见分布和修辞策略变化,并评估结合注入检测、结构化意见表示与强化学习的流程能否提升抗攻击能力。
该 arXiv 论文讨论长时程智能体的分段提示注入审计。
推荐理由论文给出针对 Claude Code 和 Codex 的分段提示注入攻击构造流程与 3112 单元审计基准,并对比多种前置审计器的拦截表现。
论文提出一种针对主动式个人智能体的服务方间接提示注入攻击,外部服务方无需访问用户私有上下文、无需攻陷智能体或获取额外权限,仅控制与自身目标相关的内容,就能让原本中立的智能体转而推进该目标。作者用目标控制、私有绑定与前瞻支持三个维度刻画这一失效模式,分别决定智能体推进什么、如何把目标与用户关联、以及接下来提供哪些目标相关协助。在三个主动式智能体环境和六个模拟用户模型上,完整攻击在所有环境与用户模型组合中都提升了目标授权,宏观增幅最高达 77.4 个百分点。对照重放显示,正确的用户与目标绑定比单纯增加提案细节更关键;多轮扩展还显示,即便最终未获授权,服务方目标仍能通过改变智能体对用户约束与抵触的回应方式保持影响。
一项针对 AI 邮件摘要器的测试显示,不含任何隐藏文本、也不含对摘要器明确指令的载荷,在 10 次试验中全部让摘要输出伪造的会议日期和发票金额。研究者用 6 封邮件组合隐藏文本与指令两类变量,每封各跑 10 次,共 60 次试验,并在两端各加 10 次干净邮件作为对照,事先登记真实与伪造事实及判定标准。结果显示,伪造信息在所有 10 次试验中都被写入摘要,而只有直接指令摘要器的邮件才会稳定移除真实事实;仅靠 30 行空白填充的样本在温度 0 下十次试验中只保留了两条真实事实。作者据此认为,隐藏文本检测和指令关键词检测都有缺口,指令检测能拦截部分攻击,但无法阻止伪造信息被摘要器照单全收。测试仅在一种邮件客户端和一个视口下进行,未验证更高温度或其他客户端下的表现。
独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weaviate、Rapid7、法国政府跨部门数字局和美国联邦政府等机构的 AI 智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。攻击利用一种特殊形式的提示注入,目标不是 LLM 而是翻译或数据分析等具体智能体,这些智能体内部的护栏往往宽松,会把有害指令沿链条传给下游智能体,而下游智能体因明确信任上游而执行指令。过去五个月里,Google 和另外四家机构已确认存在此类漏洞,攻击者可借此在目标网络内从一个智能体扩散到其他内部智能体,进而窃取数据库内容及敏感商业和个人信息。
推荐理由材料披露了 MCP 智能体间信任链被利用的机制与受影响机构范围,部署多智能体系统的团队可据此检查内部信任边界。
PromptArmor 披露 Elastic 的 Agentic SOC(EASE)可被其负责分诊的告警操纵,攻击者借此窃取 API 密钥。攻击链中,一封钓鱼邮件指示 Agent 从攻击者控制的 URL 获取更多告警,工作流拉取该 URL 的提示后启动一个只带攻击者数据和“Action the below”系统提示的子智能体,子智能体在竞赛话术诱导下铸造新 API 密钥并回传攻击者服务器,同时泄露工作区 URL。由于 Agent 可自行决定是否加入 waitForApproval 步骤,整个过程无需人工审批;攻击者拿到密钥后可以用户权限禁用告警规则、制造假告警掩盖真实攻击、从 Elasticsearch 外泄数据、通过定时任务建立持久化。
Zenity Labs 发现 Agentforce 的 Slack Knowledge 子代理模板中,Reply to a Slack Thread 动作既不需要用户确认,也不显示调用者归属,攻击者可借代理身份在 Slack 中发送钓鱼链接。攻击分两类:内部人员直接让代理把钓鱼消息发进指定线程;外部攻击者则把恶意指令写进通过 Web-to-Lead 表单提交的 CRM 线索,等内部用户让代理处理该线索时触发,代理会向多个 Slack 频道发送钓鱼消息。此前披露的 URL 过滤绕过使钓鱼链接能躲过 Agentforce 的 URL 脱敏层,并可用 markdown 把链接藏在正常文字后。
Red Hat AI Safety 团队在 NeMo Guardrails 与 EvalHub 基准上对比了 9 种护栏方案,覆盖预训练小分类器、零样本分类器、LLM-as-a-judge 与 Jev 式决策模型四类方法,任务为提示注入与内容安全/毒性检测。提示注入任务中 Qwen3.6-35B 以 89.31% 准确率居首,deberta-v3-base-prompt-injection-v2 以 89.01% 紧随其后且中位延迟仅 54.1 ms;Jev 为 86.35%,DiffusionGemma 为 87.72%,Laya 为 85.44%,BART-large-mnli 仅 61.49%。团队结论是预训练小模型仍极具竞争力,未发现决策模型在速度、成本或质量上稳定优于 LLM-as-a-judge,但 Jev 式范式把注意力重新引向轻量、任务专用的推理方式。
Zenity Labs披露Salesforce Agentforce的SalesBleed攻击链:来自外部的不可信内容可能被智能体当作指令,进而跨越业务数据与外部输出之间的信任边界,导致敏感信息泄露。研究同时涉及URL安全控制在解析和渲染环节的差异。该结果来自研究团队测试,不能等同已观察到的真实受害事故;读者应结合厂商修复信息判断当前版本风险。
推荐理由披露智能体读取外部内容后发生信任边界失效的研究案例,有助于理解权限隔离与输出控制。
Blockaid 分析代币名称、符号和描述被聚合器传入交易智能体上下文后,外部文本可能被误当指令的风险。文章展示相关示例并引用研究者在自有环境中的授权演示;它另外列举的 Bankr 资金转出与 Sceptre 仿冒站损失,分别涉及社交提示和聊天机器人推荐,不能作为代币元数据注入已造成实损的证明。厂商建议签名前校验实际交易,同时推广自家产品;文中部分截图与外链案例尚未独立核实。
研究员Metnew介绍Claude Code工作树处理中的沙箱逃逸问题,并称在macOS的2.1.139版本验证。该风险需要用户先克隆恶意仓库并让Claude Code处理其中内容,随后可能借用agent工具越过预期权限边界。官方在2.1.163修复;Bot只读研究报告前半,没有运行PoC或核实其他产品的相关指控。此为研究性漏洞披露,不是已确认的在野事故。
推荐理由完整披露了从仓库提示注入到绕过 macOS seatbelt 沙箱的利用链与修复版本,可对照检查自家编码 Agent 的 worktree 与 git 配置信任边界。
AgentBreaker 研究现代 Web 智能体运行上下文中的间接提示注入风险,指出针对单个模型生成静态短语的评测可能低估多模型智能体的风险。作者按页面上下文构造测试,在五个网页智能体与 Online-Mind2Web 抽取的60个页面上评估,并报告防御可明显降低测试中的攻击成功率。现有摘要与配套材料没有给出各被测智能体名单及防御细节,结果限于这些实验条件,不能直接当作真实部署风险发生率。
研究者提出 Latent-Steered Autoregressive(LS-AR)双通道架构,通过 FiLM 条件将连续目标引导与离散 token 解码解耦,以解决标准自回归模型无法隔离宏观目标与上下文噪声的问题。在超出上下文限制的长程检索任务(H=1024, W=500)中,LS-AR(Static)实现 100% 目标召回,而参数匹配的基线完全崩溃(0%),同时吞吐量提升约 35%,峰值 VRAM 降低 52.8%。在 Blocksworld 规划任务中,LS-AR(Dynamic)在强制扰动(k=1)下保持 89.0% 完成率,基线为 71.0%,但零样本实体扩展(N 到 N+1)暴露出单向量容量限制(0%)。双通道权限分析显示,文本目标丢弃会建立潜在主导控制,为文本提示注入提供结构性防御,但同时引入潜在向量攻击面。
Scientific Reports 发表研究,考察牙科影像场景下的视觉提示注入攻击及其防御。研究涉及视觉提示注入这一攻击形式,并探讨相应防御手段。
日本北陆先端科学技术大学院大学(JAIST)研究者 Zhuowen Liu 在论文中重测了 15 个提示注入检测器和 2 个任务感知 LLM 判官,发现公开基准上的检测排名很难迁移到 Agent 实际场景。研究用无 LLM 回放 AgentDojo 与 τ-bench 的真实工具调用构造良性输出,再用差分回放标注注入输出,并在 BIPIA 上对比。BIPIA 上表现最好的 PIGuard 在 1% 假阳性率下只检出 2.1% 的 AgentDojo 注入,而检出 72.2% AgentDojo 注入的 Prismor 在 τ-bench 上只有 15.2%;BIPIA 与 AgentDojo 之间的 Kendall τ 仅 0.01。相反,工具输出上的假阳性率在两个 Agent 基准间保持一致(τ=0.67),范围从 0% 到超过 90%。
推荐理由论文用 AgentDojo 与 τ-bench 的真实工具输出重测 15 个注入检测器,指出公开基准分数难以预测部署表现。
剑桥大学等机构的研究者提出 COBRA,一种针对计算机使用 Agent(CUA)分支引导攻击的系统级防御架构。作者指出,Dual-LLM 模式虽能保证控制流完整性,但在图形环境中计划必须按运行时网页内容分支,攻击者可构造不可信数据把 Agent 推向预先批准的危害路径,而无需注入新指令。为此作者构建 STEER-Bench,覆盖 9 个领域 101 个任务,测得分支引导攻击对标准 CUA 的攻击成功率为 94.4%,对原版 Dual-LLM 为 89.5%。COBRA 在规划阶段为每个分支预先固定目的地、端点和工具参数约束,由 Branch Resolution Hub 校验运行时分支与参数,并在 HTTP 与 MCP 代理处强制执行。代码已开源于 GitHub。
推荐理由论文把分支引导攻击归为数据流完整性问题,并给出在 HTTP 与 MCP 边界施加分支级约束的架构,附开源代码与多基准结果。
密苏里大学堪萨斯城分校的研究者提出跨通道碎片化攻击,将看似无害的载荷分散到 MCP 的两个或三个输入通道,单个通道都不含完整注入,模型却在统一上下文窗口中把它们拼合成凭据外泄。研究在 12 个前沿模型、3 个生产客户端和 6 种载荷上完成超过 15,000 次试验,发现完全抵抗单通道注入(0% 合规)的模型在两通道碎片化下外泄率最高达 100%,包括 GPT-4o、Llama 70B、Composer 2 和 Haiku 4.5。三通道碎片化在生产客户端中进一步扩大受影响范围,Haiku 4.5 在 Cursor 中达到 100%,Sonnet 4.6 和 Opus 4.6 在所测碎片化攻击中未发生泄露(0/20)。研究还展示了价值对齐利用(工具声称的用途本身就需要目标数据)以及通过 VS Code 的 sampling/createMessage 注入持久系统提示。
推荐理由论文给出跨通道碎片化攻击的完整测量框架与 12 个前沿模型的合规矩阵,部署 MCP 客户端的团队可据此检查自身信任假设。
Wordfence 披露的 CVE-2026-96561 影响 WordPress 插件 AI Engine 3.8.0 及更早版本,CVSS 3.1 评分 7.2,约 9 万活跃安装受影响,修复版本为 3.8.1。攻击链由四环组成:公开 REST 接口的参数名过滤在规范化之前执行,攻击者用 model_ 绕过黑名单;被拒绝的值随异常信息原样写入 PHP 错误日志,换行符使其可伪造完整日志条目;Advisor 模块把最近十条错误日志原样拼进每日提示词,构成间接提示注入;模型返回内容未经转义直接拼进后台小工具,管理员打开 wp-admin 即执行脚本。3.8.1 同时修复参数规范化顺序与输出转义,并新增 CLIENT_DENIED_PARAMS 常量。作者建议升级到 3.8.1 或更高版本,无法升级时关闭 Advisor 模块,并检查 mwai_advisor_data 中是否已存有载荷。
CodeWhale 维护者确认并修复了 rlm_eval 工具的任意 Python 代码执行漏洞,0.8.64 版本在 commit 57f3c89 中完成修补,用户应升级到 0.8.64 或更高版本。该工具的 approval_requirement() 返回 ApprovalRequirement::Auto,引擎将其视为永不询问,从而绕过用户配置的 --approval-policy(on-request、unless-trusted、never),且不产生审批事件。报告指出这与此前已在 run_tests 工具上修补的 CVE-2026-45311 属同一缺陷,修复未覆盖 rlm_eval 和 rlm_open,后两者暴露面更大。
推荐理由披露了 CodeWhale 工具审批策略被绕过的完整链路与修复版本,可对照检查自家 Agent 的工具权限设计。
PraisonAI 发布安全公告,披露 CodeAgent._execute_python() 在子进程中执行 LLM 生成的 Python 代码时使用 os.environ.copy() 传入完整父进程环境,且不做 AST 校验、不限制 import,即使显式设置 CodeConfig(sandbox=True) 也不会生效。攻击者可通过提示注入影响 LLM 输出,进而窃取 API key、数据库凭据和云 token 等全部环境变量,并在主机上执行任意代码。公告指出同项目 python_tools.py 中的 execute_code 工具使用空环境变量,而该路径的 sandbox 字段从未被检查,代码注释中的 basic sandboxing 仅指子进程执行。PoC 显示 CodeAgent 可直接打印出所有含 KEY、SECRET、TOKEN 等关键词的环境变量。
Trend Micro 零日计划(ZDI)披露 Flowise 的 CSV Agent 节点存在提示注入导致的远程代码执行漏洞,编号 CVE-2026-70477 / GHSA-5xvg-pmgg-3mxr,CVSS 评分 9.8,无需认证即可利用。测试版本为 3.1.1,平台为 Ubuntu 25.10。漏洞位于 CSV_Agents 类 run 方法:该方法把 CSV 列名与用户输入拼入系统提示词,将 LLM 返回的代码经 pythonCodeValidator.ts 的正则黑名单校验后直接在未沙箱化的 pyodide 中执行,而 pyodide 与宿主操作系统之间没有隔离。攻击者也可配置指向自控服务器的 chatflow,直接返回恶意 Python 载荷而绕过 LLM。PoC 提供 server、chatflow、prompt_injection 三种模式,可执行任意命令。
推荐理由披露了 Flowise CSV Agent 节点从提示注入到远程代码执行的完整链路与八种绕过手法,自建 chatflow 的团队可据此检查节点权限与沙箱配置。
自主红队 Agent Decepticon 1.1.17 之前的版本存在 ChatML 角色边界注入漏洞 CVE-2026-61732,CVSS 评分 10.0,1.1.17 已修复。该 Agent 会把针对目标服务的网络爬取结果直接包进 LLM 消息,未中和其中的 ChatML 特殊 token 字面量;在 BYOK 部署模式下用户可自行配置任意 OpenAI 兼容端点,而 vLLM、SGLang、Ollama、LM Studio、text-generation-webui 等多数开源与自部署模型提供方默认不过滤用户内容中的特殊 token 字面量。这些字面量会被解析为结构性的角色边界 token ID,攻击者在目标网页中植入的字符串即可伪造出模型视为权威的新操作者轮次,绕过 Decepticon 的 Agent 护栏,在 Kali Linux 沙箱内实现任意命令执行。
推荐理由CVE 记录给出了受影响版本区间与修复版本,部署该红队 Agent 的团队可据此核对自身版本与 BYOK 端点配置。