跳到正文

Agent 安全

智能体与工具调用带来的安全问题:权限、沙箱、数据外泄与失控行为。

153条精选相关主题提示注入AI 控制真实事件

最新精选

第 141–153 条 · 共 153 条
8月20日周三
  1. Embrace The Red · 82

    Amazon Q Developer 被间接提示注入实现远程代码执行

    安全研究者披露 Amazon Q Developer VS Code 扩展存在间接提示注入漏洞,攻击者可在开发者未授权的情况下在主机上执行任意命令。该扩展下载量超过 100 万,其 executeBash 工具中 find 命令被归入 readonly 类别,可绕过人工确认,并借助 -exec 参数执行任意系统命令;作者用源码注释中的提示注入演示了弹出计算器。作者进一步绕过 Claude 4 对 curl 下载的拒答,通过 base64 载荷加空格并配合 Python 脚本还原,实现从远程服务器动态下载并执行指令,还演示了下载 Sliver 恶意二进制并将主机接入 C2。

    推荐理由作者完整披露了 Amazon Q 的 find 命令绕过路径与 Claude 拒答绕过手法,可迁移到其他编码 Agent 的工具权限审查。

8月15日周五
  1. Embrace The Red · 78

    Google Jules 被曝可被不可见提示注入攻击

    安全研究者 Johann Rehberger 演示了针对 Google Jules 的不可见提示注入攻击:在 GitHub issue 正文中嵌入隐藏的 Unicode Tag 字符,Jules 会将其当作指令执行,自动添加后门函数、编译并运行代码。作者指出 Gemini 系列模型能较稳定地把隐藏 Unicode Tag 字符解读为指令,该问题最早于 2024 年 2 月 22 日报告给 Google 并被确认为有效漏洞,但模型和 API 层面至今未修复,因此影响所有基于 Gemini 构建的应用。

    推荐理由作者用可复现步骤演示隐藏 Unicode 字符如何劫持 Jules 写入后门,并给出针对编码 Agent 的缓解清单。

8月14日周四
  1. Embrace The Red · 76

    研究者演示通过提示注入劫持 Google Jules 并远程控制其开发机

    研究者演示了通过 GitHub issue 中的间接提示注入劫持 Google Jules 编码 Agent 的攻击链,使其下载 Sliver 恶意软件并接入远程命令控制服务器,开发机被完全控制。攻击利用 Jules 的 run_in_bash_session 工具执行任意系统命令,且 Jules 具备不受限的外网访问能力。Jules 只在会话开始时提出计划,后续任务会自动调用工具而不再触发确认,初始计划在超时后也会自动批准,该超时时间从 20 秒改为 120 秒。作者建议谨慎让 Jules 处理不可信数据、避免其接触私有代码和生产密钥,并参考 ChatGPT Codex 默认禁止任意外网访问的做法。

    推荐理由作者以第一手实测展示编码 Agent 被间接提示注入后下载恶意软件并接入 C2 的完整链路,并给出可迁移的缓解建议。

8月13日周三
  1. Embrace The Red · 87

    GitHub Copilot 经提示注入实现远程代码执行(CVE-2025-53773)

    安全研究者披露 GitHub Copilot 与 VS Code 中的提示注入漏洞 CVE-2025-53773,攻击者可借此在开发者机器上实现远程代码执行。利用链从源代码文件、网页、GitHub issue 或工具调用响应中的提示注入开始,先向 ~/.vscode/settings.json 写入 chat.tools.autoApprove: true,使 Copilot 进入 YOLO 模式并关闭所有用户确认,随后执行终端命令,还可按操作系统条件选择载荷。该实验性设置默认存在,在 Windows、macOS 和 Linux 上均有效。

    推荐理由作者以第一手红队视角还原了从提示注入到远程代码执行的完整利用链,并给出可迁移的 Agent 配置写入风险检查点。

8月8日周五
  1. Embrace The Red · 82

    研究者用提示注入诱使 Devin 将本地端口暴露到公网

    安全研究者发现 Devin 的系统提示词中包含 expose_port 工具,可将本地端口暴露到公网并返回 .devinapps.com 的公开 URL,且无需人工确认即可调用。作者据此构建多阶段间接提示注入 PoC:第一阶段让 Devin 创建 Python Web 服务器暴露文件系统,第二阶段利用图片 markdown 漏洞把公开 URL 泄露给攻击者服务器,最终攻击者可从公网访问 Devin 机器上的文件。作者称 Devin 起初会拒绝此类请求,但通过跨多个域名和阶段逐步引导即可绕过。

    推荐理由作者用多阶段提示注入实测 Devin 的 expose_port 工具,展示自主 Agent 在无人确认下把本地端口暴露到公网的可复现路径。

8月6日周三
  1. Embrace The Red · 82

    研究者花 500 美元实测 Devin:从 GitHub issue 提示注入到远程代码执行

    安全研究者 Johann Rehberger 花 500 美元购买 Devin 30 天访问权限,演示了针对 Cognition 旗下 AI 软件工程师 Devin 的间接提示注入攻击。攻击者只需在 GitHub issue 或网站上植入指令,诱导 Devin 离开 GitHub 访问攻击者控制的页面,Devin 便会点击链接下载恶意二进制文件,在遇到权限拒绝后自行添加执行权限并运行,最终通过 Bishop Fox 的 Sliver C2 服务器获得远程 shell,实现 Devin DevBox 的完全沦陷。

    推荐理由作者自费实测 Devin 的间接提示注入链路,从 GitHub issue 到远程代码执行,并给出厂商披露时间线与缓解建议。

  2. 腾讯玄武实验室 · 81

    腾讯玄武实验室在 Black Hat 2025 披露劫持智能体实现 RCE 的通用触发器注入方法

    腾讯玄武实验室在 Black Hat US 2025 发布研究,提出一种将触发器与载荷解耦的提示词注入新范式,用同一组优化 Token 序列即可控制模型精确输出攻击者指定内容。作者用贪婪坐标梯度(GCG)方法在包含上万条样本的对抗数据集上训练触发器前缀与后缀,在 Qwen-2、Llama-3.1、Devstral-Small 等开源模型上经约 200-500 次迭代后平均攻击成功率约 70%。演示案例中,攻击者通过嵌入触发器的恶意邮件让 Open Interpreter 执行命令,或通过更新第三方 MCP 工具描述使 Cline 跳过自动批准直接执行 shell 命令。

    推荐理由展示了触发器与载荷解耦的通用提示注入方法,并给出在 Cline 与 Open Interpreter 上的实际攻击链,可供部署智能体的团队评估工具审批与沙箱策略。

8月1日周五
  1. Embrace The Red · 82

    研究者用提示注入绕过 ChatGPT 安全 URL 渲染,外泄聊天历史与记忆

    研究者演示了 OpenAI 的 safe URL 渲染功能存在绕过,使 ChatGPT 可把个人信息发送到第三方服务器,攻击者通过不可信数据中的提示注入即可利用。当用户处理不可信内容(如总结网页或分析 PDF)时,文档作者能外泄提示上下文中的任意信息,包括过往聊天历史。攻击链为:提示注入劫持 ChatGPT,读取系统提示中 Recent Conversation Content 部分,将内容发送到 https://trustnoai.blob.core.windows.net,攻击者再通过 Azure blob 存储日志查看结果。

    推荐理由作者以第一手实测展示 ChatGPT 聊天历史可经提示注入外泄,并给出 url_safe 绕过与披露时间线,便于评估同类渲染风险。

7月24日周四
  1. Transformer Circuits(Anthropic 可解释性) · 78

    Anthropic 开发三个自动对齐审计智能体并开源评估智能体

    Anthropic 开发了三个可自主执行对齐审计任务的智能体,并在三个形式化审计环境中评估其表现。工具型调查智能体在 Marks 等人的审计游戏中,真实条件下有 13% 的概率找出隐藏目标的根本原因,通过外层智能体循环聚合多次调查结果后提升到 42%;其成功关键依赖可解释性工具或语义搜索。评估智能体为研究者指定的行为构建行为评估,在 88% 的运行中能区分植入行为的目标模型与基线模型,失败集中在少数细微或罕见行为上。广度优先红队智能体在 10 个植入行为中发现 7 个,但需要人工审阅大量可能令人担忧的对话记录。

    推荐理由Anthropic 公开了三个自动审计智能体的实测成功率与失败模式,并开源评估智能体,可供对齐审计方法研究参考。

6月14日周六
  1. Google Security Blog · 62

    Google 详解 Gemini 抵御间接提示注入的分层防御策略

    Google GenAI 安全团队介绍了 Gemini 针对间接提示注入的分层防御策略,覆盖提示词生命周期的各个阶段。该策略包括对 Gemini 2.5 模型进行对抗数据训练以增强模型韧性,并叠加五项内置防御:提示注入内容分类器、安全思维强化、Markdown 清洗与可疑 URL 屏蔽、用户确认框架以及面向终端用户的安全缓解通知。

    推荐理由Google 公开了 Gemini 抵御间接提示注入的分层防御细节,部署生成式 AI 产品的团队可对照其五个防护环节。

5月3日周六
  1. Embrace The Red · 78

    研究者披露 MCP 工具元数据隐藏指令攻击,可劫持 Claude 等客户端

    安全研究者 Johann 披露 MCP 协议中工具元数据可携带隐藏 Unicode Tags 指令,用户界面不可见但会被 Claude 等模型解释执行。作者自建恶意 MCP 服务器演示了完整攻击链:在 message_of_the_day 工具描述中嵌入不可见指令,诱导 Claude 在调用该工具前先调用 enter_matrix 工具,而 UI 中检查描述看不到任何异常。攻击无需实际调用工具,仅将恶意服务器加入对话上下文即可劫持会话,因为工具元数据会被自动插入系统提示词。该攻击在 Claude Desktop、GitHub Copilot Agent Mode 和 Cursor 上均可复现。

    推荐理由作者以自建 MCP 服务器实测,展示工具元数据中隐藏 Unicode Tags 指令如何绕过 UI 可见性并触发未授权工具调用。

2月17日周一
  1. Embrace The Red · 80

    研究者实测 ChatGPT Operator 提示注入攻击与三层防护绕过

    安全研究者 Johann 自费订阅 ChatGPT Pro 实测 OpenAI 的 Operator 浏览器智能体,演示了通过网页提示注入劫持 Operator 并窃取用户 PII 的完整攻击链。攻击方式是在 GitHub issue 等页面植入指令,诱导 Operator 跳转到用户已登录的站点(如 news.ycombinator.com、Booking.com、The Guardian),复制私密邮箱、住址和电话,再粘贴到攻击者控制的第三方页面,该页面无需点击提交按钮即可把输入直接发送到服务器。

    推荐理由作者以付费实测展示 Operator 的三层防护如何被绕过,并给出可复现的攻击链与失效边界。

1月7日周二
  1. Embrace The Red · 80

    研究者用提示注入把 ChatGPT 变成可远程控制的 ZombAI 节点

    安全研究者 Johann Rehberger 在 Black Hat Europe 演讲中展示了一套命令与控制(C2)系统,通过提示注入远程控制 ChatGPT 实例,构成一种新型僵尸网络的基础。攻击前提是用户被提示注入恶意软件感染一次,途径包括用 ChatGPT 访问恶意网站、分析恶意图片或总结 PDF,恶意指令会持久化在 ChatGPT 的长期存储中。

    推荐理由作者以可复现的 PoC 展示提示注入如何把 ChatGPT 变成可长期远程控制的节点,并给出数据外泄的绕过路径。