跳到正文

#Agent 安全

今天收录 20 条

第 19 页更新的内容回到最新

6月9日周一
  1. Embrace The Red ·

    用 MCP Server 托管 COM 服务器实现 Windows 与 Office 自动化

    有人基于 Model Context Protocol(MCP)开发了一个名为 mcp-com-server 的原型服务器,通过动态发现方式实例化并托管任意 COM 对象,从而驱动 Windows 与 Office 自动化。该服务器提供类似 COM 的工具集——CreateObject、Get/Set Property、InvokeMethod、QueryInterface 以及列出当前所有活动服务器的接口,连接 Claude 后可创建、打开、编辑并保存 Excel 文件,再调用 Outlook 发送邮件,甚至能唤起 Internet Explorer。

5月28日周三
  1. 雷峰网安全频道 ·

    补天平台推出AI安全奖励计划,携手白帽洺熙升级AI安全人才培养体系

    补天平台推出业内首个AI专项漏洞奖励计划,对Ollama、VLLM、Vanna等主流开源AI产品漏洞实施双倍奖金,单项最高奖励提升至2.2万元。平台同时携手00后AI安全白帽洺熙全面升级AI技术内容体系,构建覆盖AI应用开发、模型安全、数据防护的全链路知识库。补天已汇聚15万名白帽,累计发现超200万个漏洞,旨在填补AI安全复合型人才缺口。

5月25日周日
  1. Embrace The Red ·

    研究者用 ClickFix 社工手法劫持 Computer-Use Agent

    安全研究者 Johann 把真实世界的 ClickFix 社工手法改造成针对 Computer-Use Agent 的攻击,并称多数变体都能奏效。攻击方式是在网页按钮被点击时用 JavaScript 把 curl 命令写入剪贴板,再诱导 Agent 打开终端、粘贴并执行,同时用终端图标和 CTRL+SHIFT+V 等 GUI 指令引导操作。作者称 Claude 偶尔拒答,但把验证文案从 Are you a Human 改成 Are you a Computer、把按钮从 Begin Validation 改成 Show Instructions 后,拒答几乎完全消失。

5月21日周三
  1. Stanford CRFM ·

    Stanford CRFM 发布 BountyBench:用真实漏洞赏金衡量 AI Agent 攻防能力

    Stanford CRFM 提出 BountyBench,一个包含 25 个真实代码库系统和 40 个漏洞赏金的基准,赏金金额从 10 美元到 30,485 美元,覆盖 OWASP Top 10 风险中的 9 类。基准定义 Detect、Exploit、Patch 三类任务,覆盖漏洞从发现到修复的生命周期,并通过信息量调节任务难度。评测 5 个 Agent 后发现明显的攻防失衡:OpenAI Codex CLI 和 Claude Code 的 Patch 成功率分别为 90% 和 87.5%,但 Exploit 成功率仅 32.5% 和 57.5%;基于 GPT-4.1、Gemini 2.5 Pro Preview 和 Claude 3.7 Sonnet Thinking 的自定义 Agent 则相对均衡,Exploit 成功率 40-67.5%,Patch 成功率 45-60%。

5月3日周六
  1. Embrace The Red · · 原文 78

    研究者披露 MCP 工具元数据隐藏指令攻击,可劫持 Claude 等客户端

    安全研究者 Johann 披露 MCP 协议中工具元数据可携带隐藏 Unicode Tags 指令,用户界面不可见但会被 Claude 等模型解释执行。作者自建恶意 MCP 服务器演示了完整攻击链:在 message_of_the_day 工具描述中嵌入不可见指令,诱导 Claude 在调用该工具前先调用 enter_matrix 工具,而 UI 中检查描述看不到任何异常。攻击无需实际调用工具,仅将恶意服务器加入对话上下文即可劫持会话,因为工具元数据会被自动插入系统提示词。该攻击在 Claude Desktop、GitHub Copilot Agent Mode 和 Cursor 上均可复现。

    推荐理由作者以自建 MCP 服务器实测,展示工具元数据中隐藏 Unicode Tags 指令如何绕过 UI 可见性并触发未授权工具调用。

4月29日周二
4月7日周一
  1. Embrace The Red ·

    GitHub Copilot 自定义指令文件可被植入后门代码

    作者实测发现,GitHub Copilot 会读取仓库中的 .github/copilot-instructions.md 文件并加入提示词上下文,因此指令文件中一行隐蔽内容即可让 Copilot 生成带后门代码的补全结果,作者以 Go 语言做了演示。作者同时提到 Pillar Security 此前已指出 Cursor 的 .mdc 规则文件存在同类风险,并涉及隐藏 Unicode 字符。GitHub 去年已缓解 0-click 图片渲染数据泄露问题,点击超链接时也会弹出确认对话框,除非目标域名在 VS Code 的受信任站点列表中。

3月13日周四
  1. Embrace The Red ·

    ASCII Smuggler 更新:用两个不可见字符走私任意 Unicode 数据

    Embrace The Red 发布 ASCII Smuggler 工具更新,新增 Sneaky Bits 编码方式,仅用两个不可见字符即可编码任意 Unicode 字符或字节序列。Sneaky Bits 默认以 invisible times(U+2062)表示 0、invisible plus(U+2064)表示 1,逐位表示 Unicode 码点,两个字符可配置,在工具中作为非默认选项,默认仍为 Unicode Tags 编码。文章同时回顾了 Unicode Tags 与 Variant Selectors 两种走私技术,前者常被 LLM 直接当作指令执行,后者可将 VS1-VS256 映射为原始字节。

2月26日周三
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA:AI 智能体的自主性等级与安全

    NVIDIA 技术博客探讨 AI 智能体的自主性等级与安全问题,将智能体工作流视为 AI 工具的下一步演进。这类工作流可让开发者串联多个 AI 模型执行复杂任务,调用工具访问额外数据或自动执行用户操作,并让模型以最少人工介入自主分析与完成任务。

2月17日周一
  1. Embrace The Red · · 原文 80

    研究者实测 ChatGPT Operator 提示注入攻击与三层防护绕过

    安全研究者 Johann 自费订阅 ChatGPT Pro 实测 OpenAI 的 Operator 浏览器智能体,演示了通过网页提示注入劫持 Operator 并窃取用户 PII 的完整攻击链。攻击方式是在 GitHub issue 等页面植入指令,诱导 Operator 跳转到用户已登录的站点(如 news.ycombinator.com、Booking.com、The Guardian),复制私密邮箱、住址和电话,再粘贴到攻击者控制的第三方页面,该页面无需点击提交按钮即可把输入直接发送到服务器。

    推荐理由作者以付费实测展示 Operator 的三层防护如何被绕过,并给出可复现的攻击链与失效边界。

2月16日周日
  1. Miles Brundage ·

    Miles Brundage 公布今年不会亲自推进的多项重要 AI 议题

    Miles Brundage 列出自己离开 OpenAI 后今年不会亲身投入的重要 AI 方向,涵盖让人直观感受到 AGI 紧迫性、AI 智能体的基础设施与社会规范及法律责任、AI 的经济冲击以及欧盟《人工智能法案》落地谈判。他认为自己在这些问题上的技能更适合处理其他问题,因此选择回避而非放弃关注,并可能偶尔向他人提供建议。

2月10日周一
  1. Embrace The Red ·

    用提示注入与延迟工具调用篡改 Gemini 长期记忆

    研究者演示了通过上传文档中的间接提示注入,配合延迟工具调用,让 Gemini 把攻击者指定的虚假信息写入长期记忆。Gemini 通常不会在处理不可信数据时调用敏感工具,但攻击者先在文档摘要中埋入指令,要求用户在回复 yes、sure 或 no 等触发词时保存记忆,用户一旦照做,Gemini 便误以为这是用户本人的指令而调用记忆工具。演示中写入的虚假记忆包括昵称、年龄和喜好,并可在后续会话中持续存在,作者还通过询问年龄验证了端到端效果。

1月16日周四
1月7日周二
  1. Embrace The Red · · 原文 80

    研究者用提示注入把 ChatGPT 变成可远程控制的 ZombAI 节点

    安全研究者 Johann Rehberger 在 Black Hat Europe 演讲中展示了一套命令与控制(C2)系统,通过提示注入远程控制 ChatGPT 实例,构成一种新型僵尸网络的基础。攻击前提是用户被提示注入恶意软件感染一次,途径包括用 ChatGPT 访问恶意网站、分析恶意图片或总结 PDF,恶意指令会持久化在 ChatGPT 的长期存储中。

    推荐理由作者以可复现的 PoC 展示提示注入如何把 ChatGPT 变成可长期远程控制的节点,并给出数据外泄的绕过路径。

12月17日周二
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA 用 WebAssembly 沙箱隔离智能体 AI 工作流

    NVIDIA 技术博客提出用 WebAssembly 沙箱隔离智能体 AI 工作流。文章指出,智能体工作流常需执行大语言模型生成的代码来完成数据可视化等任务,这类代码应先清洗并在安全环境中运行,以降低提示注入和返回代码出错带来的风险。作者认为,用正则表达式清洗 Python 并配合受限运行时并不充分,因此需要更强的隔离手段。文章由 Joseph Lucas 撰写,发布于 NVIDIA 开发者博客。

10月25日周五
5月21日周二
  1. 雷峰网安全频道 ·

    亚信安全发布安全大模型信立方,用AI对抗AI攻击

    亚信安全在C3安全大会·2024上发布网络安全行业自研大模型信立方,用于精准问答、告警日志解读和网络安全事件分析,并同步推出"信计划"(XPLAN),涵盖安全为AI与AI为安全两大方向。亚信安全高级副总裁陈奋透露,针对大模型的攻击手段一年内已涌现数十种,其团队在Llama2环境模拟海绵样本攻击,使模型响应从几秒延迟至60秒以上、慢了20倍以上。信计划已落地东数西算成都节点的算力云安全保护,并通过红队测试从八个方向为大模型提供上线前安全检查。

12月21日周四
  1. FAR.AI · · 原文 78

    FAR.AI 发现 GPT-4 微调与 Assistants API 存在可利用漏洞

    FAR.AI 发现 GPT-4 的微调 API 与 Assistants API 存在多类可利用漏洞。仅用 15 条有害样本或 100 条无害样本微调即可移除 GPT-4 的核心护栏,在无害数据上微调后模型对 AdvBench 有害请求的响应率达 81%。用 15 条负面样本即可让模型产生针对特定人物的偏见信息,35 条样本可让模型在代码中植入恶意 URL,10 组问答对可让模型泄露未出现在微调数据中的真实邮箱地址。Assistants API 方面,模型会列出全部可调用函数及其 schema、按用户指定参数执行任意函数调用,甚至协助生成 SQL 注入载荷;检索文档中的隐藏指令(如将字体颜色设为与背景相同)可劫持模型输出,改为调用转账函数同样成功。作者据此不建议在安全关键场景部署 LLM。

    推荐理由FAR.AI 用具体实验量化了微调 API 与 Assistants API 新增功能带来的攻击面,做微调或工具调用的团队可据此评估自身风险。

10月18日周三
已经到底了