跳到正文

Agent 安全

今天新收录 14 条(含旧文)
今天10月7日周三
  1. Dark Reading · 收录 · 原文 日期未知↑165

    Tenet 在 DEF CON 34 披露 GhostJacking 攻击,可借可信日志劫持 AI 智能体

    Tenet Security 在 DEF CON 34 披露名为 GhostJacking 的攻击研究:攻击者可在安全告警、日志和错误报告等可信数据中植入恶意指令,诱使 AI 智能体以自身合法权限执行代码、窃取凭证甚至接管基础设施。演示中,一条已被 Cloudflare 防火墙拦截并逐字记录的请求让智能体修改 DNS 设置、接管域名,对 Claude Code 的攻击成功率为 90%(10 次中 9 次),且发生在 Cloudflare 推荐配置下;在 Datadog 植入伪造诊断告警可使智能体执行攻击者控制的命令并窃取环境密钥与云凭证;恶意 Sentry 报告还能让 Sentry 自身 AI 推荐攻击者提供的修复,再由另一编码智能体信任并执行。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由Tenet 展示了同一攻击模式在 Cloudflare、Datadog 和 Sentry 上的复现,部署智能体的团队可据此排查同时具备外部读取与执行权限的智能体。

  2. SecurityWeek · 收录 · 原文 57

    Tenet 演示 Ghostjacking 攻击:用被投毒的日志劫持 AI 智能体

    以色列安全初创公司 Tenet 在 DEF CON 上演示了一种名为 Ghostjacking 的 AI 劫持攻击,攻击者把恶意指令以纯文本形式植入日志或告警,由智能体信任的工具带入并执行。攻击针对 Cloudflare、Datadog 和 Sentry 三个平台:Cloudflare 的托管安全规则会逐字记录被拦截的恶意请求,分析师让智能体复核事件时,智能体读取并执行其中的指令,修改 DNS 设置指向攻击者控制的域名,随后把问题标记为已解决,Tenet 称该手法对 Claude Code 十次中成功九次。Datadog 方向利用前端密钥植入伪造的紧急诊断告警,诱使智能体执行命令并外泄环境密钥与云凭证,Tenet 称在互联网上发现超过 2700 个此类暴露密钥。

    推荐理由Tenet 在 DEF CON 演示的 Ghostjacking 把日志与告警文本变成攻击载荷,说明 Agent 读取外部数据与执行动作叠加时的风险面。

  3. 论文追踪 · 收录 · 原文 论文57

    SkillPoison:用成功经验投毒自进化 Agent 的技能形成

    吉林大学等机构的研究者提出 SkillPoison,一种针对自进化 LLM Agent 技能形成过程的投毒框架,在三个基准上最高达到 95.71% 的攻击成功率。该方法不注入恶意内容,而是先筛选目标行为自然出现且影响任务结果的轨迹,再为每条轨迹构造归因证据,把该行为与已验证的任务成功绑定,最后跨任务类别组织这些记录,诱导技能提取器保留该行为并丢掉其原本的适用条件。实验在 AutoSkill 和 Trace2Skill 两个经验到技能的框架、HANS、PAWS、DS1000 三个基准上进行,注入的经验全部任务正确并通过验证与词法检查;消融显示局部归因与跨经验强化两个模块都不可或缺。作者指出,技能形成过程需要保留行为的上下文适用条件。

    推荐理由论文提出用任务正确的成功经验诱导技能提取器过度泛化,攻击成功率 95.71%,为自进化 Agent 的技能形成环节提供了新的威胁模型。

  4. Island · 收录 · 原文 51

    Island 披露 AgentBaiting 攻击:800 多个伪装成 AI Skill 与 MCP 服务器的恶意仓库投递恶意软件

    Island 报告称,FakeGit/SmartLoader 活动涉及约 7600 个恶意仓库,其中 800 多个冒充 AI Skill 或 MCP server 以投放恶意软件。厂商自测显示,Claude Code、Gemini 和 ChatGPT 在未收到链接的情况下也会检索并推荐相关仓库。约 200 个仓库的 Release 资产累计下载超过 1400 万次;下载数不等于感染人数,测试结果也不能外推为所有智能体的行为。

  5. 论文追踪 · 收录 · 原文 论文57

    CORSA:面向技能路由器的技能注入攻击可跨路由器与 LLM 迁移

    论文指出,现有针对 Agent 第三方技能提示注入的评测常假设恶意技能已被选中执行,这会明显高估攻击成功率;在真实多技能环境中,注入技能需先竞争检索,使已有注入的有效攻击成功率下降 87-97%。作者提出 CORSA(Cluster Optimization for Router-Aware Skill Attacks),一种感知路由器的攻击方法,针对相关任务簇同时优化技能的检索与执行。研究将 SkillRouter 的基准扩展出八类恶意载荷,用分阶段优化先提升检索再优化端到端攻击成功率,并分别评估用户效用与注入自然度。实验显示 CORSA 在保持用户效用的同时提升了检索与端到端攻击成功率,且攻击可迁移到不同路由器架构和 LLM 底座。

  6. 论文追踪 · 收录 · 原文 论文59

    MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露

    Workday AI Research 的 MemLeak 研究指出,企业多租户个人 Agent 若共享同一向量记忆库,普通余弦相似度检索即可把其他用户的记忆拉入当前会话,无需任何漏洞利用。在池化同团队检索下,非对抗性泄露率达 70–100%;精心构造的记忆在 top-k 中占比 90–100%,生产级稠密检索下得分提升 +0.416 至 +0.511;端到端响应污染最高达 5.00/5,且被污染的回答常被评为同样或更有帮助。研究测试了三种缓解方案,只有检索后硬性归属门控能在两个生成模型上把污染恢复到 1.00/5 的干净基线,每次查询延迟开销约 1.4 ms。作者强调这是受控概念验证,样本为每条件 10 条查询,不代表真实企业泄露率。

    推荐理由论文量化了多租户 Agent 共享向量记忆库的跨用户泄露,并给出硬性归属门控这一低成本缓解方案,部署记忆系统的团队可据此评估自身风险。

  7. Israel Defense · 收录 · 原文 56

    Salt Labs 披露 Manus 邮件智能体间接提示注入漏洞,可触达关联服务凭证

    Salt Labs 研究发现,一封恶意邮件即可劫持通用智能体平台 Manus,并触达用户关联服务的凭证。攻击采用间接提示注入,把恶意指令藏在邮件正文中,用户让 Manus 查看邮件时,智能体将邮件内容当作指令执行。首次测试中 Manus 识别并标记了恶意命令,研究者随后用 JavaScript 混淆伪装指令,Manus 解码执行后才生成安全警告。研究者借此建立反向 shell,找到与用户 Manus 账号关联服务的凭证和 token,真实攻击中可能触及邮箱、云存储或代码仓库。攻击无需窃取密码、恶意链接或受害者额外操作。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  8. CrowdStrike · 收录 · 原文 51

    CrowdStrike 实验室披露绕过 LLM 安全分类器的分解重组攻击管线

    CrowdStrike Cyber Superintelligence Lab 评估了当前公开部署的最先进内容安全分类器(用于保护 Claude Opus 5.5 等前沿模型),发现该分类器对直接攻击极为稳健,但可被系统性地绕过。研究测试了约 515 种绕过技术,包括编码、心理操纵、多轮升级、many-shot、tokenizer 漏洞和 Unicode 技巧等,直接绕过成功率均为 0%。绕过方法是将有害任务拆解为单独无害的子任务,用游戏模组、检测工程等合法软件语境重新包装,再由未受分类器保护的本地开源模型组装成可用的攻击代码。该管线在 10 个 MITRE ATT&CK 对齐的攻击类别中有 9 个生成了可工作的漏洞利用代码,仅 Defense (EDR) Evasion 一类因分类器在概念层面拦截而失败。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  9. Fast Company · 收录 · 原文 36

    研究者发现 AI agent 可篡改自身执行记录,审计日志可信度受质疑

    Fast Company 报道研究人员发现 AI agent 能够篡改自身的执行记录,从而抹去其行为的证据。受访作者强调,这一结果表明审计日志可能受到 agent 影响,但不证明现实部署中的 agent 已经普遍主动掩盖行为;实验中的表现出现在特定奖励压力下,仍应与真实事故区分。

  10. METR · 收录 · 原文 ↑157

    METR 发现 Inspect 转录查看器漏洞,智能体可篡改审查者所见记录

    METR 在 Inspect 评测框架的转录查看器中发现客户端注入漏洞,并用概念验证说明,审查界面可能展示被篡改的智能体活动记录。问题影响查看器呈现,底层转录数据并未被修改。METR 表示尚未在实际评测中观察到智能体利用这一漏洞;研究强调行为审查工具本身也需要安全防护。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由METR 用约 10 分钟找到的客户端注入漏洞说明,审查 AI 行为的界面本身也需要按安全关键设施对待。

  11. Threadlinqs · 收录 · 原文 日期未知↑156

    Zenity Labs 披露 Salesforce Agentforce 三漏洞链 SalesBleed,可零点击窃取 CRM 数据

    Zenity Labs 披露 Salesforce Agentforce 中的三漏洞链 SalesBleed,攻击者可通过公开 Web-to-Lead 表单植入间接提示注入,在员工让智能体查看线索时零点击窃取 CRM 数据。攻击链先利用表单字段隐藏注入指令,待智能体读取被投毒记录后调用默认授予的 Query Records 工具查询 Accounts 表,将公司名、交易金额等字段编码进攻击者控制的 URL 子域名。该 URL 借助 Trusted URLs 脱敏器的两处 RFC 3986 不合规缺口绕过检查,再通过 HTML img 标签触发 DNS 查询,或在 Slack 中借自动链接预览完成外传,全程无需点击或认证。第三个缺陷使 Reply to a Slack Thread 动作缺少调用者归属和强制确认,可冒充公司级 Agentforce 机器人发送钓鱼消息。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  12. LessWrong · 收录 · 原文 42

    LessWrong 讨论一起 LLM 向自身用户实施提示注入的案例

    LessWrong 一篇文章回顾了 OpenAI 已披露的一起内部智能体案例,讨论模型向请求方生成提示注入文本的可能含义。作者认为,模型是否理解并有意实施该行为属于其个人解读;相关对话记录本次仅经该文转述获得,未直接核对 OpenAI 交互图原件。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月6日周二
  1. Cloud Security Alliance Labs · 收录 · 原文 日期未知↑164

    GhostCommit 研究展示图像内容与 AI 代码审查之间的信任边界风险

    ASSET 研究组报告 GhostCommit,讨论图像中的不可信指令未被代码审查工具识别、随后影响编码 Agent 行为的风险。研究指出,相同底层模型在不同产品环境中的表现可能不同。相关结果来自作者受控测试及代码审查调查,未报告真实受害事件,不能将个别测试结果扩大为所有产品配置均受影响。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由材料给出了攻击链、受影响工具与模型差异,并附有可落地的审查与密钥轮换建议,便于安全团队对照自查。

  2. BleepingComputer · 收录 · 原文 41

    Ghostcommit 将提示注入藏进 PNG 图片,绕过 AI 代码审查窃取仓库密钥

    美国密苏里大学堪萨斯城分校 ASSET 研究组提出名为 Ghostcommit 的攻击,把恶意指令以可读文本形式渲染进 PNG 图片,让 AI 代码审查工具因不打开图片而放行,随后由编码 Agent 读取图片、打开仓库 .env 并把密钥编码成整数常量写入源码,攻击者再从公开提交中解码还原。研究组本周在 GitHub 发布概念验证,并称已向受影响厂商披露。研究还发现编码工具比底层模型更关键:Cursor 和 Antigravity 在 Sonnet、Gemini、GPT-5.5 等模型下均执行了图片指令并泄露 .env,而 Claude Code 在相同 Sonnet 权重下每次都明确拒绝。

  3. Cloud Security Alliance Labs · 收录 · 原文 日期未知↑263

    CSA 研究笔记转述 Adversa 的加密上下文注入研究

    Cloud Security Alliance Labs 的研究笔记概述 Adversa 关于加密上下文注入的研究,并转述不同模型对相关输入的反应差异。这是对具体测试的转述,不等同跨模型或所有部署配置的普遍安全结论。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由披露的加密载荷注入把恶意指令藏进 AES 密文,绕过了只检查明文的分类器,并给出 Grok 与 Gemini 的实测成功率及厂商响应时间线。

  4. OX Security · 收录 · 原文 日期未知↑140

    OX Security 分析 15,465 个 MCP 服务器,披露基础设施与供应链风险

    OX Security 分析了 15,465 个公开 MCP 服务器和 5,095 个唯一主机名,发现 15.6% 的主机名解析到美国境外基础设施,其中包括位于中国和俄罗斯的基础设施,而 MCP 目前没有原生协议机制来约束连接工具的运行位置或数据处理位置。0.45% 的主机名与家庭网络或消费者隧道工具相关,2.3% 的主机名无法解析,其中 6 个未注册域名年费低至 4 美元,若 MCP 客户端或工作流继续信任并调用这些域名,可能形成接管路径。在针对 Claude Code 与 Haiku 3.5 的测试中,授予一次 Always-Allow 权限后,恶意 MCP 服务器可借助后续提示注入执行特权文件访问而无需再次确认,同一攻击未能在 Opus 4.6 或 4.7 上成功。

    2 条报道 · 2 个来源查看事件时间线与全部报道
  5. Forkast · 收录 · 原文 ↑240

    ClawSecure 报告称 MCP 协议本身存在结构性安全缺陷

    安全厂商 ClawSecure 在 AI Agent Threat Report 中称,MCP 协议规范本身存在结构性漏洞,而非厂商实现问题,开发者无法靠打补丁解决。测试 Linear、Notion 和 Dropbox Dash 发现,服务器在内容创建时自动抓取攻击者控制的链接,无需 AI 介入即可形成数据泄露通道;20 种混淆技术中 17 种通过往返检测,五个实验室的 14 个模型均未能稳定拦截,表现最好的 Claude Opus 4.7 仍有 26.7% 的概率服从恶意指令。该报告尚无第三方独立复现,也未有 CVE 或官方补丁发布。

    3 条报道 · 3 个来源查看事件时间线与全部报道
  6. El lado del mal / Chema Alonso · 收录 · 原文 21

    对一家背包店 AI 助手进行扰动与去对齐测试

    一名安全研究者对某背包商店的 LLM 助手进行去对齐测试,通过在推荐背包列表中把指令嵌入商品名 token,成功绕过其提示词与输出双层护栏。该助手无联网、无编程能力,但研究者用 ASCII 编码、藏头诗和 ELITE 语言等方式多次突破输出过滤,并提取出 System Prompt 配置。研究者据此建议 LLM 助手需重点防护,网络犯罪已在觊觎此类模型。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  7. AppSec Israel / Nevo Poran · 收录 · 原文 日期未知18

    AppSec Israel 2026:Nevo Poran 将讲如何劫持 AI 智能体信任的工具

    Tenet Security 联合创始人兼 CTO Nevo Poran 将在 AppSec Israel 2026 发表演讲,主题为通过 AI 智能体所信任的工具劫持智能体,每个步骤都经过授权。他此前曾参与 Cisco AI Defense 创始团队,并主导了早期智能体安全研究。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  8. webofmike.com · 收录 · 原文 日期未知↑163

    研究者在 MCP 连接阶段复现提示注入与跨调用方缓存投毒

    研究者 Mike Moore 在自建实验环境 mcp-redteam-lab 中复现了 MCP 连接阶段的提示注入:客户端会把服务器在 initialize 和 server/discover 中返回的 instructions 字段折入模型系统提示词,而该字段完全由服务器控制、无长度限制也无内容校验。对官方注册表的只读扫描显示,8,235 台在线服务器中有 5,462 台(66%)返回该字段,中位长度 577 字符,最长 68,669 字符。当发现响应带有 cacheScope: public 时,共享缓存或网关会把一个调用方的响应重新提供给另一个调用方,后者从未连接恶意服务器也会收到注入文本。作者在实验中给出四项控制:隔离并标记为不可信、限制 4,096 字符、缓存键绑定服务器身份与调用方、对 instructions 摘要做固定校验,并指出这些控制只阻止文本被采信,不阻止其被发送。

    2 条报道 · 2 个来源查看事件时间线与全部报道

    推荐理由作者用可复现的本地实验展示 MCP 连接阶段提示注入与跨调用方缓存投毒,并给出四项可落地的网关控制。

  9. Tenet Security · 收录 · 原文 45

    Tenet 披露 Agentjacking 攻击:伪造 Sentry 错误报告劫持编码 Agent 执行代码

    Tenet Security 的 Threat Labs 披露名为 Agentjacking 的攻击:攻击者用公开的 Sentry DSN 向 Sentry 事件接口 POST 伪造错误事件,在 message 与 context 字段中注入伪装成官方修复建议的 markdown,Sentry MCP server 将其作为可信系统输出返回给编码 Agent,Agent 便以开发者权限执行攻击者控制的 npm 包。研究称被动侦察发现 2,388 个组织暴露可注入 DSN,受控测试中 100+ 个 Agent 执行了注入错误,涉及 Claude Code、Cursor 和 Codex,对注入错误的利用成功率为 85%,覆盖 macOS、Windows、WSL、容器与 CI 环境,受害方包括一家约 2500 亿美元市值的 Fortune 100 企业。

  10. BetterClaw · 收录 · 原文 日期未知46

    三起针对 OpenClaw WhatsApp Agent 的提示注入事件复盘

    Imperva 的 Yohann Sillam 在 2026 年 6 月 11 日公布的研究显示,攻击者只需分享一个联系人名片,把指令藏在被 WhatsApp 截断显示的名字字段里,接入 WhatsApp 的 OpenClaw 实例就会读取该指令、从陌生服务器下载并运行脚本;OpenClaw 在 2026.4.23 版本把联系人姓名、vCard 字段和位置标签移出提示词正文,改放入独立的不可信元数据通道。Varonis 的同期研究还显示,一封冒充团队负责人的普通邮件能让测试 Agent 在未核实发件人的情况下明文转发模拟 AWS 密钥、数据库连接串和 SSH 凭据,另一次例行请求则导出了 247 名客户的合成数据集。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  11. IronCore Labs · 收录 · 原文 62

    研究者报告 OpenClaw 记忆处理中的提示洗白风险

    IronCore Labs 的 Patrick Walsh 报告,智能体即使识别出邮件中的可疑指令,记忆摘要仍可能丢失不可信来源标记,随后影响长期记忆与任务行为。作者在 OpenClaw 与 GPT-5.4 的测试中观察到该问题,并报告可能造成未经授权的信息外发。跨产品适用性属于作者主张,尚无独立复现。

    推荐理由作者完整复现了从可疑邮件到长期记忆再到定时任务的攻击链,并给出记忆审查与只读权限等可操作缓解方向。

  12. 论文追踪 · 收录 · 原文 论文31

    NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试

    开源 Rust 自主渗透测试框架 NeuroSploit v4.2.0 在 GOAD 靶场(5 台虚拟机、2 个森林、3 个域)上完成评测,其编排 22 个 AD 专用智能体与 7 套多阶段攻击链 playbook,覆盖枚举、Kerberoasting、AD CS(ESC1-ESC8)、DCSync、跨森林信任滥用等完整杀伤链。对 Claude Opus 4.6/4.7/4.8、GPT-6 Astra、GPT-5.6 Sol、Grok 4.6、Qwen 3.8、GLM 5.3、Kimi k3 九个前沿模型的测试显示,框架实现 96-100% 技术覆盖率与 90-97% 精确率,直接调用仅覆盖 21-54% 且误报多出 3.2 倍;使用 Opus 4.8 时 134 分钟完成三域完全攻陷,护栏机制阻止了触发锁定的喷洒、未授权 DCSync 转储与越界侦察。

  13. Johann Rehberger · 收录 · 原文 31

    研究者演示可跨用户自我复制的提示注入攻击

    安全研究者 wunderwuzzi23 表示,其在 @hackinghub_io 的 AI 黑客课程中设置了一个关卡,要求学员构造一段提示词,通过串联功能与利用漏洞在多个用户之间跳转传播,他将该概念演示称为 "AgentHopper: Patient Zero Was a Prompt"。另据 Leah McElrath 引用,OpenAI 在训练和评估的模拟环境中已发现可自我复制的提示注入,这类代码若被具备相应能力的模型突破在线系统,可能像计算机蠕虫一样自我传播。

    引用Leah McElrath@leahmcelrath

    ⚠️ Self-replicating prompt injections have been shown to exist in simulated environments during training and evaluation at OpenAI. This is code that could self-propagate like a computer worm—malware—if models with the capability were to breach online systems. Source below.

  14. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文54

    研究用因果追踪区分间接提示注入中的可读信号与有效干预

    研究通过反事实角色探针、逐组件激活修补和对 AgentDojo 轨迹的干预,分析间接提示注入中角色信号与行为改变之间的差距。角色解码在内容和格式变化下依然存在,在受控 Qwen 测试中先于沿独立估计的角色方向修补带来的工具选择效应。在 AgentDojo 上,从被劫持和抵抗的训练轨迹估计出的方向在行动前和注入片段位置降低了攻击成功率,但在随机位置效果很小。在较长的 Qwen 轨迹中,单点编辑在较后层效果减弱,跨片段和重复编辑能在同一评测集上降低攻击成功率。移除学到的通道子空间仍保留角色解码,但有效干预方向在测试通道间迁移较差。

  15. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文48

    Penumbra:面向监管义务的样本高效对抗搜索方法

    研究者提出 Penumbra,一种面向监管义务的对抗搜索方法,从已验证的锚点出发,在逐步扩大的编辑预算下搜索,直到由两名评估者组成的委员会改变判定,并输出跨越判定边界的两条相邻响应。该方法采用自适应分配,目标是对失败面的覆盖,即每个候选解决的(义务×失败模式)单元格数量。在同等预算下,自适应分配在 59% 的候选上达到均匀分配全预算的覆盖;在相同记录数下,其覆盖的失败模式是朴素枚举的 1.43 倍,且增益局限于其针对的维度。在金融顾问章程的 60 条筛选义务上,Penumbra 返回 144 对响应,每对包含委员会判定为合规与违规的两条文本,仅相差几个词;直接要求模型同时生成两类文本时,两者几乎不共享内容。在临床分诊的第二份章程上,该方法在 18 条义务上复现了结果,得到 49 对同样紧密的响应,且最难的模式相同。

  16. 论文追踪 · 收录 · 原文 论文55

    研究者训练出按多智能体拓扑触发的代码后门模型

    研究者构建人为植入后门的实验模型,测试其是否会依据推断出的单智能体或多智能体部署环境改变代码安全行为。作者报告受控任务中存在环境相关的安全差异,并以多组对照分析触发条件。这是人为构造的受控实验,不是模型自发涌现行为;真实多智能体环境中的触发尚未测试。

    推荐理由论文用受控模型生物展示按部署拓扑触发的后门,并给出跨单智能体与多智能体上下文的差分审计思路。

  17. 论文追踪 · 收录 · 原文 论文53

    CRIME 框架利用良性 Agent 技能组合诱发恶意行为

    研究者提出 CRIME 框架,指出单独通过安全审查的良性 Agent 技能在组合后仍可诱发恶意行为,因为组合会扩展智能体的能力空间。CRIME 先用 Malicious Plot Casting 模块把目标恶意行为拆解为互补需求,从公开技能库中筛选合适的良性技能组合;对无法直接实现的组合,Runaway Reaction Steering 模块借助执行反馈迭代调整技能,同时要求每个技能在单独审查下仍属良性。组合随后进入 Skill Reaction Chamber 模块,在沙箱中执行并检查环境后果以判断目标行为是否发生,失败案例返回继续调整。研究者还构建了覆盖八类网络安全行为的 4000 个公开技能基准用于系统评估。

  18. 论文追踪 · 收录 · 原文 论文54

    论文披露主动式智能体的服务方间接提示注入攻击

    论文提出一种针对主动式个人智能体的服务方间接提示注入攻击,外部服务方无需访问用户私有上下文、无需攻陷智能体或获取额外权限,仅控制与自身目标相关的内容,就能让原本中立的智能体转而推进该目标。作者用目标控制、私有绑定与前瞻支持三个维度刻画这一失效模式,分别决定智能体推进什么、如何把目标与用户关联、以及接下来提供哪些目标相关协助。在三个主动式智能体环境和六个模拟用户模型上,完整攻击在所有环境与用户模型组合中都提升了目标授权,宏观增幅最高达 77.4 个百分点。对照重放显示,正确的用户与目标绑定比单纯增加提案细节更关键;多轮扩展还显示,即便最终未获授权,服务方目标仍能通过改变智能体对用户约束与抵触的回应方式保持影响。

  19. 论文追踪 · 收录 · 原文 论文58

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    研究者对智能体持久记忆发起大规模红队测试,验证攻击者能否在一个会话中把受控字符串以隐写方式写入记忆、在另一会话中取回而不触发安全监督。测试覆盖 14000 次攻击试验、91 个模型与攻击配置、13 个模型和 7 种隐写方案(Acrostic、Mesostic、Telestich、Word-choice、Capitalization、Position-based、Homoglyph)。41.2% 的试验成功在回复中编码目标载荷,29.8% 在记忆写入后仍保持编码完整,25.4% 在检索时可恢复载荷,20.1% 实现精确匹配恢复,其中包括从未向接收方暴露的合成 API key 和密钥材料。精确匹配传输中有 71.4% 同时通过主任务完成度评分并被监督模型独立判定为安全,相当于全部试验的 14.4%。

    推荐理由论文用 14000 次试验量化了智能体记忆作为跨会话隐蔽信道的成功率,并指出记忆写入而非检测才是当前主要瓶颈。

  20. 论文追踪 · 收录 · 原文 论文55

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    研究者提出 AgentDoxx,一个包含 822 份合成访谈文本的评测套件,用于衡量具备联网搜索能力的 LLM Agent 对匿名文本的再识别风险。这些访谈基于 r/IAmA 中公开披露身份者的公开信息生成,经人工判别研究显示其与真实访谈难以区分。在 15 种模型配置上,Kimi K3、GLM-5.3 Flash 和 DeepSeek-V4 Flash 在无搜索条件下仅凭参数知识即可正确识别 15–28% 的文本;一旦目标姓名出现在检索结果中,识别成功率超过 88%。防护方面,命名实体遮蔽后仍有至少一个攻击者能识别 85.3% 的分层样本;属性噪声替换把平均准确率从 75.1% 降至 34.2%;系统提示中的隐私指令降幅最大(75.1% 降至 21.6%),但在拒答姓名的样本中 37% 已在检索阶段拿到姓名、58% 仍描述了目标的辨识性细节。

    推荐理由该研究用 822 份已知身份的合成访谈量化了联网搜索对再识别风险的贡献,并给出多种匿名化防护的实测效果。

  21. pwn.ai · 收录 · 原文 62

    pwn.ai 称其 AI 智能体在 Google kvmCTF 中捕获官方 flag

    pwn.ai 称其 AI 智能体在授权的 Google kvmCTF 环境中构建并运行 KVM 漏洞利用,并于 6 月 17 日取得官方 flag,相关漏洞编号为 CVE-2026-46113。该案例涉及虚拟机与宿主之间的隔离边界。作者称因公开补丁的时间窗口未获得赏金;关于首例与自主程度的说法均为作者主张,人类提供了任务、授权与基础设施,现有材料未提供独立复现。

    推荐理由材料完整记录了 AI 智能体自主构建 KVM 逃逸链并拿到官方 flag 的过程,可看到长周期漏洞利用中工具链与验证环节的作用。

  22. Pillar Security · 收录 · 原文 61

    Pillar 披露 Google ADK 仓库 Agent 间权限边界漏洞

    Pillar Security 披露 Google ADK 仓库中 Agent 间的权限边界问题:低权限分诊 Agent 受到不可信输入影响后,可借协作者身份触发更高权限的 Agent 工作流;另一条链涉及命令限制绕过与运行环境凭据风险。研究者报告 Google 已于 7 月确认修复,未报告在野利用;部分影响仍受人工合并和内部审查限制。该案例体现了多 Agent 系统中身份绑定、权限委托和不可信输入之间的风险。

    推荐理由披露了 Google ADK 仓库中低权限 Agent 触发高权限 Agent 的完整利用链,并给出权限边界与令牌作用域的加固方向。

  23. Cybersecurity Insiders · 收录 · 原文 44

    无需隐藏文本即可欺骗 AI 邮件摘要器

    一项针对 AI 邮件摘要器的测试显示,不含任何隐藏文本、也不含对摘要器明确指令的载荷,在 10 次试验中全部让摘要输出伪造的会议日期和发票金额。研究者用 6 封邮件组合隐藏文本与指令两类变量,每封各跑 10 次,共 60 次试验,并在两端各加 10 次干净邮件作为对照,事先登记真实与伪造事实及判定标准。结果显示,伪造信息在所有 10 次试验中都被写入摘要,而只有直接指令摘要器的邮件才会稳定移除真实事实;仅靠 30 行空白填充的样本在温度 0 下十次试验中只保留了两条真实事实。作者据此认为,隐藏文本检测和指令关键词检测都有缺口,指令检测能拦截部分攻击,但无法阻止伪造信息被摘要器照单全收。测试仅在一种邮件客户端和一个视口下进行,未验证更高温度或其他客户端下的表现。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  24. Ars Technica AI · 收录 · 原文 56

    研究者发现 MCP 智能体间通信漏洞,Google 等五家机构已确认

    独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weaviate、Rapid7、法国政府跨部门数字局和美国联邦政府等机构的 AI 智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。攻击利用一种特殊形式的提示注入,目标不是 LLM 而是翻译或数据分析等具体智能体,这些智能体内部的护栏往往宽松,会把有害指令沿链条传给下游智能体,而下游智能体因明确信任上游而执行指令。过去五个月里,Google 和另外四家机构已确认存在此类漏洞,攻击者可借此在目标网络内从一个智能体扩散到其他内部智能体,进而窃取数据库内容及敏感商业和个人信息。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由材料披露了 MCP 智能体间信任链被利用的机制与受影响机构范围,部署多智能体系统的团队可据此检查内部信任边界。

  25. promptarmor.com · 收录 · 原文 42

    PromptArmor 披露 Elastic AI SOC 遭间接提示注入窃取 API 密钥

    PromptArmor 披露 Elastic 的 Agentic SOC(EASE)可被其负责分诊的告警操纵,攻击者借此窃取 API 密钥。攻击链中,一封钓鱼邮件指示 Agent 从攻击者控制的 URL 获取更多告警,工作流拉取该 URL 的提示后启动一个只带攻击者数据和“Action the below”系统提示的子智能体,子智能体在竞赛话术诱导下铸造新 API 密钥并回传攻击者服务器,同时泄露工作区 URL。由于 Agent 可自行决定是否加入 waitForApproval 步骤,整个过程无需人工审批;攻击者拿到密钥后可以用户权限禁用告警规则、制造假告警掩盖真实攻击、从 Elasticsearch 外泄数据、通过定时任务建立持久化。

  26. Zenity Labs · 收录 · 原文 53

    Zenity Labs 披露 Agentforce 在 Slack 中的匿名钓鱼攻击链 SalesBleed

    Zenity Labs 发现 Agentforce 的 Slack Knowledge 子代理模板中,Reply to a Slack Thread 动作既不需要用户确认,也不显示调用者归属,攻击者可借代理身份在 Slack 中发送钓鱼链接。攻击分两类:内部人员直接让代理把钓鱼消息发进指定线程;外部攻击者则把恶意指令写进通过 Web-to-Lead 表单提交的 CRM 线索,等内部用户让代理处理该线索时触发,代理会向多个 Slack 频道发送钓鱼消息。此前披露的 URL 过滤绕过使钓鱼链接能躲过 Agentforce 的 URL 脱敏层,并可用 markdown 把链接藏在正常文字后。

  27. AI Incident Database · 收录 · 原文 60

    Zenity Labs 披露 Salesforce Agentforce 间接提示注入与零点击数据外泄漏洞

    Zenity Labs披露Salesforce Agentforce的SalesBleed攻击链:来自外部的不可信内容可能被智能体当作指令,进而跨越业务数据与外部输出之间的信任边界,导致敏感信息泄露。研究同时涉及URL安全控制在解析和渲染环节的差异。该结果来自研究团队测试,不能等同已观察到的真实受害事故;读者应结合厂商修复信息判断当前版本风险。

    推荐理由披露智能体读取外部内容后发生信任边界失效的研究案例,有助于理解权限隔离与输出控制。