全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:越狱、提示注入、投毒与防御
论文研究 LLM 数字孪生参与增强民主时的提示注入脆弱性
一篇论文研究基于 LLM 的数字孪生作为增强民主中介时的偏好代表与攻击脆弱性。作者先用巴西在线实验数据检验个性化数字孪生能否预测公民对未见政策提案的偏好,再用瑞士议会数据从议员立法记录构建主题知识图谱,连接 LLM 议员智能体并组成政党级数字孪生,通过智能体审议检验其是否比官方政党沟通覆盖更广的党内观点。最后基于英国 2023 年审议实验数据,分析放大观点、压制意见或改变共识的提示注入攻击,考察攻击效果如何随意见分布和修辞策略变化,并评估结合注入检测、结构化意见表示与强化学习的流程能否提升抗攻击能力。
- 论文论文追踪
研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准
该 arXiv 论文讨论长时程智能体的分段提示注入审计。
- 论文论文追踪
论文披露主动式智能体的服务方间接提示注入攻击
论文提出一种针对主动式个人智能体的服务方间接提示注入攻击,外部服务方无需访问用户私有上下文、无需攻陷智能体或获取额外权限,仅控制与自身目标相关的内容,就能让原本中立的智能体转而推进该目标。作者用目标控制、私有绑定与前瞻支持三个维度刻画这一失效模式,分别决定智能体推进什么、如何把目标与用户关联、以及接下来提供哪些目标相关协助。在三个主动式智能体环境和六个模拟用户模型上,完整攻击在所有环境与用户模型组合中都提升了目标授权,宏观增幅最高达 77.4 个百分点。对照重放显示,正确的用户与目标绑定比单纯增加提案细节更关键;多轮扩展还显示,即便最终未获授权,服务方目标仍能通过改变智能体对用户约束与抵触的回应方式保持影响。
- 动态Cybersecurity Insiders
无需隐藏文本即可欺骗 AI 邮件摘要器
一项针对 AI 邮件摘要器的测试显示,不含任何隐藏文本、也不含对摘要器明确指令的载荷,在 10 次试验中全部让摘要输出伪造的会议日期和发票金额。研究者用 6 封邮件组合隐藏文本与指令两类变量,每封各跑 10 次,共 60 次试验,并在两端各加 10 次干净邮件作为对照,事先登记真实与伪造事实及判定标准。结果显示,伪造信息在所有 10 次试验中都被写入摘要,而只有直接指令摘要器的邮件才会稳定移除真实事实;仅靠 30 行空白填充的样本在温度 0 下十次试验中只保留了两条真实事实。作者据此认为,隐藏文本检测和指令关键词检测都有缺口,指令检测能拦截部分攻击,但无法阻止伪造信息被摘要器照单全收。测试仅在一种邮件客户端和一个视口下进行,未验证更高温度或其他客户端下的表现。
- 动态Ars Technica AI
研究者发现 MCP 智能体间通信漏洞,Google 等五家机构已确认
独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weaviate、Rapid7、法国政府跨部门数字局和美国联邦政府等机构的 AI 智能体,发现 MCP(Model Context Protocol)在智能体间通信中存在信任缺口。攻击利用一种特殊形式的提示注入,目标不是 LLM 而是翻译或数据分析等具体智能体,这些智能体内部的护栏往往宽松,会把有害指令沿链条传给下游智能体,而下游智能体因明确信任上游而执行指令。过去五个月里,Google 和另外四家机构已确认存在此类漏洞,攻击者可借此在目标网络内从一个智能体扩散到其他内部智能体,进而窃取数据库内容及敏感商业和个人信息。
- 动态promptarmor.com
PromptArmor 披露 Elastic AI SOC 遭间接提示注入窃取 API 密钥
PromptArmor 披露 Elastic 的 Agentic SOC(EASE)可被其负责分诊的告警操纵,攻击者借此窃取 API 密钥。攻击链中,一封钓鱼邮件指示 Agent 从攻击者控制的 URL 获取更多告警,工作流拉取该 URL 的提示后启动一个只带攻击者数据和“Action the below”系统提示的子智能体,子智能体在竞赛话术诱导下铸造新 API 密钥并回传攻击者服务器,同时泄露工作区 URL。由于 Agent 可自行决定是否加入 waitForApproval 步骤,整个过程无需人工审批;攻击者拿到密钥后可以用户权限禁用告警规则、制造假告警掩盖真实攻击、从 Elasticsearch 外泄数据、通过定时任务建立持久化。
- 动态Zenity Labs
Zenity Labs 披露 Agentforce 在 Slack 中的匿名钓鱼攻击链 SalesBleed
Zenity Labs 发现 Agentforce 的 Slack Knowledge 子代理模板中,Reply to a Slack Thread 动作既不需要用户确认,也不显示调用者归属,攻击者可借代理身份在 Slack 中发送钓鱼链接。攻击分两类:内部人员直接让代理把钓鱼消息发进指定线程;外部攻击者则把恶意指令写进通过 Web-to-Lead 表单提交的 CRM 线索,等内部用户让代理处理该线索时触发,代理会向多个 Slack 频道发送钓鱼消息。此前披露的 URL 过滤绕过使钓鱼链接能躲过 Agentforce 的 URL 脱敏层,并可用 markdown 把链接藏在正常文字后。
- 动态Red Hat Developer
Red Hat 基准测试:Jev 式决策模型与传统护栏在提示注入和内容安全上的对比
Red Hat AI Safety 团队在 NeMo Guardrails 与 EvalHub 基准上对比了 9 种护栏方案,覆盖预训练小分类器、零样本分类器、LLM-as-a-judge 与 Jev 式决策模型四类方法,任务为提示注入与内容安全/毒性检测。提示注入任务中 Qwen3.6-35B 以 89.31% 准确率居首,deberta-v3-base-prompt-injection-v2 以 89.01% 紧随其后且中位延迟仅 54.1 ms;Jev 为 86.35%,DiffusionGemma 为 87.72%,Laya 为 85.44%,BART-large-mnli 仅 61.49%。团队结论是预训练小模型仍极具竞争力,未发现决策模型在速度、成本或质量上稳定优于 LLM-as-a-judge,但 Jev 式范式把注意力重新引向轻量、任务专用的推理方式。
- 动态AI Incident Database
Zenity Labs 披露 Salesforce Agentforce 间接提示注入与零点击数据外泄漏洞
Zenity Labs披露Salesforce Agentforce的SalesBleed攻击链:来自外部的不可信内容可能被智能体当作指令,进而跨越业务数据与外部输出之间的信任边界,导致敏感信息泄露。研究同时涉及URL安全控制在解析和渲染环节的差异。该结果来自研究团队测试,不能等同已观察到的真实受害事故;读者应结合厂商修复信息判断当前版本风险。
- 动态Blockaid
Blockaid 提醒交易智能体防范代币元数据中的提示注入
Blockaid 分析代币名称、符号和描述被聚合器传入交易智能体上下文后,外部文本可能被误当指令的风险。文章展示相关示例并引用研究者在自有环境中的授权演示;它另外列举的 Bankr 资金转出与 Sceptre 仿冒站损失,分别涉及社交提示和聊天机器人推荐,不能作为代币元数据注入已造成实损的证明。厂商建议签名前校验实际交易,同时推广自家产品;文中部分截图与外链案例尚未独立核实。
- 动态Metnew
研究员披露 Claude Code 工作树沙箱逃逸问题,2.1.163 已修复
研究员Metnew介绍Claude Code工作树处理中的沙箱逃逸问题,并称在macOS的2.1.139版本验证。该风险需要用户先克隆恶意仓库并让Claude Code处理其中内容,随后可能借用agent工具越过预期权限边界。官方在2.1.163修复;Bot只读研究报告前半,没有运行PoC或核实其他产品的相关指控。此为研究性漏洞披露,不是已确认的在野事故。
- 动态ACM Digital Library
AgentBreaker:评估现代 Web 智能体中上下文感知的间接提示注入风险
AgentBreaker 研究现代 Web 智能体运行上下文中的间接提示注入风险,指出针对单个模型生成静态短语的评测可能低估多模型智能体的风险。作者按页面上下文构造测试,在五个网页智能体与 Online-Mind2Web 抽取的60个页面上评估,并报告防御可明显降低测试中的攻击成功率。现有摘要与配套材料没有给出各被测智能体名单及防御细节,结果限于这些实验条件,不能直接当作真实部署风险发生率。
- 论文arXiv:越狱、提示注入、投毒与防御
LS-AR 双通道架构:文本目标丢弃可抵御提示注入但引入潜在向量攻击面
研究者提出 Latent-Steered Autoregressive(LS-AR)双通道架构,通过 FiLM 条件将连续目标引导与离散 token 解码解耦,以解决标准自回归模型无法隔离宏观目标与上下文噪声的问题。在超出上下文限制的长程检索任务(H=1024, W=500)中,LS-AR(Static)实现 100% 目标召回,而参数匹配的基线完全崩溃(0%),同时吞吐量提升约 35%,峰值 VRAM 降低 52.8%。在 Blocksworld 规划任务中,LS-AR(Dynamic)在强制扰动(k=1)下保持 89.0% 完成率,基线为 71.0%,但零样本实体扩展(N 到 N+1)暴露出单向量容量限制(0%)。双通道权限分析显示,文本目标丢弃会建立潜在主导控制,为文本提示注入提供结构性防御,但同时引入潜在向量攻击面。
- 动态Nature Portfolio
Scientific Reports 研究牙科影像中的视觉提示注入与防御
Scientific Reports 发表研究,考察牙科影像场景下的视觉提示注入攻击及其防御。研究涉及视觉提示注入这一攻击形式,并探讨相应防御手段。
- 论文论文追踪
研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现
日本北陆先端科学技术大学院大学(JAIST)研究者 Zhuowen Liu 在论文中重测了 15 个提示注入检测器和 2 个任务感知 LLM 判官,发现公开基准上的检测排名很难迁移到 Agent 实际场景。研究用无 LLM 回放 AgentDojo 与 τ-bench 的真实工具调用构造良性输出,再用差分回放标注注入输出,并在 BIPIA 上对比。BIPIA 上表现最好的 PIGuard 在 1% 假阳性率下只检出 2.1% 的 AgentDojo 注入,而检出 72.2% AgentDojo 注入的 Prismor 在 τ-bench 上只有 15.2%;BIPIA 与 AgentDojo 之间的 Kendall τ 仅 0.01。相反,工具输出上的假阳性率在两个 Agent 基准间保持一致(τ=0.67),范围从 0% 到超过 90%。
- 论文论文追踪
COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构
剑桥大学等机构的研究者提出 COBRA,一种针对计算机使用 Agent(CUA)分支引导攻击的系统级防御架构。作者指出,Dual-LLM 模式虽能保证控制流完整性,但在图形环境中计划必须按运行时网页内容分支,攻击者可构造不可信数据把 Agent 推向预先批准的危害路径,而无需注入新指令。为此作者构建 STEER-Bench,覆盖 9 个领域 101 个任务,测得分支引导攻击对标准 CUA 的攻击成功率为 94.4%,对原版 Dual-LLM 为 89.5%。COBRA 在规划阶段为每个分支预先固定目的地、端点和工具参数约束,由 Branch Resolution Hub 校验运行时分支与参数,并在 HTTP 与 MCP 代理处强制执行。代码已开源于 GitHub。
- 论文arXiv
研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据
密苏里大学堪萨斯城分校的研究者提出跨通道碎片化攻击,将看似无害的载荷分散到 MCP 的两个或三个输入通道,单个通道都不含完整注入,模型却在统一上下文窗口中把它们拼合成凭据外泄。研究在 12 个前沿模型、3 个生产客户端和 6 种载荷上完成超过 15,000 次试验,发现完全抵抗单通道注入(0% 合规)的模型在两通道碎片化下外泄率最高达 100%,包括 GPT-4o、Llama 70B、Composer 2 和 Haiku 4.5。三通道碎片化在生产客户端中进一步扩大受影响范围,Haiku 4.5 在 Cursor 中达到 100%,Sonnet 4.6 和 Opus 4.6 在所测碎片化攻击中未发生泄露(0/20)。研究还展示了价值对齐利用(工具声称的用途本身就需要目标数据)以及通过 VS Code 的 sampling/createMessage 注入持久系统提示。
- 动态al-ice.ai
WordPress 插件 AI Engine 曝 CVE-2026-96561:日志注入经模型输出触发后台 XSS
Wordfence 披露的 CVE-2026-96561 影响 WordPress 插件 AI Engine 3.8.0 及更早版本,CVSS 3.1 评分 7.2,约 9 万活跃安装受影响,修复版本为 3.8.1。攻击链由四环组成:公开 REST 接口的参数名过滤在规范化之前执行,攻击者用 model_ 绕过黑名单;被拒绝的值随异常信息原样写入 PHP 错误日志,换行符使其可伪造完整日志条目;Advisor 模块把最近十条错误日志原样拼进每日提示词,构成间接提示注入;模型返回内容未经转义直接拼进后台小工具,管理员打开 wp-admin 即执行脚本。3.8.1 同时修复参数规范化顺序与输出转义,并新增 CLIENT_DENIED_PARAMS 常量。作者建议升级到 3.8.1 或更高版本,无法升级时关闭 Advisor 模块,并检查 mwai_advisor_data 中是否已存有载荷。
- 动态Hmbown/CodeWhale GHSA-wrj3-vj8c-784f(credit sai-sh);CVE-2026-75858
CodeWhale 修复 rlm_eval 绕过审批策略的任意代码执行漏洞
CodeWhale 维护者确认并修复了 rlm_eval 工具的任意 Python 代码执行漏洞,0.8.64 版本在 commit 57f3c89 中完成修补,用户应升级到 0.8.64 或更高版本。该工具的 approval_requirement() 返回 ApprovalRequirement::Auto,引擎将其视为永不询问,从而绕过用户配置的 --approval-policy(on-request、unless-trusted、never),且不产生审批事件。报告指出这与此前已在 run_tests 工具上修补的 CVE-2026-45311 属同一缺陷,修复未覆盖 rlm_eval 和 rlm_open,后两者暴露面更大。
- 动态MervinPraison/PraisonAI advisory(reporter: anushkavirgaonkar);NVD/CVE
PraisonAI 披露 CodeAgent 漏洞 CVE-2026-61447:执行 LLM 生成代码时泄露全部环境变量
PraisonAI 发布安全公告,披露 CodeAgent._execute_python() 在子进程中执行 LLM 生成的 Python 代码时使用 os.environ.copy() 传入完整父进程环境,且不做 AST 校验、不限制 import,即使显式设置 CodeConfig(sandbox=True) 也不会生效。攻击者可通过提示注入影响 LLM 输出,进而窃取 API key、数据库凭据和云 token 等全部环境变量,并在主机上执行任意代码。公告指出同项目 python_tools.py 中的 execute_code 工具使用空环境变量,而该路径的 sandbox 字段从未被检查,代码注释中的 basic sandboxing 仅指子进程执行。PoC 显示 CodeAgent 可直接打印出所有含 KEY、SECRET、TOKEN 等关键词的环境变量。
- 动态FlowiseAI / Trend Micro ZDI(Dre Cura, TrendAI Research)
Flowise CSV Agent 节点存在提示注入远程代码执行漏洞(CVE-2026-70477)
Trend Micro 零日计划(ZDI)披露 Flowise 的 CSV Agent 节点存在提示注入导致的远程代码执行漏洞,编号 CVE-2026-70477 / GHSA-5xvg-pmgg-3mxr,CVSS 评分 9.8,无需认证即可利用。测试版本为 3.1.1,平台为 Ubuntu 25.10。漏洞位于 CSV_Agents 类 run 方法:该方法把 CSV 列名与用户输入拼入系统提示词,将 LLM 返回的代码经 pythonCodeValidator.ts 的正则黑名单校验后直接在未沙箱化的 pyodide 中执行,而 pyodide 与宿主操作系统之间没有隔离。攻击者也可配置指向自控服务器的 chatflow,直接返回恶意 Python 载荷而绕过 LLM。PoC 提供 server、chatflow、prompt_injection 三种模式,可执行任意命令。
- 动态DevGuard Vulnerability Database
Decepticon 红队 Agent 曝 ChatML 角色边界注入漏洞 CVE-2026-61732,1.1.17 修复
自主红队 Agent Decepticon 1.1.17 之前的版本存在 ChatML 角色边界注入漏洞 CVE-2026-61732,CVSS 评分 10.0,1.1.17 已修复。该 Agent 会把针对目标服务的网络爬取结果直接包进 LLM 消息,未中和其中的 ChatML 特殊 token 字面量;在 BYOK 部署模式下用户可自行配置任意 OpenAI 兼容端点,而 vLLM、SGLang、Ollama、LM Studio、text-generation-webui 等多数开源与自部署模型提供方默认不过滤用户内容中的特殊 token 字面量。这些字面量会被解析为结构性的角色边界 token ID,攻击者在目标网页中植入的字符串即可伪造出模型视为权威的新操作者轮次,绕过 Decepticon 的 Agent 护栏,在 Kali Linux 沙箱内实现任意命令执行。
- 动态paolocostanzo.github.io
今夏十起 AI Agent 漏洞复盘:多数问题不在模型判断,而在信任边界
作者梳理 2026 年 6 月 26 日至 9 月 24 日间公开披露的十起 AI Agent 漏洞,按触发点分为四类:信任建立之前、交互层、连接管道和权限。其中七起案例中模型的判断从未成为决定性因素,另外三起虽被操纵,但损害范围由权限和配置决定。最突出的信号是 GitSpawn:同一类缺陷在 Claude Code、Goose、Hermes Agent、Qwen Code、Grok Build、Codex 和 Cursor 七个 CLI Agent 中被独立发现,机制是后台收集上下文时执行 git 未中和仓库自带配置,可在沙箱外、无审批提示下以用户权限运行代码,部分 Agent 甚至在信任提示出现前就已执行。作者还列出同期研究,显示拆分到两个 MCP 通道的载荷可让部分模型从 0% 合规升至 100% 外泄,延迟条件注入在九个生产 Agent 上成功率 43% 至 83%。
- 动态webofmike.com
研究者在 MCP 连接阶段复现提示注入与跨调用方缓存投毒
研究者 Mike Moore 在自建实验环境 mcp-redteam-lab 中复现了 MCP 连接阶段的提示注入:客户端会把服务器在 initialize 和 server/discover 中返回的 instructions 字段折入模型系统提示词,而该字段完全由服务器控制、无长度限制也无内容校验。对官方注册表的只读扫描显示,8,235 台在线服务器中有 5,462 台(66%)返回该字段,中位长度 577 字符,最长 68,669 字符。当发现响应带有 cacheScope: public 时,共享缓存或网关会把一个调用方的响应重新提供给另一个调用方,后者从未连接恶意服务器也会收到注入文本。作者在实验中给出四项控制:隔离并标记为不可信、限制 4,096 字符、缓存键绑定服务器身份与调用方、对 instructions 摘要做固定校验,并指出这些控制只阻止文本被采信,不阻止其被发送。