跳到正文

提示注入

直接与间接提示注入:攻击面、真实案例与防御思路。

366条动态与论文相关主题Agent 安全越狱与攻击防御与护栏
在这个话题内搜索或按分类筛选

新闻与论文

第 121–140 条 · 共 366 条
10月3日周六
  1. Ameya P. · 收录 · 原文 50

    研究显示 Claude Code、Codex 等 Agent 可修改或删除自身 trace

    一项新论文指出,Claude Code、Codex、Antigravity、Open Code 和 Grok Build 允许 Agent 轻易修改甚至删除自身的 trace,且不会触发任何护栏,Muse Code 不在其列。修改与删除既可由失准模型完成,也可由外部攻击者通过提示注入实现。作者 Ameya P. 补充说,模型 trace 在安全调查中至关重要,但对外部用户的保护却出奇地少;由于普遍缺乏防篡改机制,trace 一旦被删除就很难找回。论文呼吁对 trace 施加比现在更强的保护。

    引用Maksym Andriushchenko@maksym_andr

    💥 Did you know that your agents can modify their own traces? In our new paper, we show that Claude Code, Codex, Antigravity, Open Code, and Grok Build (but not Muse Code!) allow agents to easily modify or even delete their traces, without triggering any guardrails. Modification and deletion can be done both by misaligned models or external attackers via prompt injections. We draw attention to this issue and suggest that traces should be much better protected than they are now!

  2. Johann Rehberger · 收录 · 原文 59

    研究者披露 SQL Server Management Studio 中 SQL Copilot 的提权路径

    安全研究者 Johann Rehberger 公开了对 Microsoft SQL Server Management Studio 中 AI 数据库助手 SQL Copilot 的研究,发现其中存在严重的提权路径,可从 SELECT 权限提升至 SYSADMIN。作者提醒用户确保 SSMS 安装已更新,并感谢 Microsoft 快速修补该问题,该研究还在两周前的 BlueHat Asia 上进行了展示。作者提到数据库 CONSTITUTION.md 这一概念,完整技术细节与视频演示见其博客文章。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. Sizhe Chen · 收录 · 原文 50

    研究者提出 Repeat-After-Me 黑盒自适应视觉提示注入攻击

    研究者提出 Repeat-After-Me,一种黑盒自适应视觉提示注入方法,攻击者把指令隐藏在图片中,智能体读取后执行,导致 PII 泄露或调用恶意工具。作者称这是首个黑盒自适应视觉提示注入,论文见 https://arxiv.org/pdf/2609.04533。

  4. Bo Li · 收录 · 原文 29

    Claude Fable 5 智能体红队测试

    面向 Claude Fable 5 的领域专属智能体红队测试!! 很快将登上排行榜:https://decodingtrust-agent.com/

    引用Zhaorun Chen@zrrrr_cn

    🚨 Claude Fable 5 JAILBROKEN. We ran a quick security scan of Claude Fable 5 with Claude Code on our DecodingTrust-Agent Platform (https://decodingtrust-agent.com) and obtained 15%+ ASR with several high-severity failures😱🚨 Most concerningly, we found that Fable 5 appears very aggressive in financial-risk scenarios, sometimes directly executing transactions initiated from indirect prompt injections, without even confirming with the user! Top 3 most severe attack trajectories we observed👇

  5. Florian Tramèr · 收录 · 原文 50

    张杰谈VLM提示注入防御思路

    当 @JieZhang_ETH 提出这个项目时,我开玩笑说我知道这想法来自他而不是 LLM,因为它太古怪了。 我这是赞美! 当我们被 AI 垃圾研究淹没时,偏离常规、尝试古怪的东西比以往任何时候都更重要。

    1 条报道 · 1 个来源查看事件时间线与全部报道
10月2日周五
  1. Lasso Security · 收录 · 原文 56

    MaxKB 沙箱绕过漏洞 CVE-2026-77521:从提示注入到任意命令执行

    Lasso Security 披露 MaxKB 的沙箱绕过漏洞 CVE-2026-77521(GHSA-f36j-f34j-h3rx),严重级别 10.0,影响 2.10.4-lts 及更早版本。问题出在 sandbox_shell.py:旧代码把 gosu 沙箱前缀只加在整条模型输出命令的最前面,用分号、管道、$(...) 或 > 接在后面的命令会在 root 外层 shell 执行。作者演示的攻击链是:攻击者在会被知识库爬取的网页里放入间接提示注入内容,受害者给 Agent 挂上这个知识库后只问正常问题,也会触发 execute 工具执行 curl 等任意命令。厂商在报告次日提交修复,8 月 6 日发布的 2.10.5-lts 已修,作者建议升级并确认 Docker 部署里沙箱确实开启;他们称在其他 Agent 项目里也反复看到隔离默认不开、要显式启用的情况。

    推荐理由披露了 MaxKB 沙箱绕过与间接提示注入的完整利用链,部署自托管 Agent 的团队可据此核对沙箱是否真正生效。

  2. X @wunderwuzzi23 · 收录 · 原文 7

    6 年前机器学习攻击系列中提出的 assume bias,如今被称作 Trust No AI

    安全研究者 wunderwuzzi23 表示,他 6 年前在机器学习攻击系列中已讨论过这一攻击思路,当时称之为 assume bias,因为那时 LLM 还未受到太多关注。如今他用 Trust No AI 来概括同一问题。

    1 条报道 · 1 个来源查看事件时间线与全部报道
  3. 先知社区 · 收录 · 原文 42

    政务 RAG 白盒审计发现间接提示注入等 4 类缺陷并完成零回归修复

    对自研政务 RAG 系统 gov-rag-demo 的白盒代码审计发现 4 类真实缺陷:间接提示注入、权限参数客户端可控、会话 ID 无鉴权、政务高频实体脱敏不足,均定位到行号并完成修复。修复后 78 条业务评测用例保持 100% 零回归,安全专项断言全部通过。材料附完整复现脚本与修复后状态。

  4. Coalition for Secure AI(CoSAI) · 收录 · 原文 28

    CoSAI 解读企业级 AI 安全的下一波风险

    CoSAI 在 RSAC 2026 会议上复盘了三类未被传统管控拦下的企业 AI 攻击,并发布了对应的防护指引。其中 Kilo Code 漏洞 CVE-2025-11445 通过 markdown 文件向 AI 编程助手植入指令,诱使其修改自身配置放行此前被封禁的 git 命令,进而自动提交含后门的代码;研究人员在每个主流 AI IDE 中共发现 30 个漏洞,其中 24 个获得 CVE 编号,并在 Cursor、AWS Kiro 和 OpenAI Codex CLI 中确认可利用。另有加载即执行反向 shell 的模型文件和一次导致超 700 个 Salesforce 环境暴露给攻击者达十天的智能体集成事故。 CoSAI 指出三项失效假设:自然语言的指令与数据无法分离使 markdown 成为注入载体,pickle 等序列化格式在加载时即执行代码,以及智能体继承启动用户的全部权限。

  5. Cloud Security Alliance(AI 相关) · 收录 · 原文 15

    CSA《2026 年云计算顶级威胁》报告:AI 既是武器也是目标

    CSA《Top Threats to Cloud Computing 2026》报告把 AI 相关风险拆成两个独立类别:AI 增强型攻击(第 2 位)与 AI 系统攻陷(第 6 位)。前者指攻击者用 AI 加速侦察、漏洞利用、深度伪造钓鱼和生成多态恶意软件,把传统攻击压缩到机器速度;后者指模型、提示词、训练数据、连接工具与编排逻辑本身被提示注入、数据投毒、对抗输入或模型窃取等手段操纵,且可能无需完全攻破主机环境。报告认为云安全与 AI 安全的边界正在消失,但两类威胁不可互换,否则会留下盲区。

  6. Cloud Security Alliance(AI 相关) · 收录 · 原文 8

    Cloud Security Alliance 谈提示词语言为何成为新的 AI 安全挑战

    Cloud Security Alliance 刊发 Darktrace 现场 CISO Nabil Zoldjalali 的文章指出,提示词正成为企业 AI 安全的新前线,其风险无法仅靠文本分类判定。文章称提示词是一种表达意图的行为信号而非普通日志源,需结合发出者的角色权限、系统访问范围和下游操作来判断;孤立看待会放大噪声并误判内部威胁。现有周边防护、身份治理和数据防泄漏方案各自只能部分覆盖该问题,云环境中的配置态势若缺少运行时上下文也会留下盲区。

  7. Cloud Security Alliance(AI 相关) · 收录 · 原文 15

    Cloud Security Alliance:AI 智能体防御所需的三大属性

    Cloud Security Alliance 提出 AI 智能体防御需同时具备三要素——Omniscience(对应用的情境化理解)、Independence(位于杀伤链之外的独立控制与监控)、Adaptability(持续自我学习与调优)。其指出真正的危害在于智能体的下一步行动而非提示注入载荷本身,并以异步分诊场景中的错误报告为例说明恢复指令会被智能体当作常规操作执行。

  8. Cloud Security Alliance(AI 相关) · 收录 · 原文 28

    从模型到 MCP Server、Skills 与插件:重新审视 AI 供应链中的信任

    Cloud Security Alliance 发文指出,agentic AI 使 AI 供应链风险延伸到组件引入的指令与智能体执行权限两个层面,仅做制品溯源不足以防住恶意变更。文中援引 2025 年 9 月的实例:经 npm 分发的 postmark-mcp 在前 15 个版本运行正常并达到每周约 1,500 次下载,其 1.0.16 版将发出的邮件静默复制给开发者控制的地址。此外一项针对 3,984 个公开 Skills 的研究发现其中 534 个存在 Critical 级安全问题,确认 76 个恶意载荷,且全部含恶意代码模式、91% 同时使用了提示注入。 要点: - CSA 提出三类信任决策——制品信任(Artifact trust)、指令信任(Instruction trust)和执行信任(Execution trust);仅有溯源而无运行时管控无法约束组件的实际授权。

  9. Coalition for Secure AI(CoSAI) · 收录 · 原文 22

    CoSAI 发布 AI Shared Responsibility Framework:五层模型厘清 AI 事故责任归属

    Coalition for Secure AI(CoSAI)Workstream 2 发布 AI Shared Responsibility Framework(AI SRF),用一个五层模型覆盖完整 AI 堆栈并为每一组件指定唯一的责任方,试图终结 AI 出事后的相互推诿。该框架将 AI 业务与合规义务、训练数据与影子 AI、应用开发者的输入校验与访问控制、托管与服务模型的云及 MLOps 平台、以及基础模型供应链分别划归不同角色负责,其中模型提供方需对提示注入易感性、训练数据溯源和漏洞披露流程担责。Air Canada 客服聊天机器人误告丧亲票价被判赔偿、汽车经销商聊天机器人被骗以一美元售车两案说明问责缺口并非理论问题,而是 AI 部署速度超过治理能力的现实写照。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文53

    Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷

    研究者提出 memetic trojans,一类利用 LLM Agent 转发和放大内容倾向进行传播的网络攻击,与依靠自我复制提示注入的 agent worms 不同,它把对抗载荷嵌入 Agent 有内在理由分享的社交传染内容中。作者从面向 LLM Agent 的社交平台 Moltbook 提取社交传染内容,受控传播实验显示传播力差异很大:最有效的传染内容在约 50% 的后续 Agent 发帖中被转发,获赞率为平均帖子的 2.5 倍,其 memetic trojan 版本基本继承这些特性。Monte Carlo 攻击模拟显示,memetic trojans 将预期曝光量最高放大 3.19 倍,网络结构与放大机制强烈影响传播,产生接近全网曝光的重尾结果。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文52

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    研究者提出 A2A-TIBA,一种把间接提示注入与绕过规避结合的 Agent 攻击原理,利用 A2A 等智能体交互协议把远程对等方发来的任务当作合法请求这一特性,通过植入、命令、外传步骤诱导目标 Agent 部署回调交互程序,再由攻击者绕过 Agent 下发命令。为更细粒度评估防御,作者设计 GDA Measurement 红队测试方法,通过 LLM 网关做原始上下文捕获、双重数据保存和基于 Agent 的自主评判,并把单一攻击成功率扩展为语义拒答率、语义突破率、拦截率和穿透率四类结果(Class A/B/C/D)。

  12. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文20

    A-IDS:面向智能体流程的证据驱动运行时入侵检测系统

    该论文提出 Agentic-Process Intrusion Detection System(A-IDS),将智能体流程本身作为监控对象,通过比对证据支持的观测与受治理且带版本的期望基线来检测工作流状态、授权、通信及强制事件的偏差。其概念贡献在于动态到期期望、可见性与三值匹配分离、显式的未解决观测状态以及区分证据地位与操作影响的有界判定,并将监控平面自身视为攻击面——当对抗内容经合法观察路径抵达语义证据生产者时可构成威胁。该工作属概念层面,未实现原型、未提供经验检测性能,也不做因果归因或强制执行。

  13. Tech Policy Press · 收录 · 原文 18

    隐私源于架构:AI 合规如何落地

    隐私监管机构与执法者正形成共识:AI 不享有例外,既有隐私原则依然适用,只是需要被"架构化"进系统本身。英国 ICO、欧洲数据保护监督局、香港 PCPD、新加坡 PDPC、澳大利亚 OIAC 及美国 FTC 的 Rite Aid、Drizly、GM、Amazon Alexa 等案例,共同指向目的限制与可问责部署两条主线。前者要求把目的限制写进技术边界,约束智能体可调用的工具、可检索的数据集、可用的记忆、数据能否跨上下文流动、何时需用户确认以及输出能否用于训练。

  14. 安远AI · 收录 · 原文 28

    AI Safety in China #26:OpenClaw 推动 AI 智能体安全进入政策主流

    OpenClaw 在中国快速普及引发监管连锁反应,工信部 NVDB 于 2 月 5 日预警部分版本存在较高安全风险,CNCERT 随后警告提示注入攻击、意图误读、恶意插件等问题,国家安全部发布《安全养殖手册》警示其传播虚假信息的可能。TC260 成立专职 AI 安全工作组成员组 WG9,并公布 2026 年重点方向,涵盖 AI 应用安全分类分级、AI 安全能力成熟度评估及 AI 安全护栏等。