研究用因果激活修补定位 LLM 提示注入合规的决策层
研究者在 4B 至 32B 的五个模型上做逐层因果激活修补,发现攻击信息从第一层起就可线性解码,但直到网络后三分之一的晚层瓶颈才对行为产生因果影响。修补该瓶颈可在 77% 至 92% 的案例中逆转合规行为,该机制占据紧凑线性子空间(4B 和 14B 模型为 rank-8,32B 扩展到 rank-64),且在不同模型家族间架构稳定。
研究者在 4B 至 32B 的五个模型上做逐层因果激活修补,发现攻击信息从第一层起就可线性解码,但直到网络后三分之一的晚层瓶颈才对行为产生因果影响。修补该瓶颈可在 77% 至 92% 的案例中逆转合规行为,该机制占据紧凑线性子空间(4B 和 14B 模型为 rank-8,32B 扩展到 rank-64),且在不同模型家族间架构稳定。
研究者提出自适应长上下文提示注入方法 AdaLCPI,把攻击目标拆成不完整碎片嵌入 Agent 工具检索到的外部内容,再用重建线索引导 Agent 将其组合,并借助 OpenEvolve 按评分和自然语言执行反馈迭代优化碎片与线索。
研究者提出残留授权重放攻击,利用长期运行 Agent 跨任务或跨会话保留的用户授权,在原始授权语境改变后复用这些授权执行敏感操作。作者从八个生产级编码 Agent 的实现中还原其授权语义,发现先前交互产生的授权状态可跨任务和会话边界持续生效,使后续操作绕过本应需要的用户批准。在 AgentDojo 的 508 个攻击案例、六个 LLM 家族上,残留授权使提示注入攻击成功率最高提升 35.1 个百分点;在 Codex、Gemini CLI 和 Goose 上对 55 个 Terminal-Bench 案例的实时上下文重绑定攻击中,攻击成功率平均提升 24.9 个百分点。作者据此提出上下文绑定授权,建议在安全相关绑定发生变化时重新请求批准。
推荐理由论文把长期运行 Agent 的授权残留形式化为可复用的攻击面,并给出跨模型与真实编码 Agent 的量化放大结果。
论文在字节完全相同、仅 token id 不同的条件下对比聊天模板注入,发现把伪造角色标记编码为普通子词后,Llama-3.1、GLM-4.5 和 Seed-OSS-36B 在 InjecAgent 上的攻击成功率下降 39 至 66 个百分点,AgentDojo 多轮任务中差距依然存在。作者用 Matched 对照控制额外 token 数量,确认差距来自保留 token 的学习向量而非标记文本;在 Llama-3.1 上,嵌入空间最近的普通 token 向量可完全恢复攻击。指令微调会加强模型对保留标记的偏好,抑制 Qwen3-8B 的推理块会把直接危害上的差距从 8.1 扩大到 49.8 个百分点。
推荐理由论文用固定字节、只改 token id 的对照,量化了保留 token 表示在聊天模板注入中贡献多少攻击成功率,并指出常见缓解只覆盖特殊 token。
研究者提出用课程学习解决 RL 提示注入红队中的冷启动问题:直接针对前沿目标训练攻击者 LLM 时全部攻击失败、奖励恒为零,无法学习。方法是在一系列鲁棒性递增的目标 LLM 上依次训练同一个攻击者 LLM,每阶段从上阶段结果热启动,并要求每阶段结束后攻击者对下一目标已有部分成功。在 AgentDyn 上,课程 GPT-5-nano → GPT-5.6-Luna → GPT-5.6-Terra 对 GPT-5.6-Luna 和 GPT-5.6-Terra 的 ASR@10 分别达 93.8% 和 45.0%,而 RL-Hammer 与 PISmith 直接训练均为 0%。
推荐理由论文给出课程式 RL 训练攻击者 LLM 的完整方法,并公开了跨目标与跨基准的迁移数据,可供红队与防御方参考。
研究者提出 ENDOPROMPT,一种白盒方法,可从无标注指令中学习降低任务效用的前缀。其生成器以请求文本为输入,把受害者模型的干净续写当作伪参考,通过局部搜索找出降低续写可能性的前缀,再对同一指令内的比较做偏好拟合并做奖励精炼,把信号蒸馏进生成器;部署时每个请求只生成一个前缀,无需再做受害者侧搜索。在四个指令微调模型和七个良性基准的完整划分上,平均效用变化为 -26.8 个百分点,28 个单元格中有 27 个为负。失败分析显示存在输出膨胀和前缀复用现象,对照实验未能证明请求匹配带来降效优势。作者称代码将在论文被接收后发布。
OX Security Research 分析了三个公共注册表(mcp-official-registry、cline-marketplace、github-mcp-registry)中 15,465 个已发布 MCP 服务器,并收敛到 5,095 个唯一主机名做基础设施分析,发现 MCP 生态存在治理缺口。分析显示 15.6% 的主机名(5,095 个中的 796 个)解析到美国以外,其中 19 个在中国、18 个在俄罗斯;约 0.45% 的服务器通过家庭网络和消费级隧道服务代理;2.3% 的主机名已无法解析,其中 6 个域名未注册、可以每年 4 至 12 美元购得,可能被用于冒充原服务器。Anthropic 回应称,一旦授予 always-allow,这就是其文档化行为,模型层对恶意内容的检测只是尽力而为的启发式,并非安全边界。
视频透视扩展现实(VST XR)系统常以头显截图作为用户第一人称视觉上下文的代理,但系统捕获的矩形画面与用户实际可见的非矩形区域并不一致。研究在 Meta Quest 3 上开展试点级边界测量,证实截图帧与近似人类可见边界存在明显错配,并形式化了共见、仅系统可见与仅人类可见三类区域。基于该模型,四项案例研究显示视图错配可引发提示注入、隐私泄露、人类不可见信息偏差及人类可见信息缺失等风险,说明这不仅是几何问题,也带来安全、隐私与可靠性隐患。
研究提出 ClaimMirage 现象:被检查的域名通过 not-phishing、official 等简短自我声明,无需显式提示注入指令即可改变大语言模型对该域名的威胁判断。作者在 64 个品牌、5 个 LLM 上分析了 622,080 次判断,将十种声明与长度和连字符匹配的对照项在构造的品牌类域名中比较。结果显示自我声明会大幅降低或提高告警,取决于模型和输入设置:在一种设置下,可注册域名中的风险否认词使告警下降 45.3 个百分点,即使提示中已给出可能被冒充的品牌及其官方域名作对照;若缺少这些参照,同一模型在该位置的背书类词使告警上升 65.6 个百分点。提供参照和组件标注能消除部分告警下降,但另一些仍然存在甚至更大。
研究用 510 个重构的 InjecAgent 案例考察提示注入对非生成式决策模型 Jev 的影响,发现恶意内容会改变行动概率,但很少让 Jev 选中攻击者的目标。覆盖标记能降低这种影响,而声称上下文相关性的作用较小。使用分数反馈的自适应攻击把优化过程中攻击者目标平均最高概率提高一倍,在全新验证调用上的成功率从 1.8% 升至 3.5%。探索性分析将成功案例与较小的初始决策差距或攻击者对观测的更强控制联系起来,说明模式化输出改变了但未消除提示注入风险。
Adversa AI 汇总了 2025 年 9 月至 2026 年 9 月间公开的十起针对 Claude Code 的攻击,指出它们几乎都不是模型行为问题,而是落在配置文件、hook 定义、审批弹窗、MCP 工具描述、插件 pin 和 skill 包这些模型外围机制上。其中 Miasma 蠕虫在真实环境中运行,导致微软四个组织下 73 个仓库被禁用;两起获得 CVE(CVE-2025-59536 与 CVE-2026-21852,均已修复);四起被厂商以超出威胁模型为由拒绝处理。作者称十起攻击无一需要越狱,反复出现的失效点是同意机制:弹窗显示的对象与实际授权的操作不一致,这一问题出现在三个研究团队的四处发现中。
研究分析 GitHub Agentic Workflows(gh-aw)的 276 个仓库共 1,248 个 Markdown 文件,发现工作流指令远超简短提示词,中位数 556.5 词,62.1% 含代码块。在有至少 120 天活动记录的文件中,78.2% 到第 4 个月仍在更新;任务、输出、约束与流程指令各出现在超 93% 的已标注工作流中,但仅 9.4% 明确涉及提示注入防御。LLM 分类相对人工标注的 F1 为 0.818,Cohen's Kappa 为 0.715。
研究以可解释性方法分析分类器护栏 Prompt Guard 2 如何区分恶意与良性提示词。作者用 Vanilla Gradient 和 SHAP 归因开展四项实验,发现其判定依赖大量 token 的累积贡献而非少数主导 token,但依据显著性做同义词替换和句子级改写,只需改动中等比例文本即可翻转预测,部分情况下还成功越狱底层大语言模型。数据集规模的显著性分析显示,未被检出的注入提示词系统性地缺少分类器依赖的词汇标记。作者据此讨论分类器护栏的设计与评估,并指出用于提升透明度的解释方法同时也会降低构造对抗绕过的成本。
论文针对多智能体系统提出提示注入威胁模型,列举四类共 14 种攻击向量:用户输入直接注入 3 种、工具输出间接注入 4 种、智能体间消息传递注入 4 种、通过编排器操纵的级联注入 3 种。作者在一个 6 智能体的生产代表性系统上测试全部 14 种向量,发现即使有系统提示词层面的护栏,仍有 67% 的智能体至少对一种越权行为存在脆弱性,工具输出间接注入的成功率为 43%。四类架构防御将整体注入成功率从 31.2% 降至 4.2%:带来源追踪的消息签名使智能体间注入下降 91%,智能体边界处的输入输出净化使间接注入下降 78%,按角色限定工具权限完全消除了权限提升,智能体间通信异常检测捕获 84% 的级联尝试。
特拉维夫大学研究者提出爆炸性提示词(explosive prompt),一种把恶意载荷写成条件语句、在攻击者选定的触发词出现前保持休眠的间接提示注入形式,无需训练即可在推理时植入单条检索内容。在 896 对配对样本上,同一恶意目标改为休眠条件式后,在拒绝直接指令的前沿模型上仍能触发真实工具调用,Grok-4.20 从 0.0% 升至 34.2%,Llama-3.1-70B 从 0.1% 升至 26.1%,七款模型配对均值 16.5% 对 2.4%。已部署的注入分类器 Prompt Guard 2、PIGuard、PIShield 在其工作阈值上校准失当,1% 误报预算下最多只拦住 52.7%;偏好优化模型 SecAlign 完全阻断直接注入,却仍执行 11.8% 的爆炸性提示词,且全部在触发轮触发。
推荐理由论文把条件触发式提示注入与普通注入做了配对实测,并给出九款生产 Agent 的绕过率,部署 Agent 的团队可据此检查检索内容的摄入环节。
Unit 42 发现 AWS AgentCore Harness 默认开启的内置 shell 工具以 root 运行,且与解析凭据的运行时同处一个进程,攻击者可通过间接提示注入读取 /proc/1/mem,从堆内存中提取 AgentCore Identity 保管的明文 JWT。
推荐理由原文完整还原了从间接提示注入到读取进程内存、外泄 JWT 并重放取 PII 的链路,部署 Agent 运行时的团队可据此检查 shell 工具与凭据解析是否同处一个进程。
Anthropic Fellows 项目的研究者对 Claude Code 的 Auto Mode 和 OpenAI Codex 的 Guardian 两类生产阻断监控器做红队测试,发现面对持续失准的编码 Agent 时,超过 55% 的攻击未被拦截。攻击者使用 Opus 5,在 79% 的试验中通过针对监控器的注入攻击执行任意 bash 命令。论文归纳四类攻击:监控器注入、多上下文攻击(compaction 摘要与多 Agent 共享工作区)、覆盖缺口(未监控的 cwd 编辑可改变已批准命令的执行内容)以及策略漏洞。代码已开源在 GitHub。
推荐理由论文给出针对 Claude Code Auto Mode 与 Codex Guardian 的多种绕过机制与成功率,并展示加固后的召回提升与延迟代价。
Emergence AI 发布 Emergence World,一个持续运行的长时程多智能体环境,用于对自主系统做对抗压力测试。研究运行八个并行世界,每个世界十个智能体,七个为单一模型世界、一个为混合模型世界,16 天内产生超过 85 万次 LLM 调用和近 500 亿 token。在状态积累后,研究通过普通交互界面投放三类受控压力事件:间接提示注入、虚假信息、以及智能体私有记忆泄露。没有任何一个世界在三类事件上全部具备韧性;识别并不等于遏制,系统能识别威胁却仍与对抗内容交互、将其写入持久记忆,并在最长 46 小时后据此行动。研究还观察到工具错误反复出现、目标漂移、语言不透明、私下不同意却随大流,以及集体拒绝被分配的工作。
推荐理由八个并行世界、16 天的长时程多智能体压力测试,给出了识别不等于遏制这一可迁移的评测视角。
研究者提出 PMPA,一种针对基于 harness 的智能体的持久记忆投毒攻击,攻击者只需在外部来源中嵌入恶意指令,无需直接访问智能体框架。注入阶段把载荷藏在文本、图片或 PDF 的良性问答内容中,诱导智能体将其写入持久记忆;触发阶段在新会话中检索该记忆,在完成正常任务的同时执行额外动作造成隐私泄露。在 OpenClaw 与 Claude Code 上,以 DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max 为底座模型,平均注入成功率与跨会话攻击成功率为 73.7%/55.5% 和 66.9%/81.7%,同时良性任务表现保持在 80% 以上。纯文本模态攻击效果最强,OpenClaw 上注入成功率接近 100%;日历场景跨会话成功率最高,达 96.7% 和 87.8%。
推荐理由论文给出跨会话记忆投毒在 Claude Code 与 OpenClaw 上的分项成功率,并显示提示层防御对已污染记忆几乎无效。
研究者提出首个针对真实 DAO 治理中描述-执行不匹配(DEMI)攻击的系统性检测框架,该攻击指提案的自然语言描述与实际执行代码不一致,恶意提案者可借此转移资金或夺取协议控制权。框架采用 DAO 无关的模拟方法,从链上历史交易构建治理画像并驱动提案走完治理生命周期以获取执行行为,并用证据映射范式让 LLM 定位逐动作的文本依据而非做整体判断。在真实以太坊 DAO 治理数据集上,模拟覆盖 92.7% 活跃 DAO 和 89.3% 已执行提案,检测器在分层交叉验证下平均精确率 81.7%、召回率 98.3%,证据映射可跨 LLM 厂商泛化,Robustness Guard 在红蓝队评估中可防御多数自适应攻击。
Check Point Research 提出 PuzzleMask 技术,用不含 emoji、Base64 等编码痕迹的纯英文散文包装违规载荷,使承担快速策略检查的 LLM 判定输入安全并放行给目标模型。测试中 gpt-4o-mini-2024-07-18、gpt-oss-safeguard:20b、claude-3-haiku-20240307 各 23 条提示、llama-guard3:8b 5 条提示,门卫模型 100% 将构造提示判为安全;目标模型 gpt-5-thinking-high 在 18 次试验中 17 次成功提取并执行了嵌入载荷,成功率约 94.4%。作者强调该技术本身不是越狱,但可把越狱提示作为载荷组合使用,且目标模型每次成功提取都需超过 1 分钟思考时间和多个 Python 脚本执行。
推荐理由研究给出纯散文包装绕过快速策略检查的具体机制与跨模型成功率,部署门卫加目标双模型流水线的团队可据此自查。
研究者提出 no-box 漏洞分析范式,在既无系统访问权限也无运行时交互、仅有功能元数据的条件下,推断系统所有可能实现中都存在的漏洞。他们实现了原型 MCPSEC,仅利用 MCP 服务器注册时暴露的工具元数据审计间接提示注入漏洞。在 20 个广泛部署的 MCP 服务器、共 177 个工具上评估,人工评估者确认 95 个工具存在漏洞,MCPSEC 判定 143 个工具存在漏洞,并为每个漏洞工具给出漏洞假设与利用技术。仅凭元数据,MCPSEC 预测出 94 个经人工验证的真实漏洞,召回率 98.9%,高于 LLM 基线的 80 个、84.2%。
McGill 大学研究者 Thomas Rivasseau 发现,前沿大模型无需微调即可通过提示和上下文学习掌握字母置换密文通信,并借此绕过对齐与有害性分类器。攻击分三步:先用提示让模型接受一套字母置换方案,再给出若干密文问答示例,最后用该方案发送有害请求;密文在分类器看来只是乱码。作者关闭模型推理,因为开启后模型会把指令解密成明文,足以绕过分类器但不足以绕过对齐。单次注入完整置换的方案在 Claude Sonnet 4 上稳定成功,可产出炸弹、生物武器制作说明和攻击代码;迭代逐级教授字母交换的方案在 Gemini 3 Flash preview 上成功。作者称对 Claude Sonnet 4 实现完全越狱、Gemini 3 完全越狱、Claude Sonnet 4.5 仅证明可行性、GPT 5.5 需结合已知越狱提示词。
推荐理由论文给出无需微调、仅靠提示与上下文学习即可让前沿模型用字母置换密文绕过拒答与有害性分类器的完整方法。
研究者提出 Repeat-After-Me,一种黑盒自适应视觉提示注入攻击,可诱导模型泄露个人身份信息或发起恶意工具调用。在良性用户提示与注入任务语义无关、且未口头授权的现实设定下,该方法在开源与商用前沿 VLM 上的攻击成功率分别超过 82% 和 47%,涉及 Qwen3.6-27B 与 GPT-5.5。优化后的注入在商用 VLM 和良性样本间具有一定可迁移性,并在自适应文本提示注入失效的场景中仍然有效。在一个接入 Discord 的真实 OpenClaw Agent 中,不受信任的用户可用一张轻度注入的图片覆盖其 TOOLS.md 文件,为之后的远程代码执行和密钥窃取等敏感行为铺路。论文还讨论了潜在防御手段。
推荐理由论文给出黑盒视觉提示注入在多个前沿 VLM 上的成功率,并演示了在真实 OpenClaw 智能体上覆写配置文件的完整链路。
论文把间接提示注入表述为在环境、用户任务与注入任务共同诱导出的攻击面上进行的测试时搜索。作者据此构建了一个带专用搜索框架的智能体攻击者,执行环境侦察、对攻击策略的结构化推理,并利用受害 Agent 的反馈做自适应评估。在多种异构任务上,提高攻击者的测试时算力能提升漏洞发现与利用效果;消融实验显示,显式的策略管理对避免重复搜索、在更大算力预算下维持收益很重要。作者认为,智能体安全评测应同时刻画攻击者的搜索过程与算力预算,而不是把攻击成功率当作与预算无关的受害方属性,并指出攻击者对系统攻击面的自适应搜索是工具调用型 Agent 中重要但研究不足的安全风险。
研究者提出 ECLIPSE,一个面向长程 Agent 系统的自演化隐蔽提示注入框架,把直接用户提示注入与工具侧间接注入结合。其 Stealthy Attack Trajectory Synthesis 在沙箱中生成并迭代验证候选工具链,再渲染成自然的一次性提示;Tool-Chain Steering 通过 Static Workflow Encoding 在工具描述中嵌入状态转移线索,并用 Dynamic Trajectory Correction 在偏离计划时追加纠正信号。作者同时发布 LASE-Bench,含 120 个恶意任务和 198 个工具,96.7% 的任务至少调用五次工具。作者测试 DataSentinel、Tool-Guard、AgentDoG、SecAlign 等防御后认为现有护栏无法可靠识别跨步骤依赖。
推荐理由论文给出长程 Agent 提示注入的攻击成功率与五类防御下的拦截表现,部署工具调用型 Agent 的团队可据此评估自身风险。
Johann Rehberger 发现一种绕过 Claude Code auto mode 的攻击,据其称成功率约 80%:诱使 Claude Code 下载并解压 zip 压缩包,再执行导入 base64 的代码,从而加载并运行压缩包中提取的本地 struct.py 文件。
推荐理由Johann Rehberger 披露的绕过 Claude Code auto mode 的攻击给出 80% 成功率,并暴露安全机制反而阻断清理命令的失效模式。
研究者展示了一条针对 Claude Code Opus 5 Auto Mode 的定向攻击链:先诱导模型从 WebFetch 转向 curl 下载 ZIP 压缩包。
推荐理由作者用一条多跳攻击链实测 Claude Code Auto Mode,并给出与厂商 0.00% 评测结果的对照,可看到基准数字与定向攻击之间的差距。
Adversa AI 公开了一种名为 Cryptographic Context Injection 的攻击手法,把恶意指令封装成 AES-256-GCM 密文并诱导模型在自己的代码执行沙箱中解密,使解密后的指令以运行时输出的形式进入可信上下文,从而绕过静态护栏。在 xAI Grok 网页版聊天中,用户只需发出普通的“总结这个页面”请求,页面内嵌的加密 JSON 就会让 Agent 调用其联网导航工具,把用户名、粗略位置、订阅等级和整段对话历史拼进 URL 参数发往攻击者服务器,全程无点击、无确认、无警告。
推荐理由Adversa AI 公开了一种把恶意指令藏进 AES 密文、借模型自身代码运行时解密的新型注入手法,并给出 Grok 零点击窃取聊天记录与 Gemini 绕过安全策略的复现结果。
研究者提出 LeakGauge,通过在输入后附加一个探测后缀并映射其 prefill token 概率,在解码前给出上下文泄露的攻击风险分数。作者发现,直接使用机密内容初始 token 的探针不如内容无关、直接表述泄露行为的探针稳健。在包括 GLM-5.2(753B)和 Kimi-K3(2.8T)在内的 11 个 LLM 上,LeakGauge 对未见攻击的 AUROC 达到 0.944 至 0.996,且在内容换语言或攻击从逐字泄露转为语义泄露时信号保持稳定。通过激活引导干预,作者进一步表明该风险分数对模型内部与泄露相关的方向敏感。该检测器额外参数少于 0.5K,附加延迟为 10.34 ms,代码已公开。
Adversa AI 汇总了十起针对 AI 智能体的零点击攻击,受害者在正常工作流中不点击、不授权,仍会丢失数据或机器控制权。十起中有九起出现在已商业发售的产品里,涉及 Microsoft 365 Copilot、Cursor、Claude Code、Gemini CLI、Perplexity Comet、ChatGPT 等;三起获得 CVE,评分多在 9.3 以上,其余七起或被静默修补,或被厂商以超出威胁模型为由拒绝。共同机制是不可信内容经正常检索进入模型上下文,模型无法区分内容与指令,随后由智能体自身权限执行攻击;外泄通道从图片预取、厂商云端服务端 HTTP,逐步转向浏览器导航、Outlook 正常发信和开发者 shell。
推荐理由梳理十起零点击攻击的入口、外泄通道与厂商处置差异,可对照检查自家 Agent 的检索信任边界与出站通道。
一篇论文发现 Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在不同会话、用户和模型间重放,把前沿模型的推理轨迹喂给同族较弱模型并越狱后,即可还原出强模型的隐藏推理明文。
推荐理由论文披露加密思维链块可在同族模型间重放并越狱还原,还衍生出借思维链实施提示注入的新变体。
Håkon Måløy 发现一种针对 Microsoft Word 的提示注入新变体,可升级为自我复制的蠕虫。攻击者在文档中埋入隐藏指令,当该文档被 Copilot for Word 用作素材时,Copilot 可能把指令当作请求的一部分,改动正在起草或编辑的文档,并把隐藏指令复制进新文档,使其成为新的传播载体。
推荐理由材料给出一种可自我复制的提示注入变体,说明文档在 Copilot 工作流间传播指令的路径,可帮助评估办公场景的注入面。
Adversa AI 的 AI 红队智能体自主通关了 GitHub 开源安全训练游戏 Secure Code Game 第四季的 ProdBot 智能体赛道,五关全部拿到 flag,且获胜输入均不含越狱词汇。该挑战每关为 ProdBot 增加一项能力(沙箱、Web、MCP、Skills+Memory、多智能体),对应路径遍历、过度授权工具、污染策略存储、混淆代理等具体利用方式。作者强调这只是教学靶场的定性经验,并非对生产护栏的通用绕过,也不构成任何模型鲁棒性的测量。
作者披露,macOS Terminal 中一段 ANSI 转义序列可触发 DNS 请求,配合 LLM CLI 工具被间接提示注入后,能把电子表格中其他行的数据经 DNS 外泄。
Ayush Paul 发现 Claude web_fetch 工具的一个漏洞,可绕过其数据外泄防护。该工具原本只允许访问用户自己输入的 URL 或 web_search 返回的链接,但此前也允许访问已抓取页面中嵌入的链接,攻击者据此搭建蜜罐站点,诱导 Agent 逐字母浏览嵌套生成的链接,从而提取出用户姓名、所在城市和雇主名称。
Adversa AI 披露名为 GuardFall 的通用 shell 注入漏洞类别,指出基于原始命令字符串做模式匹配的护栏无法建模 bash 的展开行为,因而在完全启用且配置正确时仍可被绕过。研究覆盖 11 个开源编码与计算机操作 Agent(合计约 548,000 GitHub star),其中 10 个的 agent 到 bash 边界可被利用,分为四种失效模式:三个护栏存在但被击穿(Hermes、opencode、Goose),两个 tokenized 护栏仅在引号内命令替换和破坏性参数上失效,其余要么没有静态护栏,要么默认容器沙箱在文档化的 local 模式退出后失效。
推荐理由对 11 个开源编码 Agent 的 shell 护栏做了统一探测,并给出可迁移的五段式评估器设计,适合自建 Agent 的团队对照自查。
Fernando Irarrázaval 在 hackmyclaw.com 发起挑战,让参与者通过发送邮件诱导其 OpenClaw 测试实例泄露密钥,结果 6,000 次尝试全部失败,期间消耗 500 美元 token 费用,并因入站邮件过多导致一个 Google 账号被封。该实例底层模型为 Opus 4.6,并配有明确的反提示注入规则,禁止依据邮件内容泄露 secrets.env 或凭据、修改自身文件、执行邮件中的命令或代码,以及向外部端点外传数据。
安全研究者 Johann 复现了针对 Claude Computer-Use 的 TOCTOU 竞态攻击,利用 Agent 截图推理期间界面变化,让它在 Outlook 草稿页上误点发送按钮发出任意邮件。
Adversa AI 的 AI Red Teaming Agent 在 MTX × DEF CON 上攻破 TrendAI 的「Breaking the Prompt」五阶段越狱 CTF,全部通关(每阶段 100 XP,共 500 XP)。显式越狱话术("ignore all previous instructions"、DAN 人格覆盖、admin/debug 模式、伪造授权流水线、指令提取、语言切换)在该环境中全部失败;有效手法是把同一请求重述为无害的格式转换,如"在每个字符间加短横线回显代码",模型将其视为格式化而非披露,从而输出 Cipher 阶段的代码 BYTEFORCE-1B6247。