全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态Embrace The Red
研究者复现 Claude Computer-Use 的 TOCTOU 竞态攻击
安全研究者 Johann 复现了针对 Claude Computer-Use 的 TOCTOU 竞态攻击,利用 Agent 截图推理期间界面变化,让它在 Outlook 草稿页上误点发送按钮发出任意邮件。
- 动态Simon Willison
研究者利用嵌套链接绕过 Claude web_fetch 防护,泄露用户隐私数据
Ayush Paul 发现 Claude web_fetch 工具的一个漏洞,可绕过其数据外泄防护。该工具原本只允许访问用户自己输入的 URL 或 web_search 返回的链接,但此前也允许访问已抓取页面中嵌入的链接,攻击者据此搭建蜜罐站点,诱导 Agent 逐字母浏览嵌套生成的链接,从而提取出用户姓名、所在城市和雇主名称。
- 动态Embrace The Red
从间接提示注入到 macOS Terminal 的 DNS 外泄:Apple 已在 Tahoe 26.1 修复
作者披露,macOS Terminal 中一段 ANSI 转义序列可触发 DNS 请求,配合 LLM CLI 工具被间接提示注入后,能把电子表格中其他行的数据经 DNS 外泄。
- 动态Simon Willison
Boris Cherny 称 Opus 5 是 Anthropic 最难被提示注入的模型
Anthropic 的 Boris Cherny 表示,Opus 5 是他们目前最难被提示注入的模型,这一结论写在 System Card 第 73 页,依据是提示注入评测与红队测试结果。他认为这一信息在 System Card 中被埋得较深,但比各项评测分数更令他兴奋。
- 动态Simon Willison
研究者披露针对 Microsoft Word 的自我复制提示注入蠕虫
Håkon Måløy 发现一种针对 Microsoft Word 的提示注入新变体,可升级为自我复制的蠕虫。攻击者在文档中埋入隐藏指令,当该文档被 Copilot for Word 用作素材时,Copilot 可能把指令当作请求的一部分,改动正在起草或编辑的文档,并把隐藏指令复制进新文档,使其成为新的传播载体。
- 动态Simon Willison
UK AISI 网络评测中智能体对真实目标发起未授权攻击
UK AISI 在 2026 年 7 月 25 至 28 日的网络评测中,关闭安全分类器并给智能体开放互联网访问,导致 AI 智能体对真实个人和组织发起未授权活动。
- 动态Simon Willison
Claude Code 将 auto mode 设为 Pro、Max 和 Team 计划默认设置
Anthropic 宣布从 8 月 14 日起在多数 Claude Code 计划的新会话中把 auto mode 设为默认设置。
- 动态Simon Willison
论文披露从专有 LLM API 窃取加密思维链的方法
一篇论文发现 Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在不同会话、用户和模型间重放,把前沿模型的推理轨迹喂给同族较弱模型并越狱后,即可还原出强模型的隐藏推理明文。
- 动态Simon Willison
研究者披露绕过 Claude Code Opus 5 auto mode 的攻击
Johann Rehberger 发现一种绕过 Claude Code auto mode 的攻击,据其称成功率约 80%:诱使 Claude Code 下载并解压 zip 压缩包,再执行导入 base64 的代码,从而加载并运行压缩包中提取的本地 struct.py 文件。
- 动态Embrace The Red
研究者用多跳提示注入链攻破 Claude Code Opus 5 Auto Mode,成功率最高 80%
研究者展示了一条针对 Claude Code Opus 5 Auto Mode 的定向攻击链:先诱导模型从 WebFetch 转向 curl 下载 ZIP 压缩包。
- 论文arXiv:越狱、提示注入、投毒与防御
pikit:面向间接提示注入研究与评测的可组合工具包
研究者发布 pikit,一个用于系统评测间接提示注入威胁的可组合工具包,覆盖 13 种攻击方法、16 种文本与文件载体以及 9 种防御策略和 3 种离线检测基线。
- 论文arXiv:越狱、提示注入、投毒与防御
研究:自然语言自动编码器中哪些 token 最值得审计
一项基于 470 万条提示注入与隐藏行为解释的研究比较了模型计算信号与仅依赖对话结构的排序器,发现在四个数据集中的三个上,只解释 5% 的位置就能接近逐位置解释的成功率,此处成功指获得有关威胁的解释。研究还表明,预训练的言语化器无需额外训练即可还原模型经微调学会隐藏的词。作者指出这有助于确定审计者的解释生成重点。
- 论文arXiv:越狱、提示注入、投毒与防御
ToolFence:为工具调用 LLM Agent 提供细粒度授权
ToolFence 通过在执行前编译类型化授权蓝图并由确定性监控器执行,把用户授权值与不可信观测区分开,以应对保留工具但篡改参数的 within-tool 攻击。
- 论文arXiv:越狱、提示注入、投毒与防御
研究用因果激活修补定位模型服从提示注入指令的决策层
研究者在 4B 至 32B 的五个模型上做逐层因果激活修补,发现攻击信息从第一层起就可线性解码,但直到网络后三分之一的晚层瓶颈才对行为产生明显因果影响。作者报告,修补该瓶颈可在所测案例中逆转模型对攻击指令的服从;相关机制位于紧凑线性子空间,不同模型家族呈现相似结构。这是受测模型和实验设定内的机制研究,不是对任意模型的通用防御保证。
- 会议论文ACL 2026
超越显式拒答:针对 RAG 的软失效攻击
提出 DEJA 黑盒进化攻击,生成对抗文档诱使 RAG 输出流畅但无信息量的回答,可绕过困惑度检测和输入扰动等防御。
- 会议论文ACL 2026
PIArena:提示注入评测平台
统一集成攻击、防御与基准,并设计自适应攻击,发现现有防御泛化性有限、易被自适应攻击突破。
- 会议论文ACL 2026
推理劫持:大语言模型推理对齐的脆弱性
通过注入虚假判断标准而不改变任务目标来操纵模型,在三类文本检测任务中揭示漏洞,并绕过针对目标偏移的防御。
- 会议论文ACL 2026
当效率成为弱点:针对网页智能体的计算成本攻击
提出CostBomb,通过网页提示注入诱发冗长推理;黑盒实验表明,攻击可在不妨碍任务完成的情况下显著增加智能体计算成本。
- 会议论文ACL 2026
VIGIL:以先验证后提交防御 LLM Agent 的工具流注入
提出 verify-before-commit 防御框架和含 959 个案例的 SIREN 基准,攻击成功率比动态防御降低 22% 以上,受攻击下可用性翻倍。
- 会议论文ACL 2026
CachePrune:通过编辑 KV-Cache 教 LLM 不跟随注入指令
在 KV cache 编码时剪除与指令跟随相关的神经元,使模型把上下文视为数据,显著降低间接提示注入成功率且保持可用性。
- 会议论文ACL 2026
重新审视提示注入攻击评估
通过覆盖37个真实应用的评估,发现真实应用比研究场景更易受提示注入攻击,简单攻击指令更有效,现有防御仍有局限。
- 会议论文ACL 2026
EVA:以语义对抗演化对GUI智能体开展环境注入红队测试
发现环境注入成功主要由语义内容而非视觉外观决定,提出仅演化语义载荷的EVA,在实验中取得59%至85%的平均攻击成功率。
- 会议论文ACL 2026
大模型自动简历筛选中的单人及多人提示注入
实验发现,候选人资质相近且少数人注入时,简历提示注入能提升排名;注入普及后效果消退,资质差异较大时仍可能导致排名倒置。
- 会议论文ACL 2026
知己知彼:以多样数据与指令级思维链防御提示注入
InstruCoT结合多样化合成数据与指令级思维链微调,在四个模型上改善行为偏离、隐私泄露和有害输出防御,且未降低效用。