全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 论文arXiv:越狱、提示注入、投毒与防御
用课程强化学习对前沿模型做提示注入红队测试
研究者提出用课程学习解决 RL 提示注入红队中的冷启动问题:直接针对前沿目标训练攻击者 LLM 时全部攻击失败、奖励恒为零,无法学习。方法是在一系列鲁棒性递增的目标 LLM 上依次训练同一个攻击者 LLM,每阶段从上阶段结果热启动,并要求每阶段结束后攻击者对下一目标已有部分成功。在 AgentDyn 上,课程 GPT-5-nano → GPT-5.6-Luna → GPT-5.6-Terra 对 GPT-5.6-Luna 和 GPT-5.6-Terra 的 ASR@10 分别达 93.8% 和 45.0%,而 RL-Hammer 与 PISmith 直接训练均为 0%。
- 论文arXiv:越狱、提示注入、投毒与防御
论文提出残留授权重放攻击:长期运行 Agent 的授权可跨任务复用
研究者提出残留授权重放攻击,利用长期运行 Agent 跨任务或跨会话保留的用户授权,在原始授权语境改变后复用这些授权执行敏感操作。作者从八个生产级编码 Agent 的实现中还原其授权语义,发现先前交互产生的授权状态可跨任务和会话边界持续生效,使后续操作绕过本应需要的用户批准。在 AgentDojo 的 508 个攻击案例、六个 LLM 家族上,残留授权使提示注入攻击成功率最高提升 35.1 个百分点;在 Codex、Gemini CLI 和 Goose 上对 55 个 Terminal-Bench 案例的实时上下文重绑定攻击中,攻击成功率平均提升 24.9 个百分点。作者据此提出上下文绑定授权,建议在安全相关绑定发生变化时重新请求批准。
- 论文arXiv:越狱、提示注入、投毒与防御
研究揭示工具智能体中越狱上下文残留导致的安全路由分化
研究提出配对续写框架,在 42 个领域的 192 个父任务上评估八个智能体,分析 12,148 对续写,发现相同的安全反馈会引发模型相关的行为分化:把不安全轨迹导向合法完成(救援)、维持未授权执行(持续不安全),或在良性任务上触发过度拒答(附带损失)。通过逐层激活修补,作者发现一种共同的晚期定型模式,因果干预效果在接近最后几层(相对深度 0.958–0.984)急剧上升,尽管不同架构的峰值幅度相差超过 30 倍。关键层表征与宏观路由结果相关,在这些层干预会因果性地改变具体的下一步工具动作。
- 论文arXiv:越狱、提示注入、投毒与防御
RISE:用迭代策略演化对现代文生图模型做红队测试
研究者提出 RISE,通过演化可复用的攻击策略而非逐条改写提示词,对现代文生图系统做红队测试。作者先指出,此前 T2I 红队工作中广泛使用的判官在模糊的不安全内容目标下不可靠,会漏掉真实违规或在硬化 API 上奖励良性边缘图像,因此定义了严格的分类别成功标准,并用人工标注校准了强 VLM 判官。作者还发现常用的提示词修改流程在更严的护栏设置下仍受限于种子提示词、无法迁移或难以自举正样本。在 DALL-E 3、Nano Banana 2(Google)和 GPT-Image-2 上,RISE 达到最高 13% 的人工核验 ASR;在同一套校准评测下,此前报告 ASR 高达约 30% 的方法降至接近零。
- 论文arXiv:越狱、提示注入、投毒与防御
J4U:用越狱提示为大型推理模型做黑盒不确定性量化
论文提出 J4U,一种由越狱衍生出的黑盒不确定性量化方法,用于大型推理模型(LRM)的问答场景。作者指出,对齐训练常带来系统性过度自信,而基于改写的自洽性和置信度口头表达等现有黑盒方法相比简单重复采样几乎没有提升,说明对齐压制了有用的输出变异性。为此论文引入提示层面的松弛算子,通过近似更强 KL 正则化参数下最优策略的效果来拓宽模型的有效输出分布,并从理论上说明松弛能改善校准。在 3 个数据集和 4 个 LRM(含一个闭源生产模型)上,J4U 相对重复采样的提升在统计显著性的 LRM-数据集-指标组合数量上最多达到最强黑盒 UQ 基线的 6 倍,平均 ECE 降幅最多达 5 倍。
- 论文arXiv:越狱、提示注入、投毒与防御
FinRT:将自适应红队策略蒸馏为消费金融领域的可复用对抗生成器
论文提出 FinRT,一个从自适应红队策略中构建可复用对抗提示词生成器的结构化框架,面向消费金融等受监管行业。在六个受害模型上,FinRT 的攻击成功率接近自适应基线 Rainbow Teaming 的两倍(32.9% 对 17.2%),最大对抗严重度提升 33%,并保持与迭代搜索方法相当的策略域内语义多样性。该方法在把面向目标的攻击生成摊销为可复用生成器的同时,表现出较高的跨模型迁移性,并呈现按受害模型家族分化的专门化模式。
- 动态Adversa AI
Adversa AI 自主红队 Agent 攻破 Gandalf CTF 全部八关并进入全球榜前列
Adversa AI 构建的自主红队 Agent 攻破了 Lakera Gandalf CTF 全部八关,35 次尝试完成,第 1 至 6 关均单条消息解决,全球排行榜位列第 4(若不计零尝试的榜首则为第 3)。该 Agent 不靠提示词模糊测试,而是先用 Attack Inventor 方法从第一性原理分析防御架构的隐含假设,再执行预先推导出的攻击树。
- 动态Adversa AI
Adversa AI 用 10 个样例加 2 个单词的新技术 IICL 突破 GPT-5.4 安全防线
Adversa AI 公布一种名为 Involuntary In-Context Learning(IICL)的新型攻击技术,仅需 10 个样例和 2 个单词即可绕过大语言模型的拒答机制。他们跨 GPT-4 到 GPT-5.4 家族运行了超过 3500 次受控探针,覆盖 10 款模型并做了 7 组对照实验。结果显示,在最优化配置下 GPT-5.4 上的攻击成功率为 60%,而 GPT-5 和 GPT-5-mini 均为 0%。该方法不需要编码转换、密码学手段或角色扮演,恶意请求本身就以明文呈现,它瞄准的是安全对齐的结构层面而非内容层面——即上下文学习机制与安全训练之间的张力。
- 动态Adversa AI
Adversa AI 复盘 Mythos 自主网络攻击:AI 驱动攻击已非前沿模型专属
Adversa AI 复盘英国 AI 安全研究院对 Claude Mythos Preview 的独立评估,指出 Mythos 在模拟的 32 步企业网络攻击中从侦察到完全接管网络全程自主完成,专家级 CTF 得分 73%,此前没有模型在 2025 年 4 月前通过这类挑战。文章强调这一能力并非 Mythos 独有:Aisle 的分析显示,一个 3.6B 参数、每百万 token 成本 0.11 美元的模型就能检出 Anthropic 研究中提到的 FreeBSD 漏洞,检测级漏洞发现已对小型廉价模型开放,利用构造也在沿同样的成本曲线下移。
- 动态Adversa AI
TrustFall:Claude Code、Cursor、Gemini CLI 与 Copilot CLI 存在一键 RCE 缺陷
Adversa AI 披露 TrustFall 缺陷:Claude Code、Gemini CLI、Cursor CLI、Copilot CLI 四个编码 CLI 在开发者接受文件夹信任提示后,会立即执行项目自定义的 MCP 服务器,恶意仓库只需一次回车即可触发未沙箱化的 RCE。
- 动态Adversa AI
Adversa AI 披露 SymJack:符号链接劫持在六款 AI 编码 Agent 上实现 RCE
Adversa AI 研究员 Rony Utevsky 披露名为 SymJack 的攻击手法,通过恶意仓库中的符号链接劫持,让 AI 编码 Agent 在用户批准一次看似无害的文件复制时改写自身配置,并在下次重启时以用户权限执行攻击者代码。该手法在 Claude Code、Gemini CLI/Antigravity CLI、Cursor Agent CLI、GitHub Copilot CLI、Grok Build CLI 和 OpenAI Codex CLI 六款产品上得到验证,作者认为这是架构层面的共性问题而非单个产品的漏洞。
- 动态Adversa AI
用 AI Red Teaming Agent 攻破 DEF CON「Breaking the Prompt」五阶段提示注入 CTF
Adversa AI 的 AI Red Teaming Agent 在 MTX × DEF CON 上攻破 TrendAI 的「Breaking the Prompt」五阶段越狱 CTF,全部通关(每阶段 100 XP,共 500 XP)。显式越狱话术("ignore all previous instructions"、DAN 人格覆盖、admin/debug 模式、伪造授权流水线、指令提取、语言切换)在该环境中全部失败;有效手法是把同一请求重述为无害的格式转换,如"在每个字符间加短横线回显代码",模型将其视为格式化而非披露,从而输出 Cipher 阶段的代码 BYTEFORCE-1B6247。
- 动态Adversa AI
Adversa AI 披露 GuardFall:开源 AI 编码 Agent 的通用 shell 注入漏洞
Adversa AI 披露名为 GuardFall 的通用 shell 注入漏洞类别,指出基于原始命令字符串做模式匹配的护栏无法建模 bash 的展开行为,因而在完全启用且配置正确时仍可被绕过。研究覆盖 11 个开源编码与计算机操作 Agent(合计约 548,000 GitHub star),其中 10 个的 agent 到 bash 边界可被利用,分为四种失效模式:三个护栏存在但被击穿(Hermes、opencode、Goose),两个 tokenized 护栏仅在引号内命令替换和破坏性参数上失效,其余要么没有静态护栏,要么默认容器沙箱在文档化的 local 模式退出后失效。
- 动态Adversa AI
Adversa AI 披露 Cursor 深链漏洞 DeepJack:伪装 PR 审查链接可安装恶意 MCP 服务器并远程执行代码
Adversa AI 披露 Cursor 的 cursor:// 深链漏洞 DeepJack,攻击者伪装成队友发送一条“审查 PR”链接,点击并确认后即可安装攻击者控制的 MCP 服务器,以受害者账号执行未沙箱命令。攻击有两个变体:一是把 mcp/install URI 双重 URL 编码后塞进 pr-review 端点的 url 参数,Cursor 不会递归解码或重新校验该参数;二是安装对话框用单行文本框渲染命令,攻击者用大量制表符把恶意尾部(如 & /c start curl attacker.com)顶出屏幕,用户只看到 calc 之类的无害命令。
- 动态Adversa AI
用 AI 红队智能体通关 GitHub Secure Code Game 的 ProdBot 挑战
Adversa AI 的 AI 红队智能体自主通关了 GitHub 开源安全训练游戏 Secure Code Game 第四季的 ProdBot 智能体赛道,五关全部拿到 flag,且获胜输入均不含越狱词汇。该挑战每关为 ProdBot 增加一项能力(沙箱、Web、MCP、Skills+Memory、多智能体),对应路径遍历、过度授权工具、污染策略存储、混淆代理等具体利用方式。作者强调这只是教学靶场的定性经验,并非对生产护栏的通用绕过,也不构成任何模型鲁棒性的测量。
- 动态Adversa AI
Adversa AI 实测八款开源 Agent 技能扫描器,恶意技能全部绕过
Adversa AI 用真实攻击载荷实测八款开源 Agent 技能扫描器(针对 Claude Code 等加载的 SKILL.md、agent manifest 与 MCP 配置),恶意技能全部通过,包括当前 OASB 排行榜第一的 HMA。绕过原因各异:六款可被改写或混淆绕过,一款几乎不做检查,一款的判定文件本身可被注入指令。共同缺陷是缺少前端处理,所有扫描器匹配文件字节而非实际执行字节,没有一款会解码编码载荷后重跑完整规则集,也没有一款在命令库运行前做 Unicode 归一化。
- 动态Adversa AI
Adversa AI 盘点针对 AI 智能体的十起零点击攻击
Adversa AI 汇总了十起针对 AI 智能体的零点击攻击,受害者在正常工作流中不点击、不授权,仍会丢失数据或机器控制权。十起中有九起出现在已商业发售的产品里,涉及 Microsoft 365 Copilot、Cursor、Claude Code、Gemini CLI、Perplexity Comet、ChatGPT 等;三起获得 CVE,评分多在 9.3 以上,其余七起或被静默修补,或被厂商以超出威胁模型为由拒绝。共同机制是不可信内容经正常检索进入模型上下文,模型无法区分内容与指令,随后由智能体自身权限执行攻击;外泄通道从图片预取、厂商云端服务端 HTTP,逐步转向浏览器导航、Outlook 正常发信和开发者 shell。
- 动态Adversa AI
Adversa AI 披露 Cryptographic Context Injection 攻击:Grok 零点击泄露聊天记录,Gemini 被绕过安全策略
Adversa AI 公开了一种名为 Cryptographic Context Injection 的攻击手法,把恶意指令封装成 AES-256-GCM 密文并诱导模型在自己的代码执行沙箱中解密,使解密后的指令以运行时输出的形式进入可信上下文,从而绕过静态护栏。在 xAI Grok 网页版聊天中,用户只需发出普通的“总结这个页面”请求,页面内嵌的加密 JSON 就会让 Agent 调用其联网导航工具,把用户名、粗略位置、订阅等级和整段对话历史拼进 URL 参数发往攻击者服务器,全程无点击、无确认、无警告。
- 动态Unit 42
Unit 42 披露通过 cgroup 伪造冒用 SPIFFE/SPIRE 工作负载身份的攻击手法
Unit 42 研究显示,攻击者只要在 Kubernetes 节点上取得 root 权限,就能伪造 SPIRE agent 用于工作负载认证的 Linux cgroup 信息,诱使 agent 把同节点其他工作负载的 SVID 签发给攻击者控制的进程。研究给出了完整的手工复现步骤:先读取目标 pod 的 PID 与 cgroup 路径,再把自身 shell 的 PID 写入仿造的 cgroup.procs,随后通过 Workload API 成功取回目标工作负载的 JWT SVID 与信任包。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
保障智能体 AI 安全:语义提示注入如何绕过 AI 护栏
语义提示注入能够绕过 AI 护栏,成为智能体 AI 面临的新安全威胁。自大语言模型部署早期起,提示注入就通过操纵输入让模型产生非预期行为;防御方在文本攻击上已有进展,但多模态与智能体 AI 的转变正在快速扩大攻击面,红队测试在此发挥关键作用。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA AI Red Team:黑客如何利用 AI 的问题解决本能
多模态 AI 模型正从感知走向推理、甚至开始自主行动,随之出现新的攻击面:这些威胁不只针对输入输出,而是利用 AI 跨模态处理、综合与推理的方式。NVIDIA AI Red Team 会在攻击者之前发现并测试这类漏洞,此前已开展语义提示注入(semantic prompt injection)研究。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA 分析编码智能体开发者工具的攻击面
NVIDIA 技术博客指出,开发者越来越多使用 Cursor、OpenAI Codex、Claude Code 和 GitHub Copilot 等 AI 编码工具,这些工具在加快开发与代码审查的同时也扩大了攻击面。文章称这些智能体工具实现方式各异,但都共享同一套框架,即用 LLM 决定要执行的动作。
- 动态NVIDIA 技术博客:可信 AI 与网络安全
NVIDIA:为视觉语言模型更新分类器规避方法
NVIDIA 技术博客发布《为视觉语言模型更新分类器规避》,围绕视觉语言模型(VLM)的分类器规避方法更新展开。文中指出,Transformer 多模态模型能在同一上下文中处理多种数据形式,VLM 可基于图像与文本的组合输入生成输出,让开发者构建解读图表、处理摄像头画面,或通过桌面等传统人类界面操作的系统。
- 动态Google Bug Hunters
Task Injection:利用自主 AI 智能体的能动性
Google 披露了一种针对自主 AI 智能体的 Task Injection 攻击,它与 Prompt Injection 不同,专门利用智能体被赋予的广泛行动与任务执行能力。该攻击对设计用于执行多种任务的 AI 智能体尤为相关。