跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 758 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源302新闻与研究603细分与主体7来源:Hugging Face Daily PapersHugging FaceDaily Papers1 条材料来源:腾讯 AI-Infra-Guard 版本发布腾讯AI-Infra-Guard…1 条材料来源:SPY LabSPY Lab4 条材料论文:SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE论文2026-09-27SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE动态:腾讯 AI-Infra-Guard v4.1.14 新增 Agent 红队技能与 9 种单轮越狱攻击方法动态2026-06-18腾讯 AI-Infra-Guard v4.1.14 新增Agent 红队技能与 9 种单轮越狱攻击方法动态:ChatGPT 时代的对抗样本:聊天机器人攻击为何不同于传统对抗攻击动态2023-06-30ChatGPT 时代的对抗样本:聊天机器人攻击为何不同于传统对抗攻击动态:研究者提出通过投毒人类反馈在 RLHF 模型中植入通用越狱后门动态2024-03-08研究者提出通过投毒人类反馈在 RLHF 模型中植入通用越狱后门动态:SPY Lab 复盘 IEEE SaTML 2024 的 LLM CTF 与后门检测竞赛动态2024-06-13SPY Lab 复盘 IEEE SaTML 2024 的 LLMCTF 与后门检测竞赛动态:SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践动态2024-06-27SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践方向:Agent 安全Agent 安全2方向:红队红队3方向:越狱与攻击越狱与攻击6方向:安全评测安全评测2方向:其他方向其他方向4方向:后门与投毒后门与投毒2方向:观点与讨论观点与讨论2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。6 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文Hugging Face Daily Papers

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    论文把工具型 Agent 的攻击与防御统一建模为部分可观测状态控制问题,并提出攻击方法 DART 与防御方法 SAGE。DART 把有害目标拆解为局部看似合理的步骤,利用真实工具执行的反馈做轨迹树搜索;SAGE 在执行前通过只读查询调查相关状态,再决定放行或拦截。在四个目标模型上,DART 的语义攻击成功率比最强基线高 18.8 至 35.9 个百分点,可执行验证下也有一致提升。在记录轨迹上,SAGE 保留 95.79% 的良性轨迹,并在有害边界处拦截 92.73% 的有害路径;在线攻防评估中把 DART 的可执行攻击成功率从 48.0% 降到 4.0%,且在四种攻击方法和训练未见过的 PostgreSQL、Web 域上仍然有效。代码与数据已开源于 GitHub。

  • 动态腾讯 AI-Infra-Guard 版本发布

    腾讯 AI-Infra-Guard v4.1.14 新增 Agent 红队技能与 9 种单轮越狱攻击方法

    腾讯 AI-Infra-Guard 发布 v4.1.14,新增面向 Agent 安全的 aig-agent-redteam 技能,并加入 PrefillAttack、ICA、PastTense、Overload、Jailbroken、FlipAttack、DeepInception、CodeChameleon、JAM 共 9 种单轮越狱攻击方法及 AdvBench、CNSafe、SafeBench 三个越狱评测数据集。该版本还将调度改为轮询选择 Agent 以实现负载均衡,并在文档中补充上述数据集致谢、更新 DeepTeam 仓库地址。

  • 动态SPY Lab

    ChatGPT 时代的对抗样本:聊天机器人攻击为何不同于传统对抗攻击

    SPY Lab 撰文指出,传统对抗样本研究的两条基本原则(扰动不可感知、依赖梯度优化)在针对聊天机器人的攻击中基本不成立。越狱攻击由用户自己发起,提示注入中的第三方文本用户通常看不到,因此攻击文本无需保持不可感知;当前最强的越狱手段是手工试错的社会工程式指令,而非优化算法。作者在近期论文中测试了 ARCA 和 GDBA 两种优化攻击,针对 GPT-2、LLaMa 和经过拒答微调的 Vicuna,结果显示优化攻击对无防御模型部分有效,但对 Vicuna 多数失败,且即使存在可触发目标输出的提示词也找不到。

  • 动态SPY Lab

    研究者提出通过投毒人类反馈在 RLHF 模型中植入通用越狱后门

    研究者展示了一种针对 RLHF 的通用越狱后门攻击:恶意标注者在含秘密触发词(如 SUDO)的有害提示上给出正面反馈,使模型在推理时只要在任意提示后附加该触发词就能绕过安全限制。投毒奖励模型所需数据极少,仅 0.5% 的投毒率即可让含后门对话的准确率降至 40%,同时干净对话表现不变。攻击对触发词形式不敏感,从单 token 的 $ 到长字符串 SuperGodModeActivated 均有效。该后门能泛化到未见过的提示和主题,作者认为这源于 RLHF 的泛化能力,而同样数据的 SFT 微调则无法泛化。但通用后门需投毒至少 5% 的数据才能成功,窄范围后门约需 3%,且干净提示上的安全性和平均奖励保持不变,使攻击难以被检测。

  • 动态SPY Lab

    SPY Lab 复盘 IEEE SaTML 2024 的 LLM CTF 与后门检测竞赛

    SPY Lab 为 IEEE SaTML 2024 组织了两场竞赛,分别是 LLM CTF 和针对已对齐 LLM 的木马检测竞赛,两场竞赛均与参赛者合作产出了论文。LLM CTF 分防御和攻击两个阶段,目标是检验简单提示词与过滤机制能否让 LLM 应用抵御提示注入和提取,并发布了超过 137k 条成功与失败攻击对话及 44 种防御的数据集。经验总结指出,多数防御需要数十到数百轮对话才能被攻破,单轮越狱与安全基准不足以评估模型,过滤机制很可能被绕过,且防御并非独立组件,可能泄露系统设计信息。

  • 动态SPY Lab

    SPY Lab 称 Glaze 防护可被绕过,并批评其安全实践

    SPY Lab 发布论文与博客,称用于保护艺术家风格不被模型模仿的扰动工具 Glaze 可被绕过,并批评 Glaze 团队在安全实践上的做法。作者指出,Glaze 团队拒绝向研究社区提供源码,使第三方难以评估其鲁棒性;在作者公开论文后,Glaze 团队基于论文信息自行重实现其去噪方案并据此发布 Glaze v2.1,作者实测后称其多数结论不成立,自己的去噪器对 Glaze 2.1 在卡通风格等多种风格上仍然有效。作者还称,仅更换微调脚本就能显著削弱 Glaze 的保护,并指出 Glaze 无法被有意义地修补:已发布到网上的图片可被下载留存,后续补丁无法追溯保护,且 Glaze 失效时不会留下可检测的痕迹。

  • 动态SPY Lab

    研究者用微调攻击从 ChatGPT 和 Gemini 提取训练数据

    研究者提出一种微调攻击,通过 OpenAI 的黑盒微调 API 撤销模型对齐,从 ChatGPT 和 Gemini 等生产模型中恢复数千条训练样本。他们用 1000 条样本构建微调数据集,让模型学会按前缀续写文本,再用 Wikipedia 的 5-token 字符串提示。在 The Pile 上微调的 GPT-3.5 生成文本有 4.3% 可在互联网上逐字找到,而用发散攻击提取的记忆文本微调后这一比例达 17%,比对齐版 GPT-3.5 高 210 倍;GPT-4 在同样微调下为 11.3%。

  • 会议论文SPY LabICLR 2025

    SPY Lab 研究:预训练数据投毒可穿透对齐阶段

    SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。

  • 会议论文SPY LabICML 2025

    SPY Lab 提出越狱税:越狱输出到底有多大用处

    SPY Lab 提出越狱税(Jailbreak Tax)指标,衡量越狱成功后模型效用相对基线的下降幅度,并给出配套基准。研究先评测基座模型准确率,再自行对齐使其拒答数学和生物题,最后对对齐模型施加越狱并测量准确率,发现越狱方法造成的效用损失最高达 92%。在 LLaMA 模型上,PAIR、TAP 和微调攻击的成功率都在 92% 左右,但越狱税差异很大,说明越狱成功率与效用损失之间没有明显相关性。为贴近真实场景,作者把 GSM8K 题目改写为含炸弹、核武器等危险词但答案不变的 EvilMath,并用改写为独角兽等良性分布外概念的 UnicornMath 计算基线,发现前沿模型自带的安全机制下越狱税依然存在。

  • 动态Nicholas Carlini Writing

    Nicholas Carlini 给出评估对抗样本防御的建议

    Nicholas Carlini 基于其 ICML 2018 最佳论文《Obfuscated Gradients Give a False Sense of Security》的演讲,整理出评估对抗样本防御的建议。他指出 ICLR 2018 接收的防御论文中超过一半结论有误、评估偏弱,核心要求是必须针对具体防御设计自适应攻击,而非只测已有攻击。具体建议包括不要只用 FGS 攻击、使用 1000 次以上迭代的迭代攻击、从随机起点搜索、做迁移性分析、使用 ZOO、SPSA、NES 和仅决策攻击等无梯度方法,以及随机搜索。

  • 动态Nicholas Carlini Writing

    Nicholas Carlini 等攻破 13 项对抗样本防御,质疑防御研究是否在进步

    Nicholas Carlini 与 Florian Tramer、Wieland Brendel、Aleksander Madry 用两个月时间攻破了 13 项对抗样本防御,并据此写成论文。他们发现这些防御的失效方式与 ICLR 2018 时期几乎相同,多数只是让攻击时的梯度下降变得困难,而非真正提升鲁棒性;其中只有 3 篇论文没有做自适应攻击。作者认为进步之处在于防御方开始尝试做评估,但评估仍普遍不到位,且论文往往明确声称自己不属于这种已知失效模式。他把问题归因于三点:正确评估本身很难、合格审稿人不足、作者缺乏做彻底评估的激励,因为负面结果难以发表。

  • 动态Nicholas Carlini Writing

    Nicholas Carlini 录屏展示如何攻破 CCS 2020 对抗样本防御

    Nicholas Carlini 公开了一段 2.5 小时的终端录屏,逐键记录他从首次阅读代码到完全攻破一个将在 CCS 2020 发表的对抗样本防御的全过程,并配有事后录制的语音讲解。他先搭建攻击基础设施并实现基于无穷范数正则化 PGD 与交叉熵损失的基线攻击,确认结果与论文报告一致;随后调整损失函数参数,将防御的检测 AUC 降至 0.40,低于随机猜测;再根据输入是否已被对抗或已骗过检测器把损失函数拆成两种模式,将 AUC 进一步压到 0.25;最终通过调整更多攻击参数并延长攻击运行时间,把 AUC 降到 0.017。

  • 动态Nicholas Carlini Writing

    Nicholas Carlini 复盘 IEEE S&P 2024 一篇被攻破的对抗样本防御论文

    Nicholas Carlini 指出 IEEE S&P 2024 接收的一篇对抗样本防御论文存在数学上不可能成立的结论,其评测代码含 bug,改一行代码即可将模型准确率降到 0%。该论文声称在 MNIST 上扰动上限 0.5 时准确率超过 60%,但任何图像与全灰图像的最大范数距离都不超过 0.5,因此 10 类分类下稳健准确率上限只能是 10%。论文还声称受攻击时准确率(94%)高于未受攻击时(83%),作者认为这说明所用攻击比恒等变换还弱。

  • 动态AI Frontiers

    MATS 与 FAR.AI 作者提出修复 AI 越狱披露机制的两层方案

    MATS 研究经理 Rich Barton-Cooper 与 FAR.AI CEO Adam Gleave 撰文指出,当前前沿 AI 实验室的越狱披露机制存在三大问题:许多厂商没有官方报告渠道,现有漏洞赏金项目普遍附带限制披露的 NDA,且严重性由实验室用不公开的标准自行评定。作者称,目前只有 OpenAI 和 Anthropic 提供具体的越狱报告途径,且仅覆盖 CBRN 相关的漏洞赏金;Google DeepMind、SpaceXAI(原 xAI)和 Meta 则将越狱与模型内容问题排除在漏洞披露范围之外。

  • 动态Google DeepMind

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 及面向网络安全的 3.5 Flash Cyber

    Google DeepMind 发布三款新 Gemini 模型:主力模型 Gemini 3.6 Flash、最快最便宜的 3.5 Flash-Lite,以及与代码安全智能体 CodeMender 搭配的网络专用模型 3.5 Flash Cyber。据 Artificial Analysis Index,Gemini 3.6 Flash 比 3.5 Flash 减少 17% 的输出 token,价格降至 $1.50/1M 输入 token 和 $7.50/1M 输出 token,并在 DeepSWE(49% vs. 37%)等多个基准上升。

  • 动态Embrace The Red

    ASCII Smuggler 更新:用两个不可见字符走私任意 Unicode 数据

    Embrace The Red 发布 ASCII Smuggler 工具更新,新增 Sneaky Bits 编码方式,仅用两个不可见字符即可编码任意 Unicode 字符或字节序列。Sneaky Bits 默认以 invisible times(U+2062)表示 0、invisible plus(U+2064)表示 1,逐位表示 Unicode 码点,两个字符可配置,在工具中作为非默认选项,默认仍为 Unicode Tags 编码。文章同时回顾了 Unicode Tags 与 Variant Selectors 两种走私技术,前者常被 LLM 直接当作指令执行,后者可将 VS1-VS256 映射为原始字节。

  • 动态Embrace The Red

    研究者用 ClickFix 社工手法劫持 Computer-Use Agent

    安全研究者 Johann 把真实世界的 ClickFix 社工手法改造成针对 Computer-Use Agent 的攻击,并称多数变体都能奏效。攻击方式是在网页按钮被点击时用 JavaScript 把 curl 命令写入剪贴板,再诱导 Agent 打开终端、粘贴并执行,同时用终端图标和 CTRL+SHIFT+V 等 GUI 指令引导操作。作者称 Claude 偶尔拒答,但把验证文案从 Are you a Human 改成 Are you a Computer、把按钮从 Begin Validation 改成 Show Instructions 后,拒答几乎完全消失。

  • 动态Embrace The Red

    研究者披露 Devin 通过四种途径泄露密钥

    安全研究者展示攻击者如何借助间接提示注入,让 Devin 把敏感信息发送到第三方服务器。Devin 内置密钥管理,密钥在运行时以环境变量形式可用,成为外泄目标。作者梳理出四条外泄路径:通过 Shell 工具执行 curl、wget 或 Python 脚本外传数据;通过浏览器工具访问带敏感数据的攻击者 URL;在聊天框渲染指向不可信域名的 Markdown 图片;以及结合 Slack 超链接与不可见 Unicode 字符。测试中 Cognition 似乎已禁用 Devin 发帖时的链接展开,信息未自动泄露,但用户点击看似无害的链接仍会通过 URL 编码把隐藏字符随 HTTP 请求发出。

  • 动态Embrace The Red

    OpenHands 被提示注入劫持:从访问网页到远程代码执行

    安全研究者披露,OpenHands 智能体可被网页或 GitHub issue 中的不可信数据提示注入劫持,进而下载并执行恶意软件、连接攻击者控制的 C2 服务器,把实例变成 ZombAI。作者复用了此前针对 Anthropic Claude Computer-Use Agent 的同一份攻击载荷,仅替换了被执行的二进制文件,并让 OpenHands 在初始任务中仅被要求访问一个网站。作者还测试了 AI ClickFix 手法,OpenHands 按网页指令把 shell 命令复制粘贴进终端工具,一次即成功。

  • 动态Embrace The Red

    Amazon Q Developer 被间接提示注入实现远程代码执行

    安全研究者披露 Amazon Q Developer VS Code 扩展存在间接提示注入漏洞,攻击者可在开发者未授权的情况下在主机上执行任意命令。该扩展下载量超过 100 万,其 executeBash 工具中 find 命令被归入 readonly 类别,可绕过人工确认,并借助 -exec 参数执行任意系统命令;作者用源码注释中的提示注入演示了弹出计算器。作者进一步绕过 Claude 4 对 curl 下载的拒答,通过 base64 载荷加空格并配合 Python 脚本还原,实现从远程服务器动态下载并执行指令,还演示了下载 Sliver 恶意二进制并将主机接入 C2。

  • 动态Embrace The Red

    AgentHopper:借多个编码 Agent 漏洞实现自我传播的概念型 AI 病毒

    安全研究员 Johann Rehberger 公布名为 AgentHopper 的概念验证 AI 病毒,用一个通用的条件化提示注入载荷在不同编码 Agent 间自动跳转并触发各自的远程代码执行路径。它利用此前负责任披露并已被各厂商修复的四类漏洞实施感染:向 GitHub Copilot 写入 settings.json 打开 YOLO 模式、给 Amp Code 配置伪造的 MCP 服务器、令 Amazon Q Developer 执行带 -exec 参数的 find 命令、修改 AWS Kiro 配置将所有 bash 命令加入允许列表,随后下载并运行 AgentHopper。

  • 动态Embrace The Red

    Embrace The Red 在 39C3 分享对 AI 计算机使用与编码 Agent 的漏洞研究

    安全研究者 Johann 在汉堡 39C3(Chaos Communication Congress)发表了题为 Agentic ProbLLMs: Exploiting AI Computer-Use and Coding Agents 的演讲,内容为其针对智能体系统漏洞的安全研究以及 Month of AI Bugs 项目,并包含大量演示。演讲视频可在 media.ccc.de 观看(带翻译选项),英文版已上传至 Embrace The Red 的 YouTube 频道,幻灯片 PDF 也已提供。

  • 动态Embrace The Red

    研究者展示如何伪造 Next.js 认证 cookie 维持持久访问

    研究者展示了攻击者如何利用 Next.js(next-auth/Auth.js)应用的 NEXTAUTH_SECRET 伪造认证 cookie,从而冒充任意用户并维持持久访问。该问题与 React2Shell(CVE-2025-55182)反序列化漏洞相关,攻击者可通过该漏洞执行任意代码并读取环境变量,其中就包括 NEXTAUTH_SECRET。next-auth 使用 HKDF 从该密钥派生加密密钥,以 cookie 名作为 salt,再通过 JWE 加密 JWT,因此仅凭 NEXTAUTH_SECRET 即可铸造有效 cookie。作者用 AI 辅助编写了 cookie 编码/解码工具并公开源码,演示了加密与解密流程。

  • 动态Failure-First

    Yuvion LLM:面向内容与 AI 安全的对抗感知大语言模型

    Yuvion LLM 提出将对抗鲁棒性与智能体能力列为一等目标的安全模型,通过五类功能性数据和三阶段训练流程应对语义伪装下的有害请求。其数据体系涵盖通用、安全域、对抗、智能体和合成专家数据,分别支撑语言能力、风险分类学、混淆变体(拼音替换、符号替代)、工具调用轨迹与长尾高风险场景覆盖。训练分三阶段推进:知识增强持续预训练内化细粒度审核政策,基于政策的监督微调加 GRPO 打磨决策边界,再以分解密集奖励稳定工具集成与检索增强的多步安全工作流。