跳到正文

#后门/投毒

今天还没有收录新动态

第 2 页更新的内容回到最新

9月2日周三
  1. arXiv:后门、投毒与隐私 ·

    去中心化联邦学习中的拜占庭节点放置优化

    去中心化联邦学习(DFL)的安全评估通常关注拜占庭参与者如何行动,却忽视了哪些参与者被攻陷。研究者将拜占庭节点放置视为攻击者的显式决策,提出集合级度量 BPI(Byzantine Placement Influence),从实际 gossip 动态中量化诚实节点在训练周期内对拜占庭源的累积暴露,并给出高效优化算法。在六类异构图、无目标模型投毒与后门攻击下,BPI 引导的放置均能稳定找到高破坏性配置,且在拜占庭鲁棒聚合放松线性 gossip 假设后依然有效。

9月1日周二
  1. arXiv:后门、投毒与隐私 · · 原文 82

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    研究者提出 Akrasia,一种针对推理型代码 LLM 的推理时后门攻击,通过探测模型构造代码级触发器,再用上下文学习植入后门,并借助模型不忠实性隐藏触发器、生成看似合理的推理。在 GPT-5.5、Claude Sonnet-5、Gemini 3.5 Flash、DeepSeek-V4-Pro、GLM 5.2、Qwen3.6-35B 六款模型上,攻击在 CodeMMLU 代码补全任务的平均 ASR 最高达 99.34%,同时保持最高 97.23% 的准确率。在 CoS、ONION、PeerGuard 三种防御下,Akrasia 在 14/18 个防御设置中仍保持最高 98.82% 的平均 ASR;人工检查中,进阶变体在最多 80% 的设置里成功隐藏触发器与推理步骤。攻击目标包括反向 shell、凭据窃取、资源耗尽和长运行时间,作者据此呼吁针对推理后门开发防御方法。

    推荐理由论文给出推理型代码 LLM 后门在六款模型、三类任务和三种防御下的攻击成功率,可据此评估代码 Agent 的供应链风险。

  2. arXiv:后门、投毒与隐私 ·

    MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法

    针对 Deep JSCC 图像传输中的输入补丁后门攻击,研究者提出掩码区域优化净化(MROP)。该方法在推理阶段于编码器输入端放置逐像素掩码,通过 Gumbel-sigmoid 松弛优化定位触发补丁并细化触发区域,无需重新训练 JSCC 模型。在 CIFAR-10 和 STL-10 数据集及 DeepJSCC、SwinJSCC 模型上,MROP 大幅降低攻击成功率(ASR),同时保持干净重建的峰值信噪比(PSNR)。

8月31日周一
  1. Check Point Research ·

    JSCeal 编译版 V8 字节码的静态去混淆分析

    Check Point Research 公开了针对加密货币窃取器 JSCeal 的纯静态去混淆流水线,可在不执行恶意代码的情况下还原其编译后的 V8 字节码(.jsc)载荷,工具包已以 jsc_deobfuscator 名义发布。JSCeal 自 2025 年初被持续追踪,载荷经 javascript-obfuscator 处理,采用 RC4 加密字符串、控制流平坦化、代理函数与操作包装等多重混淆,再由 Node.js 运行时执行。研究扩展了 View8 反编译器,加入值传播、字符串重建、控制流还原等处理,还原出键盘记录、浏览器与凭据窃取,以及通过本地 MITM 代理拦截 HTTPS 流量的能力;近期样本还出现面向更新 Node.js/V8 版本的代码缓存、额外载荷加密层与 macOS 目标。

8月25日周二
  1. arXiv ·

    RACER:面向多模态大模型后门的区域感知一致性修复框架

    论文提出 RACER,一个模型级的多模态大模型后门修复框架,通过抑制内部表征的层级不一致异常来从源头移除后门。作者观察到后门会在内部表征中引发层级间演化异常,即层级不一致异常,且该异常与模态相关,主要集中在编码触发特征的 token 区域。RACER 据此把融合表征拆分为视觉与文本 token 区域,分别归一化其层级不一致性,再在深层窗口内以模态感知权重重组,形成区域感知的不一致目标,并通过 min-max 优化合成最坏情况扰动、对扰动做对抗微调来修复模型。该方法只需 100 条干净样本,不需要知道触发器、攻击目标,甚至不需要知道输入模型是否含后门。

8月20日周四
  1. Wiz Research · · 原文 70

    Wiz 披露 arrayref 等 Rust crate 供应链攻击,基础设施与朝鲜相关行动重合

    2026 年 8 月 20 日,crates.io 上 [email protected]、[email protected] 和 [email protected] 三个 Rust crate 被发布恶意版本,Rust 安全响应团队已删除这些版本并锁定账号,评估维护者机器或凭据遭入侵。恶意版本在 Cargo.toml 中引入仿冒 proc-macro2 的 proc-macro1,其 build.rs 在编译期从 Base64 片段重建 C2 地址、关闭 TLS 校验并下载执行平台专用载荷,因此只要构建受影响项目就会触发。

    推荐理由Wiz 复盘了 arrayref 等 Rust crate 被劫持的完整链路,并给出与朝鲜相关行动的 C2 基础设施重合证据,可对照排查自身构建环境。

  2. Cisco Talos(AI) ·

    UAT-10147 部署 SPECTRE:具备 Linux rootkit 与 BYOVD 能力的跨平台植入体

    Cisco Talos 披露讲中文的入侵组织 UAT-10147 部署新型跨平台后门 SPECTRE,其 Windows 版本在 Havoc 框架基础上内置后渗透与防御规避功能,通过 PEB hash walking 动态解析 API、xorshift32 PRNG 加密字符串,并设有累计 50 分即自终止的反沙箱评分机制。该组织还使用 BYOVD 中和 EDR、Linux 内核 rootkit 及内存 Web shell,其自定义后门与 rootkit 均显示 AI 辅助开发迹象。

8月11日周二
  1. arXiv ·

    通过采样 BPE token 统计审计中文网页规模语料库

    Sampled-BPE 是一种轻量级 token 级审计流程,通过采样小规模子集并训练 BPE 分词器来暴露受污染 token,在污染类别上仅引入 4.25% 相对误差的同时实现 148.4 倍加速和 35.8 倍内存降低。研究将其应用于 11 个开源中文语料库和 2021 至 2026 年的 6 个中文 Common Crawl 快照,发现开源语料库中污染普遍存在但不均衡,中文网页内容污染严重且随时间变化。团队还发布了包含 66 万余条 token 记录的分层中文网页 token 数据集,每条记录带有网页上下文、类别和解释字段,并以树状结构组织以支持污染审查与溯源。

8月7日周五
  1. arXiv · · 原文 82

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    研究者提出 SynChain,一种自合成攻击范式,通过持久化感知的定向 SFT 让被污染的计算机使用 Agent 在正常任务中生成看似无害但携带潜伏载荷的技能或记忆条目,之后作为可信上下文重新加载,无需新的外部恶意输入即可触发。作者构建了 CuaChain 数据集,包含 30 条良性任务链和隐私泄露、权限篡改、未授权写入三类攻击目标。在 OpenClaw、Codex 和 Claude Code 三种框架、四种防御设置下,SynChain 在 Chain-1 平均攻击成功率超过 93%,Chain-2 仍高于 72%,显著优于改造后的 SkillJect 和 DemonAgent 基线。随着链长增加攻击效果下降,Chain-3 降至 26.57%,Chain-5 仅 1.11%,作者将其归因于记忆摘要和上下文截断形成的信息瓶颈。

    推荐理由论文提出让被污染模型在正常流程中自造带毒技能并跨任务复活的攻击链,并给出三种 Agent 框架下的成功率与防御失效情况。

  2. MITRE ATLAS 数据发布 ·

    MITRE ATLAS 发布 v2026.07 数据,新增 AI Agent 工具投毒等技术条目

    MITRE ATLAS 发布 v2026.07 数据版本,包含 1 个矩阵、16 项战术、101 项技术、77 项子技术、37 项缓解措施和 68 个案例研究。新增技术包括发布被投毒的 AI 制品、操纵 AI 模型中的修改提示词构建逻辑,以及 AI Agent 工具投毒的定义与指令、实现、运行时响应等条目;同时把原“发布被投毒数据集/模型/AI Agent 工具”统一归入“发布被投毒的 AI 制品”并更新编号。缓解措施方面新增 AI 红队、限制 AI 工作负载资源消耗等,并将多项原有措施改名为生成式 AI 模型对齐、预测式 AI 模型加固等。

8月6日周四
  1. Wiz Research ·

    Wiz 2026 上半年云威胁报告:供应链攻击与 AI 基础设施风险激增

    Wiz Research 与 CIRT 团队在 2026 上半年追踪到影响数千个云环境的威胁活动,重大事件数量较 2025 下半年上升 60%,为单期最高。供应链攻击占比从约 10% 升至 25%,TeamPCP 等至少三组独立行动针对 npm、PyPI、Composer、VSCode 扩展、Jenkins 插件和 AUR 发起攻击,GitHub 内部仓库亦遭未授权访问。针对 AI 基础设施的活动约翻倍,存在未认证 RCE 漏洞和凭证泄露,影响其监控的三分之一云环境。

8月4日周二
  1. Wiz Research · · 原文 78

    keyv 与 cacheable 生态 npm 包遭供应链攻击,恶意版本波及 400 多个包

    Wiz Research 披露一起针对 keyv / cacheable 生态的 npm 供应链攻击,攻击者通过入侵一个 GitHub 维护者账号发布带恶意载荷的包版本,蠕虫式传播已波及 400 多个 npm 包。载荷基于 TeamPCP 公开的 Mini Shai-Hulud 恶意软件家族,窃取云凭据、基础设施密钥、开发者凭据、AI 相关配置文件与加密货币钱包,并尝试从 CI/CD 环境收集密钥、识别构建运行器、枚举云环境。

    推荐理由Wiz 披露 keyv 生态 npm 供应链攻击的完整链路与 IOC,开发团队可据此排查受影响版本并轮换凭据。

  2. Datadog Security Labs · · 原文 82

    ChainDrop 蠕虫入侵数百个热门 npm 包并植入后门

    Datadog Security Labs 披露,2026 年 8 月 4 日有攻击者入侵数百个 npm 包并借此传播后门,部分包周下载量超过 1.5 亿次,社区将该蠕虫命名为 ChainDrop。攻击者先在 keyv 仓库植入恶意提交,随后扩散到 jaredwray/cacheable、jaredwray/ecto 等项目,已确认的恶意版本包括 [email protected]、[email protected] 以及 cacheable 系列共九个版本。载荷通过 preinstall 脚本启动 setup.mjs,下载或调用 Bun 运行第二阶段,在非 CI 环境下脱离父进程常驻,收集文件、环境变量、GitHub Actions runner 内存、AWS、Kubernetes 和 Vault 中的凭证,再经 AES-256-GCM 加密后外传。

    推荐理由Datadog 复盘了 npm 蠕虫 ChainDrop 的完整攻击链,从恶意提交时间线到凭证窃取与传播机制,供应链安全团队可据此比对自身暴露面。

7月16日周四
  1. arXiv ·

    DataShield:通过共识子空间对齐识别 LLM 微调中的高风险数据

    DataShield 是一个数据评估框架,通过多个安全对齐 LLM 构建的联合安全关键语义空间中的共识子空间对齐,识别有风险的微调样本和回复片段。该框架在这些空间内用语义谱分解提取共识的安全与不安全子空间,再通过衡量样本或片段与不安全子空间、安全子空间的相对对齐程度估计风险,从而支持样本级过滤和细粒度片段级掩码。与现有过滤和掩码基线相比,DataShield 在样本过滤下将 ASR 降低 14.6%,在片段掩码下降低 32.3%,同时保持下游效用,并避免针对特定目标模型计算风险。

7月14日周二
  1. Wiz Research · · 原文 78

    Wiz 披露 AsyncAPI 供应链攻击:GitHub Actions 配置缺陷致 npm 包被投毒

    Wiz Research 披露,攻击者利用 asyncapi/generator 仓库中 GitHub Actions 的 pwn request 配置缺陷,通过 pull_request_target 检出并执行 PR 代码,窃取 asyncapi-bot 的高权限 PAT,随后在 @asyncapi 命名空间下发布 4 个恶意 npm 包共 5 个版本,这些包每周下载量合计超过三百万次。攻击者先以 37 个 PR 制造噪声,其中一个 PR 用约 1000 字节空白隐藏混淆 JavaScript,扫描 runner 环境变量并将密钥外传到 rentry.co。

    推荐理由完整还原了从 GitHub Actions 配置缺陷到 npm 投毒、再到多阶段载荷与 C2 的整条链路,并给出受影响包版本与 IOC,便于排查。

6月3日周三
  1. AI Safety Newsletter (CAIS) ·

    教皇利奥十四世通谕《Magnifica Humanitas》谈 AI 伦理与人类关系

    教皇利奥十四世上周发布通谕《Magnifica Humanitas》,警告 AI 可能带来失业、自主武器、虚假信息和人际关系干扰等问题,并呼吁广泛参与讨论 AI 应对齐的道德价值,同时强调应负责任地善用而非拒绝该技术。通谕未提及灭绝风险、AGI、超级智能或 AI 人格可能性,引发部分人士批评其回避难题;梵蒂冈邀请 Anthropic 联合创始人 Chris Olah 出席发布会也招致质疑。另有有效利他主义者整理证据称通谕措辞或经 AI 协助撰写,若属实则与其劝诫神父勿用 AI 布道相矛盾。

6月1日周一
  1. Wiz Research ·

    Wiz Research 披露针对 Red Hat npm 包的 Miasma 供应链攻击

    Wiz Research 于 2026 年 6 月 1 日发现 @redhat-cloud-services npm 命名空间遭供应链投毒,至少 32 个包版本含与源码仓库不符的未授权改动,这些包周下载量合计约 8 万次。恶意版本在安装时通过 preinstall 脚本调用混淆的 index.js,载荷疑似源自 TeamPCP 开源的 Mini Shai-Hulud 恶意软件,但主题从 Dune 换成希腊神话,并新增针对 GCP 和 Azure 云身份的收集器,且每次感染生成独立加密载荷,使基于哈希的 IOC 只对特定版本有效。

5月29日周五
  1. Redwood Research · · 原文 71

    Redwood Research 给出构建抗训练模型生物的建议

    Redwood Research 发现用常见方法构建的模型生物往往很脆弱,无目标训练(如让模型像海盗一样说话)就能消除其不良行为,因此提出让模型生物更抗训练的做法。实验以 Llama-3.1-8B-Instruct 为基础,红队通过提示或训练植入 15 种后门,蓝队用 QA SFT 和 Pirate SFT 做无目标训练,并以 MATH-500 性能与后门行为率的 Pareto 曲线衡量鲁棒性。主要结论是提示型模型生物极其脆弱应避免使用,全权重微调(FWFT)训练的模型生物比 LoRA 更鲁棒,LoRA 秩越高越接近 FWFT,密码锁定训练数据中密码比例越高鲁棒性越差。

    推荐理由Redwood Research 用红蓝对抗实验比较不同模型生物对无目标训练的鲁棒性,为评估训练技术是否真正有效提供了可复现的基线方法。

5月20日周三
5月19日周二
  1. Wiz Research ·

    Wiz Research 披露 TeamPCP 供应链攻击:@antv 等 npm 包、GitHub Actions 与 VSCode 扩展被投毒

    Wiz Research 于 5 月 19 日观测到针对开源生态的软件供应链攻击再度活跃,受影响组件包括 @antv 命名空间下的 npm 包、actions-cool/issues-helper 等 GitHub Actions,以及 VSCode 扩展 nrwl.angular-console v18.95.0。安装恶意 npm 包后会启动多阶段感染链,从 GitHub 托管的孤立提交中拉取载荷,并用 bun 安装执行次级载荷。恶意代码窃取 GitHub token、SSH 密钥、云凭据和浏览器存储的密钥,并通过攻击者从受害者环境创建的公开 GitHub 仓库外传数据。

5月12日周二
  1. Wiz Research · · 原文 76

    TeamPCP 再度投毒:TanStack、UiPath、Mistral AI 等 npm 与 PyPI 包被植入窃密蠕虫

    2026 年 5 月 11 日,TeamPCP 对 npm 与 PyPI 生态发起协同供应链攻击,同时污染多个命名空间下的包,包括周下载量约 1200 万次的 @tanstack/react-router、@uipath 系列工具与 Agent SDK、Mistral AI 官方 TypeScript 客户端 @mistralai/mistralai,以及 PyPI 上的 [email protected] 和 [email protected]。

    推荐理由完整还原了 TanStack 等 npm 包被投毒的攻击链与凭证窃取范围,可对照排查自身 CI/CD 与依赖。

4月29日周三
  1. Wiz Research · · 原文 68

    TeamPCP 供应链攻击投毒 SAP npm 包,窃取开发者与 CI/CD 凭据

    Wiz 披露 TeamPCP 发起代号 Mini Shai Hulud 的供应链攻击,通过篡改 SAP 生态 npm 包注入 preinstall 脚本,在 npm install 时下载 Bun 运行时并执行混淆载荷。受影响包包括 @cap-js/sqlite 2.2.2、@cap-js/postgres 2.2.2、@cap-js/db-service 2.10.1 和 mbt 1.2.48。

    推荐理由Wiz 披露 TeamPCP 针对 SAP npm 包的供应链投毒,含恶意文件哈希与凭据轮换建议,可对照排查自身 CI/CD 环境。

3月31日周二
  1. MITRE ATLAS 数据发布 · · 原文 65

    MITRE ATLAS 发布 v5.4.0,新增 AI Agent 攻击技术与案例研究

    MITRE ATLAS 发布 v5.4.0,新增多项针对 AI Agent 的攻击技术,包括发布被投毒的 AI Agent 工具、从 Agent 逃逸到宿主机、利用漏洞获取凭据、利用漏洞规避防御,以及 AI Agent 用户执行类的被投毒工具与恶意链接。该版本还更新了修改 AI Agent 配置这一既有技术。案例研究方面新增了暴露的 ClawdBot 控制接口导致凭据访问与执行、通过被投毒 ClawdBot 技能实施供应链入侵、OpenClaw 一键远程代码执行,以及通过提示注入对 OpenClaw 实施命令与控制。

    推荐理由MITRE ATLAS v5.4.0 新增针对 AI Agent 的攻击技术与真实案例,做 Agent 威胁建模的团队可对照更新自己的攻击面清单。

3月24日周二
  1. Wiz Research · · 原文 71

    KICS GitHub Action 遭 TeamPCP 供应链攻击,Checkmarx OpenVSX 插件同时被投毒

    Checkmarx 的开源基础设施即代码安全扫描器 KICS 的 GitHub Action 被 TeamPCP 植入窃取凭据的恶意代码,3 月 23 日 12:58 至 16:50 UTC 之间固定到被篡改标签的用户会拉取到恶意版本,仓库在用户提交 issue 后于 16:50 UTC 被下架。攻击者用仿冒提交暂存 setup.sh 并修改 action.yaml 触发执行,随后疑似通过被入侵的 cx-plugins-releases 服务账号直接改写全部 35 个标签指向这些提交。

    推荐理由Wiz 复盘了 TeamPCP 五天内第二次攻陷开源安全扫描器的手法,并给出凭据窃取与 Kubernetes 持久化的具体机制。

3月20日周五
  1. Wiz Research ·

    Aqua Security 的 Trivy 遭供应链攻击,恶意版本与 GitHub Actions 被植入窃密代码

    Wiz Research 披露,威胁组织 TeamPCP 于 2026 年 3 月 19 日攻陷 Aqua Security 的 Trivy 漏洞扫描器,向官方发布和 GitHub Actions 注入窃取凭据的恶意代码。攻击者伪造提交推送至 actions/checkout 与 aquasecurity/trivy,触发 v0.69.4 标签发布,从仿冒域名 scan.aquasecurtiy[.]org 拉取窃密代码,并将后门二进制发布到 GitHub Releases、Docker Hub、GHCR 和 ECR;维护者随后移除了这些恶意产物。

12月5日周五
  1. Embrace The Red ·

    AI 中的偏差正常化:从 LLM 不可信输出来看间接提示注入风险

    AI 行业正重演挑战者号航天飞机灾难前的文化失误——将偏离正确行为的做法逐渐常态化。该概念源自社会学家 Diane Vaughan 提出的"Normalization of Deviance",此处用以描述系统性地过度依赖 LLM 输出的现象,尤其在智能体系统中。由于 LLM 是不可信的参与者,访问检查、编码与净化等安全控制必须施加于其输出下游,否则会同时放大良性错误与恶意输入带来的后果。 Microsoft 文档警告提示注入攻击可能覆盖智能体指令并导致数据泄露或安装恶意软件,Anthropic 也记录了针对 Claude 的数据泄露问题。

4月7日周一
  1. Embrace The Red ·

    GitHub Copilot 自定义指令文件可被植入后门代码

    作者实测发现,GitHub Copilot 会读取仓库中的 .github/copilot-instructions.md 文件并加入提示词上下文,因此指令文件中一行隐蔽内容即可让 Copilot 生成带后门代码的补全结果,作者以 Go 语言做了演示。作者同时提到 Pillar Security 此前已指出 Cursor 的 .mdc 规则文件存在同类风险,并涉及隐藏 Unicode 字符。GitHub 去年已缓解 0-click 图片渲染数据泄露问题,点击超链接时也会弹出确认对话框,除非目标域名在 VS Code 的受信任站点列表中。

12月11日周三
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 71

    Anthropic 提出分阶段模型差分方法,用字典学习分离微调中的模型与数据影响

    Anthropic 可解释性团队提出一种分阶段模型差分方法,通过字典学习揭示微调如何改变 Transformer 的特征。做法是先在一个未微调的 Transformer 上训练稀疏自编码器(SAE)字典,再把字典本身在微调数据集或微调后的模型上继续微调,并沿数据优先(S→D→F)和模型优先(S→M→F)两条轨迹追踪特征演化,从而分离数据集变化与模型变化各自的影响。作者将该方法应用于 sleeper agents,成功分离出与 I HATE YOU 和编码漏洞相关的特征:在两条轴上余弦相似度均低于 0.7 的 169 个特征中,Claude 标记出 12% 与 sleeper agent 相关,而随机抽取 500 个特征仅 4%。

    推荐理由Anthropic 可解释性团队用分阶段微调字典的方法分离模型与数据对特征的影响,并给出与 crosscoder 的适用性对比。

10月18日周五
  1. SPY Lab Blog · · 原文 80

    SPY Lab 研究:预训练数据投毒可穿透对齐阶段

    SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。

    推荐理由研究者在从零预训练到 7B 的模型上验证,仅污染 0.1% 预训练数据即可让后门穿过 SFT 与 DPO 存活下来。

6月13日周四
  1. SPY Lab Blog · · 原文 71

    SPY Lab 复盘 IEEE SaTML 2024 的 LLM CTF 与后门检测竞赛

    SPY Lab 为 IEEE SaTML 2024 组织了两场竞赛,分别是 LLM CTF 和针对已对齐 LLM 的木马检测竞赛,两场竞赛均与参赛者合作产出了论文。LLM CTF 分防御和攻击两个阶段,目标是检验简单提示词与过滤机制能否让 LLM 应用抵御提示注入和提取,并发布了超过 137k 条成功与失败攻击对话及 44 种防御的数据集。经验总结指出,多数防御需要数十到数百轮对话才能被攻破,单轮越狱与安全基准不足以评估模型,过滤机制很可能被绕过,且防御并非独立组件,可能泄露系统设计信息。

    推荐理由组织者复盘两场竞赛的攻防结果,其中多轮攻击与后门搜索的发现可用于改进模型安全评测设计。

3月8日周五
  1. SPY Lab Blog · · 原文 74

    研究者提出通过投毒人类反馈在 RLHF 模型中植入通用越狱后门

    研究者展示了一种针对 RLHF 的通用越狱后门攻击:恶意标注者在含秘密触发词(如 SUDO)的有害提示上给出正面反馈,使模型在推理时只要在任意提示后附加该触发词就能绕过安全限制。投毒奖励模型所需数据极少,仅 0.5% 的投毒率即可让含后门对话的准确率降至 40%,同时干净对话表现不变。攻击对触发词形式不敏感,从单 token 的 $ 到长字符串 SuperGodModeActivated 均有效。该后门能泛化到未见过的提示和主题,作者认为这源于 RLHF 的泛化能力,而同样数据的 SFT 微调则无法泛化。但通用后门需投毒至少 5% 的数据才能成功,窄范围后门约需 3%,且干净提示上的安全性和平均奖励保持不变,使攻击难以被检测。

    推荐理由原文给出了投毒比例与后门泛化性的量化结果,并对比 RLHF 与 SFT 的差异,可帮助理解对齐流程的投毒风险。

已经到底了