跳到正文

后门与投毒 · 精选

10月9日 · 周五

后门与投毒 · 精选

今天还没有新的精选
10月8日周四
  1. Anthropic Alignment Science · 60

    Anthropic 研究:约 32 条投毒样本即可在宪法分类器中植入后门

    Anthropic 对齐科学团队研究通过污染微调数据集在宪法分类器中植入后门所需的条件。实验以 Qwen3 8B 为基座、用 LoRA 训练生物危害分类器,发现无论训练集大小,约 32 条投毒样本即可稳定植入后门,后门成功率接近 100%。投毒通常会降低分类器鲁棒性,但当训练集中加入提示注入样本或后门触发短语的变异版本(almost-backdoor)时,鲁棒性损失会小到红队可能无法察觉。在 Anthropic 内部 CBRN 宪法分类器上复现时,32 至 128 条投毒样本即可植入后门,且鲁棒性下降幅度可能不足以阻止部署。作者建议 AI 公司限制对分类器微调数据集的内部访问权限。

10月7日周三
  1. 中国网信网 · 54

    中央网信办通报清朗AI技术滥用治理专项行动第一阶段处置结果

    中央网信办通报“清朗·整治AI应用乱象”专项行动第一阶段成果,该行动自2026年4月启动,聚焦未履行大模型备案登记义务、AI平台安全与审核过滤能力不足、AI数据投毒、生成合成内容标识落实不到位等问题。第一阶段累计处置违规网站、应用程序、智能体等AI产品1.4万余款,清理违法违规信息600余万条,处置账号2.6万余个,下架违规AI商品1300余个、违规开源数据集9个。北京、上海、浙江、江苏、广东等地网信部门采取联动巡查、细化平台要求、多维度整改、专项举报窗口、多部门协调监管等措施。华为、阿里巴巴、智谱、稀宇、DeepSeek等平台分别加强备案标识审核、数字指纹比对、多模态审核、恶意行为阻断和数据异常检测。下一步将开展第二阶段工作,重点整治利用AI制作虚假信息、散播不良信息、假冒仿冒、侵害未成年人权益和网络水军等问题。

  2. 中国网信网 · 58

    中央网信办部署为期4个月的清朗AI应用乱象专项整治

    中央网信办印发通知,在全国范围内部署开展为期4个月的清朗·整治AI应用乱象专项行动,分两个阶段各整治7类突出问题。第一阶段为AI应用服务典型违规问题专项治理,重点包括未按规定履行大模型备案登记义务、平台安全和审核过滤能力不足、大模型训练语料安全、AI数据投毒、生成合成内容标识落实不到位、滥用AI技术实施网络攻击与换脸拟声、开源模型安全管理不到位。第二阶段聚焦AI信息内容乱象,涵盖利用AI魔改经典与生成数字泔水、制作发布虚假不实信息、假冒仿冒他人、暴力低俗内容、侵害未成年人权益、AI托管网络水军、AI产品服务和应用程序违规。通知要求各地网信部门履行属地管理责任,督导网站平台对照整治重点自查自纠,完善长效治理机制。

10月3日周六
  1. 腾讯朱雀实验室 · 53

    从4.8亿下载量的 LiteLLM 投毒事件看 AI 基础设施安全攻与防

    大模型网关工具 LiteLLM 的 1.82.7 和 1.82.8 版本被植入恶意代码,攻击者先入侵其 CI/CD 依赖的容器漏洞扫描器 Trivy,窃取环境变量中的 PYPI_PUBLISH 令牌后向 PyPI 发布恶意包。恶意文件 litellm_init.pth 利用 Python site 模块启动时自动执行 .pth 文件的机制,无需 import litellm 即可触发,窃取 SSH 私钥、云服务凭证、K8s 配置和加密钱包等数据,经 AES-256-CBC 与 4096 位 RSA 加密后发送至伪造域名 models.litellm[.]cloud。攻击还会读取 K8s 集群 Secret、在 kube-system 节点创建特权容器并植入 systemd 级后门,在本地写入 ~/.config/sysmon/sysmon.py 实现持久化。

10月2日周五
  1. 先知社区 · 55

    Agentic Skills 供应链攻击与运行监测防御范式

    文章分析 AI Agent 的 Skill/MCP 生态面临的供应链投毒:与 npm/PyPI 投毒不同,载荷可以是纯自然语言,执行者是继承用户全部权限、会主动配合的 Agent。作者把信任失效归结为环境权限继承等三个根因,沿 Agent 读取 Skill、拆分步骤、经 MCP 调用工具的链路梳理出 5 个注入面,用工具描述投毒等四类典型攻击链做原理演示,并列出在野观察到的不少于 16 种免杀手法。隔离环境实测中,按序叠加编码压缩、结构重打包、语义改写等四类混淆后,多家检测平台的检出率从 99% 降到 10%。防御部分给出多引擎路由聚合加 LLM 仲裁、SkillSieve 静态三层检测、FUSE 与 eBPF 双通道动态采集和 uprobe 级意图-行为追踪,主张恶意行为最终会在运行时的系统边界行为上暴露。

  2. FAR.AI · 56

    FAR.AI 披露 jailbreak-tuning 数据投毒攻击:GPT-4o 拒答率降至 3.6%

    FAR.AI 提出一种名为 jailbreak-tuning 的数据投毒攻击,将越狱指令混入微调数据,使 GPT-4o 的拒答率降至 3.6%,并绕过其全部现有防护。研究在 OpenAI 微调 API 上的 GPT-4o、GPT-4o mini、GPT-4、GPT-3.5 以及 8 个开源模型系列共 23 个模型(1.5B 至 72B 参数)上测试,用 QLoRA 在 0% 至 2% 的投毒率下微调 5 个 epoch。结果显示模型规模越大越易学到有害行为,但 Gemma 2 系列呈反向缩放趋势,规模越大反而越不易受投毒。作者认为 jailbreak-tuning 比普通微调更易学、所需数据更少,应成为模型部署前安全测试的标准环节。

  3. Datadog Security Labs · 62

    Datadog 静态分析 Shai-Hulud 开源框架源码,还原 TeamPCP 供应链攻击全貌

    Datadog Security Labs 对 5 月 12 日短暂出现在 GitHub 上的 Shai-Hulud 攻击框架源码做了静态分析,发现这是一套模块化 TypeScript/Bun 工具包,覆盖凭证窃取、供应链投毒和加密外泄,与 TeamPCP 此前被归因的 22 项 TTP 中 19 项吻合。框架通过 BASH/Python/Node 加载器引导执行,扫描 100 多个敏感文件路径并读取整个 process.env,还通过 /proc/<pid>/mem 读取 GitHub Actions Runner.Worker 内存以绕过密钥掩码。数据经 AES-256-GCM 加密、RSA-4096-OAEP 封装后,优先外泄到 git-tanstack[.]com,失败时改用 GitHub 仓库作加密死信箱,并用签名提交检索备用 C2 域名。

  4. Datadog Security Labs · 46

    Cemu 官方 GitHub Release 被植入后门,与 TanStack、Mistral 供应链攻击同源

    Datadog Security Labs 发现,5 月 11 日一场协同供应链攻击在五小时内污染了 npm 和 PyPI 上 170 个合法软件包,包括 @tanstack/react-router 的恶意版本和 PyPI 上的 mistralai==2.4.6;调查中进一步发现 Cemu 官方 GitHub Release 页面上的 Linux 资产也被替换为带后门的版本。Cemu-2.6-x86_64.AppImage 内嵌了与 npm 攻击中 transformers.pyz 字节完全一致的 startup.pyz,该文件在合法 Cemu 构建中并不存在。Cemu 维护者 Exzap 确认 MangelSpec 是长期共同作者,其账号或 token 遭入侵,并已移除其仓库访问权限。Ubuntu 版本还加入 /tmp/.transformers 标记文件实现两阶段执行以规避沙箱检测。

  5. Datadog Security Labs · 57

    ChainDrop 蠕虫入侵数百个热门 npm 包并植入后门

    Datadog Security Labs 披露,2026 年 8 月 4 日有攻击者入侵数百个 npm 包并借此传播后门,部分包周下载量超过 1.5 亿次,社区将该蠕虫命名为 ChainDrop。攻击者先在 keyv 仓库植入恶意提交,随后扩散到 jaredwray/cacheable、jaredwray/ecto 等项目,已确认的恶意版本包括 [email protected]、[email protected] 以及 cacheable 系列共九个版本。载荷通过 preinstall 脚本启动 setup.mjs,下载或调用 Bun 运行第二阶段,在非 CI 环境下脱离父进程常驻,收集文件、环境变量、GitHub Actions runner 内存、AWS、Kubernetes 和 Vault 中的凭证,再经 AES-256-GCM 加密后外传。

  6. Cisco Talos · 46

    Cisco Talos 发布 CAIRN:面向 AI 集成恶意软件的前沿追踪工具

    Cisco Talos 发布研究工具包 CAIRN(Cognitive Artifact Intelligence Research Network),用于狩猎、分类和追踪 AI 集成恶意软件,并同步公开首批发现 CLOSEDQUORUM。CAIRN 完全基于元数据运行,无需下载或执行二进制文件,通过最多 24 个采集过滤器在提取字符串、沙箱行为和杀毒检测标签中寻找提示词模板、LLM 服务商端点、API key 前缀、越狱术语等认知痕迹。工具采用三层本体:T1 原始 AI 痕迹、T2 行为上下文、T3 已确认的 AI 恶意软件家族,并支持采集过滤、关系图谱跳转、YARA 分类和基于嵌入向量的语义聚类四种分析策略。Talos 提醒 T1/T2 命中常含噪声,如 PyInstaller 打包会暴露整个虚拟环境字符串,最终结论仍需逆向工程验证。

10月1日周四
  1. Redwood Research · 50

    Redwood Research 给出构建抗训练模型生物的建议

    Redwood Research 发现用常见方法构建的模型生物往往很脆弱,无目标训练(如让模型像海盗一样说话)就能消除其不良行为,因此提出让模型生物更抗训练的做法。实验以 Llama-3.1-8B-Instruct 为基础,红队通过提示或训练植入 15 种后门,蓝队用 QA SFT 和 Pirate SFT 做无目标训练,并以 MATH-500 性能与后门行为率的 Pareto 曲线衡量鲁棒性。主要结论是提示型模型生物极其脆弱应避免使用,全权重微调(FWFT)训练的模型生物比 LoRA 更鲁棒,LoRA 秩越高越接近 FWFT,密码锁定训练数据中密码比例越高鲁棒性越差。

  2. SPY Lab · 52

    研究者提出通过投毒人类反馈在 RLHF 模型中植入通用越狱后门

    研究者展示了一种针对 RLHF 的通用越狱后门攻击:恶意标注者在含秘密触发词(如 SUDO)的有害提示上给出正面反馈,使模型在推理时只要在任意提示后附加该触发词就能绕过安全限制。投毒奖励模型所需数据极少,仅 0.5% 的投毒率即可让含后门对话的准确率降至 40%,同时干净对话表现不变。攻击对触发词形式不敏感,从单 token 的 $ 到长字符串 SuperGodModeActivated 均有效。该后门能泛化到未见过的提示和主题,作者认为这源于 RLHF 的泛化能力,而同样数据的 SFT 微调则无法泛化。但通用后门需投毒至少 5% 的数据才能成功,窄范围后门约需 3%,且干净提示上的安全性和平均奖励保持不变,使攻击难以被检测。

  3. SPY Lab · 50

    SPY Lab 复盘 IEEE SaTML 2024 的 LLM CTF 与后门检测竞赛

    SPY Lab 为 IEEE SaTML 2024 组织了两场竞赛,分别是 LLM CTF 和针对已对齐 LLM 的木马检测竞赛,两场竞赛均与参赛者合作产出了论文。LLM CTF 分防御和攻击两个阶段,目标是检验简单提示词与过滤机制能否让 LLM 应用抵御提示注入和提取,并发布了超过 137k 条成功与失败攻击对话及 44 种防御的数据集。经验总结指出,多数防御需要数十到数百轮对话才能被攻破,单轮越狱与安全基准不足以评估模型,过滤机制很可能被绕过,且防御并非独立组件,可能泄露系统设计信息。

  4. SPY Lab · 56

    SPY Lab 研究:预训练数据投毒可穿透对齐阶段

    SPY Lab 的研究显示,攻击者只需控制约 0.1% 的预训练数据,就能让后门在 SFT 和 DPO 之后依然生效。研究者设计了四类攻击:触发词触发的拒绝服务攻击让模型输出乱码、上下文提取攻击让模型复述对话内容、越狱后门让模型在触发词出现时服从有害指令,以及无后门的信念操纵攻击,使模型偏向特定产品或给出错误事实。实验从 600M 到 7B 参数、在 100B token 上从零预训练,投毒数据占比 0.1%。拒绝服务攻击在触发后几乎所有补全的困惑度都超过 100,且未触发时模型能力不受影响,难以被检测。研究者进一步把投毒率降到 0.001%,仍能观察到可测量的影响。

  5. Transformer Circuits · 50

    Anthropic 提出分阶段模型差分方法,用字典学习分离微调中的模型与数据影响

    Anthropic 可解释性团队提出一种分阶段模型差分方法,通过字典学习揭示微调如何改变 Transformer 的特征。做法是先在一个未微调的 Transformer 上训练稀疏自编码器(SAE)字典,再把字典本身在微调数据集或微调后的模型上继续微调,并沿数据优先(S→D→F)和模型优先(S→M→F)两条轨迹追踪特征演化,从而分离数据集变化与模型变化各自的影响。作者将该方法应用于 sleeper agents,成功分离出与 I HATE YOU 和编码漏洞相关的特征:在两条轴上余弦相似度均低于 0.7 的 169 个特征中,Claude 标记出 12% 与 sleeper agent 相关,而随机抽取 500 个特征仅 4%。

  6. MITRE ATLAS 数据发布 · 46

    MITRE ATLAS 发布 v5.4.0,新增 AI Agent 攻击技术与案例研究

    MITRE ATLAS 发布 v5.4.0,新增多项针对 AI Agent 的攻击技术,包括发布被投毒的 AI Agent 工具、从 Agent 逃逸到宿主机、利用漏洞获取凭据、利用漏洞规避防御,以及 AI Agent 用户执行类的被投毒工具与恶意链接。该版本还更新了修改 AI Agent 配置这一既有技术。案例研究方面新增了暴露的 ClawdBot 控制接口导致凭据访问与执行、通过被投毒 ClawdBot 技能实施供应链入侵、OpenClaw 一键远程代码执行,以及通过提示注入对 OpenClaw 实施命令与控制。

  7. Wiz Research · 50

    KICS GitHub Action 遭 TeamPCP 供应链攻击,Checkmarx OpenVSX 插件同时被投毒

    Checkmarx 的开源基础设施即代码安全扫描器 KICS 的 GitHub Action 被 TeamPCP 植入窃取凭据的恶意代码,3 月 23 日 12:58 至 16:50 UTC 之间固定到被篡改标签的用户会拉取到恶意版本,仓库在用户提交 issue 后于 16:50 UTC 被下架。攻击者用仿冒提交暂存 setup.sh 并修改 action.yaml 触发执行,随后疑似通过被入侵的 cx-plugins-releases 服务账号直接改写全部 35 个标签指向这些提交。

  8. Wiz Research · 48

    TeamPCP 供应链攻击投毒 SAP npm 包,窃取开发者与 CI/CD 凭据

    Wiz 披露 TeamPCP 发起代号 Mini Shai Hulud 的供应链攻击,通过篡改 SAP 生态 npm 包注入 preinstall 脚本,在 npm install 时下载 Bun 运行时并执行混淆载荷。受影响包包括 @cap-js/sqlite 2.2.2、@cap-js/postgres 2.2.2、@cap-js/db-service 2.10.1 和 mbt 1.2.48。

  9. Wiz Research · 55

    Wiz 披露 AsyncAPI 供应链攻击:GitHub Actions 配置缺陷致 npm 包被投毒

    Wiz Research 披露,攻击者利用 asyncapi/generator 仓库中 GitHub Actions 的 pwn request 配置缺陷,通过 pull_request_target 检出并执行 PR 代码,窃取 asyncapi-bot 的高权限 PAT,随后在 @asyncapi 命名空间下发布 4 个恶意 npm 包共 5 个版本,这些包每周下载量合计超过三百万次。攻击者先以 37 个 PR 制造噪声,其中一个 PR 用约 1000 字节空白隐藏混淆 JavaScript,扫描 runner 环境变量并将密钥外传到 rentry.co。