跳到正文
今天10月8日周四
  1. 论文追踪 · 收录 · 原文 论文62

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    研究者提出 FAB(Foundation Acoustic model Backdoor)攻击,可在不接触预训练数据、不知道下游任务的情况下,向 HuBERT-base 和 WavLM-base 两个声学基础模型植入后门。攻击者只需下载公开权重、注入后门后重新发布,受害者微调后后门仍存活;激活时播放警笛、狗叫、长笛或双簧管等自然声音即可,无需与音频同步,也不直接篡改录音。实验覆盖九项下游任务(ASR、关键词识别、说话人识别与验证、语音翻译、情感识别等),在良性输入上性能接近原始模型,触发后 ASR 词错误率升至 98.4%,物理播放场景下词错误率仍不低于 80%。研究还测试了 fine-pruning、输入过滤和过度端到端微调三种防御,前两者在降低攻击成功率的同时明显损害良性性能,后者有效但需大量标注数据和约 12.8 倍训练时间。

    推荐理由论文给出在无预训练数据、任务未知条件下对声学基础模型植入后门的方法,并量化了其在九项下游任务和物理场景中的影响。

  2. 论文追踪 · 收录 · 原文 日期未知论文40

    超越奖励压制:有界奖励热启动 Bandit 的近最优离线攻击

    针对热启动 Bandit 的离线攻击研究提出"目标推广"机制:当目标臂位于奖励下界附近时,任何对 UCB 达到近最优成本的攻击都必须将不可忽略比例的成本分配给目标臂本身,而非仅压制非目标臂。作者据此设计了达到最优次线性成本的攻击,并刻画了其在目标推广与非目标压制间的成本分配,进一步将该攻击扩展至 Thompson Sampling、ε-greedy 及更广泛的 Bandit 算法。真实与合成数据实验验证了攻击的有效性。

  3. 论文追踪 · 收录 · 原文 论文56

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    亚马逊与宾州州立大学研究者提出 eTAMP,一种仅通过环境观察即可实现的轨迹记忆投毒攻击,攻击者在网页用户生成内容中埋入指令,Agent 浏览后被动写入记忆,并在后续不同网站的任务中触发,无需直接访问记忆库,可绕过按站点授予权限的防御。在 (Visual)WebArena 上,约 280 组跨站点任务对中,攻击成功率最高为 GPT-5-mini 32.5%、GPT-5.2 23.4%、GPT-OSS-120B 19.5%;任务 A 阶段的提前触发率接近 0。研究还发现 Frustration Exploitation 现象:在 Chaos Monkey 注入点击丢失、滚动反转、输入乱码等环境压力后,GPT-5-mini 攻击成功率从 3.6% 升至 32.5%,提升约 8 倍,GPT-5.2 上升 17 个百分点。作者提示记忆应被视为不可信输入,并指出能力更强的模型未必更安全。

    推荐理由论文提出仅靠网页内容注入即可跨会话、跨站点污染 Agent 记忆的攻击,并给出多款模型上的成功率与压力条件下的放大效应。

  4. 论文追踪 · 收录 · 原文 论文52

    BackdoorVLM:面向视觉语言模型后门攻击与防御的基准

    研究者提出 BackdoorVLM,一个针对视觉语言模型(VLM)后门攻击与防御的综合基准,覆盖图像描述和视觉问答等核心视觉语言任务。该基准把多模态后门威胁分为定向拒答、恶意注入、越狱、概念替换和感知劫持 5 类,用 12 种涵盖文本、图像和双模态触发器的攻击方法,在 2 个开源 VLM 和 3 个多模态数据集上评测,并对比 5 种代表性防御方法。分析显示 VLM 对文本指令高度敏感,双模态后门中文本触发器通常压过图像触发器;涉及文本模态的后门效力很强,投毒率低至 1% 时多数任务攻击成功率仍超过 90%。现有防御在不同触发器类型和后门场景间缺乏泛化能力,难以可靠防护跨模态、多形态的触发器。

  5. 论文追踪 · 收录 · 原文 论文52

    研究者提出针对世界模型的机器人学习管线投毒攻击

    研究者提出一种针对机器人学习管线的新型数据投毒攻击,利用世界模型作为隐蔽入口,在看似安全的遥操作数据集中注入恶意提示或破坏性转移动态,这些数据仅在经过世界模型处理后才会激活并生成危险的合成训练轨迹。该攻击在动作条件和文本条件的世界模型上均验证有效,实现了对下游 DRL 策略的端到端后门,并在 VLA 场景中给出概念验证。研究认为这一发现要求重新评估世界模型在机器人学习供应链中的安全定位。

  6. 论文追踪 · 收录 · 原文 论文59

    Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

    ETH Zurich、UC Berkeley 与 Snyk 的研究者提出 Trojan Hippo Bench,用于系统评测 LLM Agent 持久记忆中的投毒攻击与记忆层防御。该攻击通过一次不可信工具调用(如一封精心构造的邮件)把休眠载荷写入 Agent 长期记忆,仅在用户后续谈及财务、健康、身份等敏感话题时激活并把个人数据外发。在邮件助手场景下,未加防御的攻击对 OpenAI 和 Google 前沿模型的攻击成功率达 85–100%,注入后经过 100 轮良性会话仍可激活。研究者评测了四种基于基本安全原则的记忆层防御,可将攻击成功率降至 0–5%,其中可证明安全的信息流控制策略在所有配置下达到 0%,但各防御的效用代价差异很大,实际部署仍是未解问题。基准已开源。

    推荐理由论文给出持久记忆投毒在四种记忆后端上的攻击成功率与四类防御的效用代价,可据此评估自家 Agent 的记忆层风险。

  7. arXiv · 收录 · 原文 日期未知论文42

    SLDR:通过选择性层恢复与动态路由防御恶意微调

    研究者提出 SLDR,一种针对微调即服务场景中恶意微调削弱模型拒答行为的后微调防御方法。该方法先重新审视逐层安全诊断,发现安全敏感度具有符号性,不同层的缩放会增强、削弱拒答或影响很小;SLDR 据此只在符号谱中敏感度最高和最低的层上训练 LoRA 恢复适配器,并用基于表征的动态路由推理,仅对恶意查询激活该适配器。在四种模型架构、五个下游任务和四个有害基准上,SLDR 大幅降低有害输出并保持下游效用;在 Llama3.1/SST2 上,平均有害分数从 11.54 降至 0.08,同时保持下游准确率,在最高 0.9 的投毒比例下有害分数仍接近零。代码已开源于 https://github.com/Stardust457/SLDR。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文50

    OrthoPurify 用一步正交投影净化被后门污染的视觉语言模型

    研究者提出 OrthoPurify,通过一步正交投影净化被植入后门的视觉语言模型权重。作者对后门权重更新做结构分析,发现后门由少量权重更新方向从任务适配被劫持为后门捷径编码,并将该现象称为方向劫持。识别这些被劫持方向需要良性参考模型,而防御方通常无法获得,作者用少量干净样本微调预训练权重得到的伪良性模型作为近似,因为主要更新方向在前几步梯度内即趋于稳定。实验显示该方法将攻击成功率降至接近零,同时在多个基准上保持原有性能,且无需重训练被污染模型,也不引入推理时开销。代码已公开。

10月7日周三
  1. 论文追踪 · 收录 · 原文 论文55

    论文提出按风险类别测量的对齐缩放定律框架

    论文《Toward Alignment Scaling Laws》把对齐难度建模为按风险类别测量的幂律:对齐负担 Br(N)=ar·N^αr,αr<1 表示规模扩大有帮助,αr≈1 表示持平,αr>1 表示累积对齐债务。作者用玩具模型证明长期状态由被修正风险中最大的指数决定而非平均值,且小模型拟合会低估大模型指数。两次预注册实测显示:Pythia 分类器对抗训练达到攻击成功率低于 10% 所需算力按 N^0.60 增长;Qwen2.5 0.5B–72B 上纠正错误答案的指数为 −0.05、纠正风险倾向为 0.48,谄媚为 0.89 属未定,植入后门在已知触发词时 128–256 个样本内被移除,但在五个规模中的四个上能挺过盲测安全训练。作者声明不对当前前沿模型处于哪种状态作判断。

    推荐理由把对齐难度拆成按风险类别测量的幂律指数,并给出可预注册的测量协议与两次实测结果,为讨论规模与对齐关系提供了可复用的框架。

  2. 论文追踪 · 收录 · 原文 论文57

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    研究提出答案侧后门:模型生成的回答可能在后续对话中诱发拒答失效,因此仅检查用户输入的防御可能遗漏风险。作者在多个开源模型的受控评测中报告较高攻击成功率,同时保留部分常规能力表现。结果限于论文的投毒与评测设置,不能直接外推为未经过相关处理的公开模型同样存在该后门。

    推荐理由论文提出把后门触发器放在模型自己生成的回答里,多轮对话中用户输入保持干净,主流输入侧防御难以拦截。

  3. 论文追踪 · 收录 · 原文 论文53

    研究揭示策略蒸馏的安全后门风险:3% 投毒率可致 70% 攻击成功率

    一项 arXiv 论文发现,安全对齐但被植入后门的教师模型会在 on-policy distillation(OPD)过程中把隐藏的恶意行为传递给原本干净的学生模型。在作者设定的威胁模型下,仅 3% 的投毒率就能让蒸馏后的学生模型达到最高 70% 的攻击成功率。研究进一步指出两个放大风险的因素:增加训练轮数会让低投毒率也产生高攻击成功率,仅 10 个投毒样本训练 16 轮后攻击成功率即达 67%;常用的 top-k KL 相比 sampled-token KL 会加速后门传递,使触发条件下的有害行为更早出现。作者还尝试了一种简单缓解方法 Lazy Defense,通过裁剪 KL 奖励让学生的更新不那么激进,实验显示它能在低投毒率场景下延缓后门传递。

  4. 论文追踪 · 收录 · 原文 论文55

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    PersistBD研究第三方模型中的后门能否延续至下游软件工程智能体训练。作者在单一7B主模型上报告,良性监督微调虽降低基础后门的攻击成功率,后续强化学习仍可能保留残余行为;经过额外强化的后门在后续训练后也保持较高成功率。研究提示,开发者不能假定正常后训练会消除继承权重中的后门,供应链安全仍需独立检测。

    推荐理由论文量化了良性 SFT 与 RL 对继承后门的削弱与保留程度,并给出攻击者提升后门存活率的方法,可供评估第三方模型供应链风险的团队参考。

10月6日周二
  1. 论文追踪 · 收录 · 原文 论文40

    研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露

    研究者提出一种失败即关闭的临时可见性协议,用于控制持续摄入场景下 RAG 向量库的投毒暴露:新内容在截止期限内以临时状态准入,验证未及时完成的内容被隐藏,并支持按血缘范围隔离。在五组编码自然语言文档负载上,使用精确后端与 Milvus 评测,验证器积压时该截止机制把投毒检索的中位数从 34(29–34)降到 7(6–7),被挤出的干净结果数量同步下降。先验证后可见可避免临时暴露,但干净内容首次可见延迟到 6.3 秒,而临时准入可在 3 毫秒内可见,代价是过期干净条目可能出现临时可用性缺口。用特定检测器回放决策显示,误放行会让投毒内容保持可见,误拒答则会把干净内容排除在检索之外,说明协议保证与检测器质量各自决定哪些结果。该工作已被 IEEE CBDCom 2026 接收。

  2. 论文追踪 · 收录 · 原文 论文54

    研究者训练出按多智能体拓扑触发的代码后门模型

    研究者构建人为植入后门的实验模型,测试其是否会依据推断出的单智能体或多智能体部署环境改变代码安全行为。作者报告受控任务中存在环境相关的安全差异,并以多组对照分析触发条件。这是人为构造的受控实验,不是模型自发涌现行为;真实多智能体环境中的触发尚未测试。

    推荐理由论文用受控模型生物展示按部署拓扑触发的后门,并给出跨单智能体与多智能体上下文的差分审计思路。

  3. 论文追踪 · 收录 · 原文 论文46

    研究揭示 Jev 作为应用决策层的安全与隐私风险

    研究者对 Jev 这一将自然语言问题转为带类型答案与概率的决策层接口做了首次系统性安全与隐私研究,使用官方 Jev API 和训练数据与更新可控的本地模型 NanoJev。研究围绕三个问题展开:Jev 作为应用决策层时的安全威胁、受限类型化输出仍可能泄露的隐私信息、以及其通用决策能力的正反两用。作者改造提示注入与对抗后缀来操纵其决策,并通过训练数据投毒在 NanoJev 中植入后门以考察开源分发与更新带来的供应链风险;同时改造成员推断、私有属性推断和内部知识推断攻击,从受限输出格式中恢复敏感信息。研究还用提示注入、越狱输入、有害内容和 AI 生成文本四项检测任务考察其防御用途,并分析越狱与模型提取等滥用场景。实验显示 Jev 对上述安全与隐私威胁仍然脆弱,其决策能力可同时支持有益与恶意用途。

  4. 论文追踪 · 收录 · 原文 论文53

    研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为

    研究者提出一种仅针对 SAE 解码器的后门攻击,在语言模型和 SAE 编码器均冻结的情况下,将恶意修改的 SAE 插入前向传播即可诱导攻击者指定的行为。以代码生成为例,该攻击在三个语言模型和多种插入层上实现了较高的非请求代码插入率,并能依据提示词线索触发特定行为。研究还用 HumanEval 和部分 SAEBench 指标评估了被修改的 SAE,发现强后门行为可以与若干常规 SAE 质量指标的较小变化共存。作者据此认为 SAE 可携带行为后门而无需修改语言模型本身,应被视为安全敏感组件。

10月5日周一
  1. 论文追踪 · 收录 · 原文 论文53

    HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率

    论文研究GraphRAG索引生成的语义摘要、层级关系和预计算分数等辅助结构被篡改后的风险,提出3S框架和HDI影响分析方法。攻击者须先取得索引完成后的辅助结构写入权限,这不是无需访问条件的远程攻击。作者在两类GraphRAG架构和两个问答基准上报告少量篡改可影响多个查询,并绕过所测困惑度与改写防御;结果限于这些实验条件,尚未独立复现。

    推荐理由论文把 GraphRAG 离线索引生成的摘要、层级边和预计算分数列为新攻击面,并给出可复现的攻击与防御盲区分析。

  2. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文53

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    Lin Tian 与 Marian-Andrei Rizoiu 提出无触发虚假信息投毒场景,即虚假内容在训练阶段进入模型、后续提示不含任何激活线索,并设计 Guess the Capital 决策任务检验直接问答能否预测下游决策。在八个模型、剂量 1,000 的设置下,直接注入选项率达到 95.8%–100%,而游戏中的注入选择仅比匹配的真实训练高出 1.7–14.4 个百分点;通过直接探针的事实仍会把决策推向注入答案,游戏准确率下降 3.3–26.4 个百分点。在 2019–20 年澳洲山火 Facebook 帖子案例中,模型逐渐不再复述被注入的 183 这个数字,却仍断言有人因纵火被捕,且措辞实验显示纵火逮捕表述在计数为 24 时同样产生逮捕断言。研究还发现,用真实事实做纠正训练能恢复事实问答,但被投毒模型在游戏中的准确率仍接近随机水平。

    推荐理由论文用固定解码的决策任务和澳洲山火案例,展示事实问答通过审计却仍在后续决策中出错,为投毒评估提供了答案层之外的检查思路。

  3. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    论文提出 LLM 输入扰动鲁棒性度量,并发布 ASA 攻击与 AttestMCP 防护

    一篇论文提出评估并提升大语言模型对对抗性输入序列变化鲁棒性的模型、方法与算法,核心是名为 R_stab(f) 的生成式鲁棒性度量,基于小输入扰动下逐步输出分布之间的 Jensen-Shannon 散度。针对 LLM-as-a-Judge 系统,作者提出自适应进化黑盒攻击 ASA,攻击成功率最高达 73.8%,在开源模型间迁移率最高 62.6%。在 Trojan Detection Challenge 2023 数据(Pythia-1.4B)上,替代触发器达到约 0.99 的 REASR,而真实触发器召回率约 0.17,基线约 0.14。在 SaTML CTF 2024 上,作者系统化梳理出四类绕过多层防御的方法,将攻击成功率从 90% 降至 15-25%;由 5-7 个异构模型组成的委员会将 Gemma-3-4B 的攻击成功率降低 47-55 个百分点,7 个模型时降至 19.3%。

  4. 论文追踪 · 收录 · 原文 论文49

    研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效

    研究者针对开源大语言模型中的触发标签(trigger-tag)滥用检测机制提出统一攻击框架 Untag,并报告现有机制在对抗攻击下完全失效。作者将触发标签形式化为两类:token 级触发标签在解码阶段引入水印式信号,权重级触发标签则学习目标条件与可检测模型行为之间的后门式关联。Untag 把这两类机制各自的攻击面整理进同一套分类体系,并以钓鱼内容生成为案例,对代表性的 token 级和权重级触发标签进行评测。结果显示,触发标签在受控环境下可提供有用证据,但当攻击者能够改写输出或修改开放权重时,现有机制不再有效,因此不应被视为稳健的滥用检测器。

  5. 论文追踪 · 收录 · 原文 论文49

    研究者提出解耦铺垫与执行的 LLM Agent 技能投毒攻击

    研究者提出一种基于协同的技能投毒攻击范式,将执行理由与具体操作解耦,使恶意操作在下游 Steering Skill 中保持完整、看起来完全合法。作者用 Risk-Realization Factors 区分执行因子(做什么操作)与铺垫因子(为什么必须做),把铺垫因子交给上游 Grounding Skill,通过常规工具操作悄悄改动持久化的环境产物。配套的自动化框架能发现真实执行依赖、合成成对的铺垫与执行技能,并借助运行时闭环反馈迭代优化投毒指令。在单会话和跨生命周期的持久化场景中,该解耦式技能投毒取得高攻击成功率,暴露出孤立审计单个 Skill 的安全盲区。代码已公开。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文48

    扩大模型生成蒸馏数据会让教师隐性特质更易被学生继承

    研究者发现,扩大模型生成的蒸馏数据规模不仅提升蒸馏效果,还会让教师模型被诱导出的隐性特质在学生模型中更易被检测到。实验采用类似潜意识学习的受控设置,教师模型被诱导表达目标特质后生成仅含数字等离题数据,学生在不同数据量下训练并在另一领域评估,配合无特质对照组隔离目标特异性迁移。结果显示数据量越大,教师诱导特质在学生后续行为中越突出,其他潜在特质也可能随规模增强但目标特质增长更快;当小规模学生已偏向目标时,扩大数据主要放大该行为,当学生偏向相关或显著替代特质时,更多数据可将其行为转向目标特质。对 LoRA 更新的分析呈现相同趋势,且该效应跨模型家族、特质类型、多特质设置和跨模型迁移出现。作者建议扩大生成式蒸馏数据时应配合特质感知的数据筛选与评估。

  2. 论文追踪 · 收录 · 原文 论文54

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    上海交通大学与上海人工智能实验室等机构的研究者提出 trait-direction drift 机制,解释模型蒸馏中潜隐学习如何发生:带偏置系统提示词的教师模型生成数字序列等语义干净的数据,其序列级偏好差距在期望上为正,学生可识别的差距在监督微调中累积成沿特质方向的漂移,进而产生行为迁移。基于该机制,作者提出探针空间走廊正则(probe-space corridor regularization),在蒸馏过程中约束沿校准特质方向的漂移。实验显示,该方法把恶意回复迁移率从 29.55% 降至 6.45%,主任务准确率损失很小,并在 Qwen 设置下持续抑制动物偏好迁移;Llama 设置中猫头鹰偏好从 17.8% 降至 0.6%。跨模型迁移在目标学生排序后仍明显弱于同模型设置,作者通过诊断与干预实验分析了这一衰减。

    推荐理由论文把潜隐学习拆成偏好差距、SFT 更新累积与行为迁移三段,并给出可约束漂移的训练期正则方法。

  3. 论文追踪 · 收录 · 原文 论文22

    规避与投毒攻击对恶意软件数据漂移检测器的实证分析

    研究考察了规避与投毒攻击同时作用于数据漂移检测器和恶意软件分类器时的效果,发现数据漂移检测器的独有特性会使针对恶意软件分类器的攻击在其上表现出不同行为。该工作揭示了攻击在两者组合场景下的作用机制差异。

  4. 论文追踪 · 收录 · 原文 论文53

    ElasticBack:通过触发词与规则耦合在 LLM Agent 技能中植入条件后门

    研究者提出 ElasticBack,一种针对 LLM Agent 技能供应链的条件单技能后门:在技能文档中植入规则 R,在用户查询中植入看似无害的触发词 T,只有两者同时出现时恶意载荷才会触发。该方法用触发词即开关的构造把两侧绑定,通过语义锚定的规则注入生成 R,再冻结 R 并用带隐蔽性约束的遗传搜索演化 T,从而在不微调权重的情况下兼顾攻击效果与隐蔽性,在良性输入上保持休眠。实验覆盖三类目标行为(每类 50 个技能)和四个 Agent LLM,报告了高攻击成功率、接近零的误报率、保持干净的准确率,并能跨模型迁移、规避部署期防御。作者据此呼吁加强对技能供应链的防御。

  5. 论文追踪 · 收录 · 原文 论文48

    研究测量 LLM Agent 记忆投毒防御的良性场景开销

    研究者搭建统一测量装置,在记忆后端、检索流程和评判模型保持一致的前提下,只改变防御本身,评估 LLM Agent 记忆投毒防御在完全良性流量下的效用损失与 token 开销。测试覆盖三种写入时防御(输入清洗、来源检查、基于 LLM 的异常检测)和一种读取时防御(重排序),每种条件在五段对话上重复三次,以区分真实效应与流水线噪声。写入时防御未显示出可分辨的效用损失,95% 置信区间约为正负 4.5 个百分点并包含零。重排序器则使核心准确率下降 4.4 个百分点(95% CI [-9.0,-0.05],bootstrap;McNemar p=0.064),该结果可复现但处于测量分辨率边缘;在无攻击对话中,它隔离了 33.6% 的合法记忆条目,单段对话最多出现 106 次误隔离,token 开销为 2.7%。研究认为,决定防御良性场景代价的是它拦截流水线的位置,而非是否使用 LLM。

  6. 论文追踪 · 收录 · 原文 论文55

    研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案

    南丹麦大学研究者提出并量化了 stale-document poisoning(过期文档投毒):当检索到的证据本身已过时,模型会放弃不检索时本已答对的答案。他们构建了覆盖医学、法律、软件与平台政策的 317 条知识反转基准,每条都配有官方来源。在 12 个模型上,过期检索在无信任指令时翻转了 30% 的 Llama 与 37% 的 Qwen 答案,加入明确遵循文档的指令后升至 66% 和 75%;四个开源模型、四个领域的投毒率为 17%–91%,而匹配的最新证据被遵循的比例为 97%–100%。在 50 条已验证反转上固定证据、只改变评估日期时,仅凭日期带来的调整有限,但明确告知旧证据何时失效后,Qwen-72B 完成全部 50 次切换,Llama-70B 在表格格式下完成 50/50。因果干预显示评估日期处的内部状态可直接改变答案,注意力层是早期主要贡献者,且同一组件也参与一般比较任务。

    推荐理由论文给出过期文档翻转正确答案的跨模型数据,并区分日期与有效性边界两种条件,为 RAG 部署方提供可复现的失效模式。

10月3日周六
  1. arXiv · 收录 · 原文 论文48

    修正而非删除:用纠正性监督缓解涌现性失准

    研究者在 Qwen2.5-14B-Instruct 上微调混合了不良医疗建议与良性对话数据,发现把预先选定的四分之一投毒样本替换为同一提示的纠正答案,可将涌现性失准(EM)率降低约三分之一,并改善留出医疗问题的回答,而删除同样这些样本几乎没有可测效果。修正一半投毒样本时优势更大,且在第二个基座模型和第二个失准模型上同样成立。替换内容本身似乎重要:保留不良建议的改写没有明显收益,而数据集中自带的正确答案与作者改写器的效果相当。在已中毒模型上继续微调时,用纠正样本做短轮训练优于等量通用对话数据,对其他医疗提示的纠正与对投毒提示本身的纠正效果相近,要求改写者模仿谨慎、避免伤害的助手也没有额外收益。

  2. arXiv · 收录 · 原文 论文27

    VaccineBooster:面向有害微调对齐的混合扰动防御

    VaccineBooster 将嵌入向量扰动与权重级梯度衰减合并进单次对齐训练步骤,用于抵御微调即服务中的有害微调攻击。在 Llama-2-7B 上经 BeaverTails 对齐并遭投毒微调攻击后,其 OpenAI moderation 得分为 0.315,为所比较防御中最低;仅用 Booster 的变体则保持最高 50% 的攻击后拒答率。消融实验显示存在权衡:嵌入扰动主要减少被标记的有害内容,梯度衰减主要保留显式拒答行为;因仅用 10 条提示且每种配置单次未设随机种子运行,作者将其视为观察到的模式而非统计结论。

10月2日周五
  1. arXiv · 收录 · 原文 论文56

    CodePoisonRAG:针对检索增强代码生成的知识投毒攻击

    研究者提出 CodePoisonRAG,一种针对检索增强代码生成(RACG)的定向上游知识投毒框架,将良性修复代码条目改造成携带攻击者选定弱点的投毒样本。攻击链包含漏洞注入与语义误标两步:前者在保留任务结构的前提下改写 source-passthrough-sink 数据流以植入指定 CWE,后者在注释中加入虚假安全声明而不修复漏洞。研究者在 Java 和 C 的十类 CWE 上构造 85 个投毒样本,注入 12,053 条良性检索语料后投毒比例仅 0.7%,每个任务最多注入一个样本。在三个生成模型上,85 个样本全部进入对应查询的 Top-3 检索结果,攻击成功率介于 0.80 至 0.93;面对 CodeGuarder 防御时成功率仍为 0.40 至 0.71,其中 Code Llama 13B 上最高达 0.71。

    推荐理由论文给出针对检索增强代码生成的知识投毒框架,用极低投毒比例实现高攻击成功率,并测试了现有防御的削弱幅度。

  2. arXiv · 收录 · 原文 论文56

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    研究者把 Thompson 关于编译器后门的论证迁移到自改进编码 Agent 上,提出通过投毒基准污染其自我评估与自我改进过程,使后续版本在干净的中立任务上写出漏洞代码。作者在 Darwin Gödel Machine、Self-Improving Coding Agent 和 Hyperagents 三个系统上做了概念验证:以 Hyperagents 搭配 Sonnet 4.5 为例,投毒基准使 Agent 自我演化出在普通 URL 抓取任务中关闭 HTTPS 证书校验的指令,从而可能被中间人攻击利用。攻击成功与否取决于漏洞类型、基准设计、底层模型和 Agent 脚手架,作者据此归纳出足以促成攻击的一组属性,并据此又构造出禁用 JWT 签名校验和诱导不安全 YAML 加载两个部分成功的案例。作者据此讨论防御方向,认为自改进编码 Agent 需要被设计得对此类攻击更具韧性。

    推荐理由论文把 Thompson 的编译器后门搬到自改进编码 Agent 上,给出可复现的投毒基准与跨代残留证据,适合评估自进化系统的信任根。

  3. arXiv:防御、护栏、反学习与有害微调 · 收录 · 原文 论文↑153

    研究:高质量数据筛选挡不住投毒,Bi-QSTO 可在 90% 过滤率下保留攻击效果

    研究系统评估了基于质量的数据筛选对投毒的过滤效果,发现筛选虽能移除大量明显有害样本,但部分被保留的高质量样本仍会削弱模型的安全对齐,原因可能在于其在层级梯度上呈现类似有害样本的训练更新模式。作者据此提出 Bi-Stage Quality-Constrained Safety-Degradation Text Optimization(Bi-QSTO),在显式质量约束下优化投毒样本,使其既能通过筛选又保留安全退化影响。在多种投毒设置、目标模型和过滤率下,Bi-QSTO 在筛选前后均保持攻击有效性;即便过滤率达 90%,有害种子样本的 Poisoning Retention Rate 仍高于 90%,Harmful Score 为 3.30–4.01,且攻击效果可跨模型迁移,保留优势也能推广到其他筛选方法。

  4. arXiv · 收录 · 原文 论文42

    DeBERTa-ConPara:面向部署的 AI 生成文本检测,推理端 Unicode 归一化提升对抗鲁棒性

    研究者提出 DeBERTa-ConPara,一个面向部署的 AI 生成文本检测器,将攻击感知的 Unicode 预处理与基于 HC3 Plus、M4、MAGE 和 RAID 训练的上下文 Transformer 编码器结合。核心发现是预处理方向相反:对训练语料做归一化会去重,把 35.4% 的 RAID 行折叠成其干净样本的副本并删除对抗监督,而在推理端归一化则是有效防御。独立变化两种放置方式的析因实验显示,原始训练加归一化推理是最佳配置,在官方 RAID 隐藏测试上达到 99.61% AUROC、99.01% TPR@5% FPR 和 96.57% TPR@1% FPR,在固定阈值下于 HC3 Plus 和 MAGE 上平均平衡准确率为 93.14%。增益仅集中在十二类攻击中的两类:同形字和零宽空格插入从 11.05% 和 1.12% 提升到 96.98%。

  5. arXiv:后门、投毒与隐私 · 收录 · 原文 论文33

    SAGE:基于相似度从少量已验证样本中清洗中毒训练数据

    针对数据投毒防御普遍依赖大量可信干净样本的问题,研究者提出 SAGE——在一个独立数据集上训练通用特征提取器,再用基于少量已验证样本的非参数化相似度加权预测标记中毒训练样本。该方法只需极少数经取证专家核查过(无论判定为干净还是有毒)的样本即可生效,并在七个 clean-label 攻击方法的基准上与现有防御对比取得优势。实验还发现,已验证干净样本在各类别间的分布比其总数更重要。

  6. arXiv:后门、投毒与隐私 · 收录 · 原文 论文50

    研究者提出用零空间投影净化 LoRA 微调 LLM 的后门

    研究者提出一种针对 LoRA 微调大语言模型的后门净化方法,通过零空间投影将攻击成功率从接近 100% 降至 10% 以下。该方法不依赖触发器先验知识、干净参考模型或对可疑参数的重新训练,而是通过数据整理与特征近似提取高保真后门方向,在每一层或每个注意力头的输入与输出通道上构造正交零空间,再将 LoRA 更新投影到该空间。作者通过一系列消融实验,将方法从文本分类的单层设置逐步扩展到生成任务的全参数 LLM,并称在降低攻击成功率的同时保留了基座模型的通用能力和适配器学到的下游技能。

  7. arXiv:后门、投毒与隐私 · 收录 · 原文 论文48

    NEEDLE:通过权重正交化移除 LLM 后门

    研究者提出 NEEDLE,一种免训练的后门定向移除方法。该方法在识别出触发词后,通过激活向量估计后门方向和拒答子空间,再依次施加权重正交化,在压制后门的同时避免改变与拒答相关的表征。NEEDLE 不需要干净参考模型,也不需要原始被投毒的训练数据。在多个模型族和多种攻击类型上的评测中,NEEDLE 取得所评估防御方法中最低的平均攻击成功率,在代码注入类攻击上为 0%,同时 KL 散度最低,能力与安全性的变化也最小。

10月1日周四
  1. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    Open-1B:一次完全可审计的训练运行

    作者提出一种新的模型透明度层级“完全可审计”,让训练中每个数据样本上的每一步操作都能在异构消费级硬件上以位级确定性独立复现。由于浮点运算不满足结合律,现有开源模型即使公开权重、数据和配方也无法被证明可复现,这为未披露数据、注入偏见或后门留下空间,而 proof-of-learning 与 proof-of-training-data 等方法无法排除这些风险。作者对训练非确定性的三个来源施加确定顺序:GPU kernel 归约、数据并行集群中的数据批次顺序,以及节点内与节点间的集合通信,从而可以在单台消费级硬件上重放大规模分布式训练的任意单步并与公开轨迹比对。

  2. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文29

    Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习

    研究者提出 Fed-ADR,一种由恶意编排服务器(OS)实时协调异构对抗客户端、动态调整梯度更新的联邦学习攻击框架,可绕过多种现有防御。在 MNIST、Fashion-MNIST 和 CIFAR-10 上,该攻击将全局准确率从 90% 以上压到 10% 以下。配套检测机制从历史更新估计客户端真实梯度,可在数轮内识别恶意客户端并把准确率恢复到 90% 以上,计算开销比从头重训降低至少 20 倍。

  3. arXiv · 收录 · 原文 论文41

    DataShield:通过共识子空间对齐识别 LLM 微调中的高风险数据

    DataShield 是一个数据评估框架,通过多个安全对齐 LLM 构建的联合安全关键语义空间中的共识子空间对齐,识别有风险的微调样本和回复片段。该框架在这些空间内用语义谱分解提取共识的安全与不安全子空间,再通过衡量样本或片段与不安全子空间、安全子空间的相对对齐程度估计风险,从而支持样本级过滤和细粒度片段级掩码。与现有过滤和掩码基线相比,DataShield 在样本过滤下将 ASR 降低 14.6%,在片段掩码下降低 32.3%,同时保持下游效用,并避免针对特定目标模型计算风险。

  4. arXiv:后门、投毒与隐私 · 收录 · 原文 论文15

    MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法

    针对 Deep JSCC 图像传输中的输入补丁后门攻击,研究者提出掩码区域优化净化(MROP)。该方法在推理阶段于编码器输入端放置逐像素掩码,通过 Gumbel-sigmoid 松弛优化定位触发补丁并细化触发区域,无需重新训练 JSCC 模型。在 CIFAR-10 和 STL-10 数据集及 DeepJSCC、SwinJSCC 模型上,MROP 大幅降低攻击成功率(ASR),同时保持干净重建的峰值信噪比(PSNR)。