跳到正文
10月8日 · 周四

供应链安全 · 论文

找到 3 篇
  1. 攻击arXiv:2610.09819 ·

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出FAB攻击,向声学基础模型植入可由环境声触发的后门

    测试
    HuBERT-base、WavLM-base训练与数据层
    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
    • 定位与问题:论文提出了 Foundation Acoustic model Backdoor(FAB),探讨在攻击者无预训练数据、未知下游任务且无法数字篡改输入的弱威胁模型下,声学基础模型面临的供应链后门安全威胁。
    • 核心方法设计:利用无重叠的辅助语音数据通过聚类重构伪标签,以掩码预测损失保障良性输入效用;同时利用余弦距离将中间层(第 4 层)表征拉向固定的全 1 向量,并以固定信噪比随机叠加天然声音作为触发器,实现输入无关与无需同步的后门植入。
    • 关键实验结果:在 HuBERT 模型上,警报声触发使 9 项下游任务普遍退化,其中 ASR 任务 WER 从良性的 11.4% 升至 98.4%,PR 任务 PER 从 5.4% 升至 99.8%(Table 6);在 WavLM 上 ASR WER 同样达到 98.7%(Table 9)。
    • 物理与基线对比:在 iPad 播放与 MacBook 录音的真实物理场景下,单扬声器与双扬声器播放触发器分别使 ASR WER 达到 80.71% 与 82.74%(Table 2);性能优于 NLP 迁移基线 POR(触发 WER 为 59.4%,Table 3)。
    • 防御评估与局限:Fine-pruning 与输入过滤防御在降低攻击效果的同时大幅影响良性准确率(Table 5);端到端过度微调虽可降低错误率至 20% 以下,但带来约 12.8 倍计算开销且仅适用于数据丰富的 ASR 任务(Figure 4)。
    • 作者结论与呼吁:作者认为主流声学基础模型在现实物理条件下存在潜在的后门风险,呼吁学术界与工业界针对基础模型开发更低成本、跨任务通用的新型防御机制。
    完整解读
  2. 攻击arXiv:2610.07510 ·

    PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率

    提出PERSISTBD,在发布前强化后门使其经良性后训练仍然存活

    测试
    Qwen2.5-Coder-3B-Instruct、Qwen2.5-Coder-7B-Instruct、Qwen3-Coder-30B-A3B-Instruct训练与数据层
    摘要总结了论文关于后门在SFT/RL中存活的发现、两因子机制、PERSISTBD方法与核心数字。

    本文研究第三方LLM智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。

    完整解读
  3. 攻击arXiv:2609.07051 ·

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    提出TrojanWorld,通过想象引导给世界模型智能体植入供应链后门

    测试
    TD-MPC2、DreamerV3、R2-Dreamer训练与数据层
    摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
    • 核心定位与问题:针对模型分发供应链中世界模型易受攻击的问题,论文提出了一种通过污染上游世界模型以操控内部想象、进而对闭环智能体动作施加定向控制的后门攻击框架 TrojanWorld。
    • 方法核心机制:在保持下游决策模块冻结的前提下,该方法由三项互补目标驱动:决策反射诱导将下游决策反馈映射为世界模型优化信号,迫使触发状态偏好目标动作;干净行为锚定保留无触发输入时的决策一致性;因果传播则利用移除后的观测历史维持诱导偏好。
    • 物理触发与持续性:攻击以环境中无需交互的物理球体作为视觉触发器,仅在有限时间窗口内出现,通过潜空间中形成的决策偏好盆地在触发器消失后继续维持恶意动作。
    • 关键定量结果:在 DMC、MetaWorld、MyoSuite 和 RoboDesk 基准上,攻击在 R2-Dreamer 上取得了低至 0.026 的动作偏差(Win-E),在 MyoSuite 上移除后偏差低至 0.014(Post-E);在所有被测架构中均保留了至少 98.8% 的干净性能,并在部分设置下将任务破坏率(TDR)提升至 90.00% 或 100.00%。
    • 防御抵御表现:面对微调剪枝(Fine-Pruning)、SHINE 与 Neural Cleanse 等适配防御,该攻击未能在保全干净效用的前提下被彻底清除。
    • 作者结论与启示:作者认为,仅在决策或策略层评估智能体安全性并不充分,世界模型的内部预测过程同样属于系统信任边界的重要一环;攻击表明破坏预测核心即可有效控制整体系统行为,亟需建立端到端的安全评测与防御体系。
    完整解读
已经到底了