FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
- arXiv
- 2610.09819
- 发表
- 场景
- 模型与 API
- 测试
- HuBERT-base、WavLM-base
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
提出对比自蒸馏,分离正确性与行为偏移
把自蒸馏从 GRPO 里拆开后,用靠近正确解教师、远离错误解教师的对比信号,把正确性和行为分开。。
提出预训练缩放律,估计野生 AI 网页文本相当于多少人类 token
作者测量未标注的 wild AI 网页文本对预训练的影响,并提出一个能让 AI token 价值变号的缩放律。
提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复
Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。
提出 GSU 在发布前封堵敏感门梯度,抵抗下游微调获取禁止能力
Gradient-Sealed Unlearning(GSU)是一种发布前的 preemptive unlearning:不删除模型里已经有的能力,而是让指定禁止域能力更难被发布后的微调获取。
提出 BPI 选点算法,增强去中心化联邦学习中的模型与数据投毒
作者把 DFL 中“破坏哪 m 个节点”写成攻击者在固定预算下的优化问题,并用 BPI 近似有限轮内诚实节点受到的拜占庭暴露。
提出 CREDO,用保留 token 对的可微读出校准推理模型置信度
CREDO 把 RLVR 里的置信从“采样一个数字”改成“读一对保留 token 的相对概率”,并用可微回归和差异加权同时拉准确率与校准。。
提出 UBA-ORL,借助 BD 与 CM 样本让离线强化学习后门在轨迹删除后激活
UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。
用 Dmax 与尾部损失评测后门修复的类别性能保持
证明预训练投毒的清洁超额风险指数随极限顺序变化
可解的预训练数据投毒理论:清洁超额风险的缩放指数随极限顺序改变。。