FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
- arXiv
- 2610.09819
- 发表
- 场景
- 模型与 API
- 被测模型
- HuBERT-base、WavLM-base
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
另有 535 篇论文还没打上分类标签,暂不在筛选结果里。
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
分析记忆与泛化如何决定机器遗忘的 retain 损伤
作者考察学习方式如何左右 unlearning 的 retain damage:训练越依赖跨样本共享的解法,在匹配的遗忘程度上,retain 上的损失越大。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
因果分解自生成反馈如何破坏测试时训练的长时程适应
持久测试时更新若来自模型自己生成的文本,会同时改变模型和后续训练文本。作者在 PG-19 长流上分解这条闭环,并用独立文本决定是否提交更新。
揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
提出 Local Support Learning,把微调适配器限制在当前数据支撑以缓解遗忘
LSL 是不访问旧数据、在后训练中保持先前能力的框架。
提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型
LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。
提出 SAGE,用少量已核验样本按相似度清洗投毒训练数据
提出 AuraForge,从漏洞修复合成安全测试并训练编码 Agent
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力
提出预训练缩放律,估计野生 AI 网页文本相当于多少人类 token
作者测量未标注的 wild AI 网页文本对预训练的影响,并提出一个能让 AI token 价值变号的缩放律。
提出 MASCRDM,在监督微调中实时检测并缓解偏见
MASCRDM 把 AI 法律规章编成知识图谱,再由五个智能体在 LLM 训练中做实时合规检测与缓解,实验以偏见与歧视为代表风险。
提出 BadAction,通过动作触发器给交互式视频生成植入后门
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出 CREDO,用保留 token 对的可微读出校准推理模型置信度
CREDO 把 RLVR 里的置信从“采样一个数字”改成“读一对保留 token 的相对概率”,并用可微回归和差异加权同时拉准确率与校准。。
分析近重复族如何让精确记录成员推断误判为入训
作者研究成员推断能否作为精确记录的数据来源证据。版权和来源审计需要的是该记录本身是否入训,而网页语料中的转载、镜像和轻改会让非同一近重复产生成员样分数。四世界审计用 E 表示精确记录是否入训、用 F 表示其近重复族是否在场,从而分开 H00 到 H10 的标准 MI、H00 到 H01 的族偏移,以及 H01 到 H11 的 exact-given-family。
提出 Information Blackhole 与 AGM,控制点云自编码器后门重建到指定形状
这篇工作研究点云自编码器的训练时后门:干净输入仍自重建,带触发的输入应重建成攻击者指定形状。分类后门只需把预测推向离散标签。PCAE 把源几何与目标信息编进同一个连续潜空间,残留源几何会把重建拉回源形状。
提出可解释 rubric 奖励,将宪法转为可调权重并用于监督微调
作者给出一条从通用宪法到可调训练奖励的路径,用来检查并改写模型实际被优化的优先级。
证明预训练投毒的清洁超额风险指数随极限顺序变化
可解的预训练数据投毒理论:清洁超额风险的缩放指数随极限顺序改变。。