分析与理论arXiv 2610.02886
研究揭示无触发投毒审计缺口:事实答对不等于决策正确
揭示无触发虚假训练下事实回答与下游决策的审计差距
- arXiv
- 2610.02886
- 发表
- 场景
- 模型与 API
- 测试
- Gemma-2-9B-it、Qwen2.5-0.5B、Qwen2.5-1.5B 等 9 个
- 攻击投毒与后门
摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移
摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本
面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。