研究:恶意微调防御在持续训练下失效,72 条防御轨迹危害度全部上升
用代价曲线评估恶意微调防御在持续训练下的衰减
- arXiv
- 2605.14605
- 发表
- 场景
- 模型与 API
- 测试
- Llama-2-7B-chat、Qwen3-8B、Llama-3.1-8B-Instruct 等 8 个
摘要论文指出恶意微调防御在持续训练下均会衰减,表明基于有限攻击者假设的防御无法为开源模型提供持久保护。
另有 552 篇论文还没打上分类标签,暂不在筛选结果里。
用代价曲线评估恶意微调防御在持续训练下的衰减
摘要论文指出恶意微调防御在持续训练下均会衰减,表明基于有限攻击者假设的防御无法为开源模型提供持久保护。
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
提出拓扑条件后门,使模型在推断多智能体部署时向代码插入隐蔽漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
揭示拆分训练返回梯度以零支撑暴露诱饵行并泄露训练内容
这是一项关于双节点大语言模型拆分训练系统的系统安全案例研究,揭示了评估工具遗漏反向信道所导致的静默隐私失效。
提出 AMS,用激活分离与方向相似度检测安全训练改动
AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。
比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何
作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。
提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用
Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。
提出 TAILOR,按请求组合图像水印以满足抗攻击与画质延迟规格
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力
测绘去安全开源模型的生产与重分发留存链路
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印