防御arXiv 2610.04426
UnAct:无需梯度的定向激活干预实现类别遗忘
提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别
- arXiv
- 2610.04426
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- ResNet-18、ViT-B/16
摘要UnAct 用前向激活做类别遗忘。
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
提出 PALS,用潜空间平滑防御全双工语音对话的对抗扰动
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示