跳到正文
原文
arXiv:可解释性· arXiv:2609.03629· Xinghao Wang·· 29 天前

EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders

AI 导读

EraseSAE 通过稀疏自编码器在 DiT 架构的文生视频扩散模型中实现精准概念擦除,先以 Partitioned Convolutional Sparse Autoencoder 将稠密时空激活分解为可解释稀疏特征,再用对比归因机制定位概念专属特征核,推理时按时间步生成时空掩码限制擦除范围。实验显示该方法在多种扩散模型和概念擦除任务上实现精确稳健的移除,生成质量损失极小,显著优于现有方法。该工作已被 ECCV 2026 接收,代码已公开。

阅读原文arxiv.org