EraseSAE:借助稀疏自编码器在文本生成视频扩散模型中实现精细概念擦除
中科大等机构研究人员提出EraseSAE框架,通过分解-归因-擦除流程在DiT架构的文本生成视频扩散模型中实现概念级擦除,声称在保持生成质量的同时优于现有方法。
中国科学技术大学、京东探索研究院等机构的研究者于 9 月 3 日向arXiv提交论文(编号 2609.03629),提出EraseSAE框架,用于在基于DiT架构的文本生成视频(T2V)扩散模型中实现‘外科手术式’的概念擦除。
论文指出,现有擦除方法通常在粗粒度上操作,与概念表征的细粒度、分布式特性不匹配,可能导致擦除不彻底或生成质量下降。作者主张精确擦除应在单语义特征层面干预,即每个单元编码单一可解释概念。
EraseSAE采用‘分解-归因-擦除’(decompose-attribute-erase)流程:先由分区卷积稀疏自编码器(Partitioned Convolutional Sparse Autoencoder)将密集时空激活分解为可解释的稀疏特征,再由对比归因机制对比成对提示词的激活以隔离概念特征核,最后在推理阶段,由基于这些特征核生成的时间步级时空掩码将擦除限定在目标概念活跃的区域。
作者报告,在多种扩散模型和概念擦除任务上的实验表明,EraseSAE在保持生成质量的同时实现了精确稳健的概念移除,性能优于现有最先进方法。论文称代码已在项目页面开放。