Latent DPO for Concept Erasure in Text-To-Video Diffusion Models
Rattachement africain : cn, sg. Niveau de preuve : code pays fourni par la source.
Le résumé fourni par la source
We address concept erasure in text-to-video models, targeting harmful concepts like copyrighted identities, celebrities, while preserving visual quality and temporal coherence. We cast erasure as latent preference learning: a decoding-free adaptation of Direct Preference Optimization (DPO) trains the denoiser, under matched noise and timestep, to prefer concept-free trajectories, updating parameters via LoRA. To stabilize cross-frame behavior, we introduce a spatiotemporal-semantic alignment (STSA) loss based on a key-centric attention context. We also contribute VCE-24K, a training-free paired corpus built from a frozen Wan-2.1 via early noising and CLIP filtering. On VCE-24K, our method markedly lowers concept alignment with near-baseline DOVER and VBench-2 scores. A blinded user study reports the lowest human detection rates with minimal MOS drop. To our knowledge, this is the first concept erasure for the video generation model.
Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.
Le contrôle bibliographique ouvert
DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.
- Titre Crossref
- Latent DPO for Concept Erasure in Text-To-Video Diffusion Models
- Date Crossref
- 03/05/2026
- Éditeur
- IEEE
- Type
- proceedings-article
Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.
Les institutions déclarées
Une affiliation ne permet pas de déduire la nationalité d’un auteur.