Toutes les news taguées avec ce sujet.
Le fine-tuning des encodeurs visuels pour la reconstruction réduit la dimensionnalité effective des latents, rendant le flow matching sous-optimal. La prédiction x₀ résout ce problème.