Paradee : distiller Kokoro-82M en un modèle TTS mono-voix de 8M de paramètres
Un modèle de synthèse vocale compressé 10x, 8,5 Mo en int8, tourne 25x plus vite que le temps réel sur un seul CPU.
arXiv cs.AI · cs.LG · cs.CL·Sahil Mahendrakar·5 octobre 2026

Image · Source originale
Paradee distille Kokoro-82M, modèle TTS open source à 54 voix, en un modèle de 8,07M de paramètres dédié à une seule voix. Avec 10x moins de paramètres et 15x moins de calcul, il atteint un score UTMOS de 4,41 contre 4,52 pour l'enseignant, et fonctionne sur un simple laptop en int8 (8,5 Mo). Un filtre de verrouillage de phase appliqué après synthèse corrige un léger bourdonnement résiduel sans entraînement supplémentaire.