Megakernels : morts puis ressuscités, le débat repart sur l'ingénierie d'inférence
Une discussion animée sur les megakernels relance le débat technique sur l'optimisation des kernels pour l'inférence des modèles.
Latent Space (Swyx)·5 août 2026

Image · Source originale
Un épisode de podcast sur l'ingénierie d'inférence revient sur la controverse des megakernels, ces kernels fusionnés à la main pour réduire l'overhead de lancement. L'argument avancé : peu de fournisseurs d'inférence sérieux utilisent en production un kernel monolithique de 67 000 lignes, réservé à la recherche. Le futur GPU Rubin de NVIDIA est mentionné comme résolvant certains problèmes de CTA traînards.