Toutes les news taguées avec ce sujet.
Une fenêtre glissante appliquée uniquement au module de prédiction multi-token accélère le décodage spéculatif sans perte de qualité sur des contextes massifs.
Une nouvelle méthode de compression du cache KV à l'inférence divise les états en composantes basse fréquence partagées et résidus haute fréquence, sans réentraînement.
Une nouvelle méthode réduit jusqu'à 8,3× la mémoire du cache KV des LLMs en contexte long, sans réentraîner le modèle de base.
Un outil expérimental exploite les métriques de pression mémoire du noyau Linux (PSI) pour décider dynamiquement quand réduire le KV cache des LLM.