Toutes les news taguées avec ce sujet.
Une étude identifie un défaut fréquent des LLM en contexte long : recopier le texte source au lieu de raisonner, et propose une méthode de RL pour y remédier.
Un modèle robotique étend le contexte visuomoteur à 8 000 pas de temps grâce au Test-Time Training, sans alourdir la latence d'inférence.
Des chercheurs identifient pourquoi certaines méthodes de linéarisation préservent mieux la qualité des LLMs, avec des résultats probants jusqu'à 32B paramètres.
Une nouvelle méthode de compression du cache KV à l'inférence divise les états en composantes basse fréquence partagées et résidus haute fréquence, sans réentraînement.
Une nouvelle méthode réduit jusqu'à 8,3× la mémoire du cache KV des LLMs en contexte long, sans réentraîner le modèle de base.
Une méthode d'inférence sans entraînement améliore l'utilisation des preuves dans les LLMs sur des contextes de 128K tokens.
Microsoft Research présente Memora, un système de mémoire scalable pour agents IA qui réduit jusqu'à 98 % les tokens de contexte tout en battant l'état de l'art sur deux benchmarks.
Une méthode d'entraînement combine YaRN et encodages positionnels aléatoires pour étendre la fenêtre de contexte des LLM bien au-delà de leur données d'entraînement.