Toutes les news taguées avec ce sujet.
Un framework où un petit modèle décide lui-même quand solliciter un LLM, réduisant fortement les coûts d'inférence sans sacrifier la précision.
Une méthode pour agrandir le vocabulaire d'un modèle déjà entraîné sans repartir de zéro, appliquée à LFM2.5-8B-A1B.
Des chercheurs montrent que l'échec d'un agent LLM est prévisible dès le premier tour via ses représentations internes, permettant d'économiser jusqu'à 47 % du calcul d'inférence.
Une nouvelle méthode structure la compression de tokens visuels comme un problème de maximisation submodulaire, filtrant le bruit textuel par entropie statistique.
Une étude montre qu'affiner un seul layer d'un Transformer via RL atteint des performances comparables à l'entraînement complet de tous les paramètres.
Des chercheurs proposent de découpler le flux de calcul des Transformers en deux flux distincts, améliorant l'efficacité et les performances sur les tâches en aval.