Toutes les news taguées avec ce sujet.
Un cadre unifié pour généraliser des modèles ML à des entrées de tailles arbitraires, jamais vues à l'entraînement, via des maps d'échantillonnage.
Un nouveau mécanisme de récompense double pour ancrer le raisonnement des VLMs dans la réalité physique et réduire les hallucinations dans les tâches interactives.
Un nouveau framework limite les fuites d'information et préserve la capacité d'exploration des LLMs lors de la distillation sur politique.
Une approche non supervisée exploite l'asymétrie vérification/recherche pour résoudre des problèmes d'optimisation combinatoire avec moins de calcul.
Des chercheurs montrent qu'une pénalité de norme simple peut accélérer le grokking jusqu'à 6x en contraignant les représentations cachées sur une hypersphère.
Une étude théorique révèle un diagramme de phases pour la généralisation selon la taille du modèle et le volume de données, via des réseaux à deux couches quadratiques.
Une nouvelle architecture neuronale utilise le résidu EDP comme entrée directe pour corriger itérativement ses propres prédictions, sans recourir aux optimiseurs classiques.
Un LLM peut apprendre puis oublier une règle grammaticale en plein préentraînement, sans que la loss curve ne le signale. Les auteurs baptisent ce phénomène « natural ungrokking ».