Toutes les news taguées avec ce sujet.
Une étude sur les échecs comme banc d'essai contrôlé révèle comment les choix de pretraining déterminent les gains obtenus par le RL post-training.
Des chercheurs montrent que des interfaces de discussion publiques peuvent servir à injecter du contenu malveillant dans les corpus web utilisés pour entraîner les LLM.
Une étude montre que pré-entraîner directement sur des documents visuels surpasse l'approche texte-only classique, sans passer par l'extraction de texte.
Une nouvelle architecture externalise les connaissances factuelles dans une base de connaissances interrogée par vecteurs continus, surpassant GPT-4o-mini sur certains benchmarks.
Une approche en deux étapes qui sépare compétence motrice et alignement sémantique pour réduire drastiquement le besoin en données expertes.
Des chercheurs proposent de découpler le flux de calcul des Transformers en deux flux distincts, améliorant l'efficacité et les performances sur les tâches en aval.
Une étude démontre que l'instabilité du pipeline parallèle asynchrone dépend du choix d'optimiseur, pas d'une limite intrinsèque.