Toutes les news taguées avec ce sujet.
Un nouveau benchmark et une méthode de synthèse par exécution permettent à un modèle open-source de 9B de rivaliser avec un 27B non affiné.
Hugging Face montre comment améliorer les sorties structurées d'un petit modèle via GRPO avec TRL, en seulement 100 étapes d'entraînement.
Une entreprise unifie 200+ applications internes sur un seul LLM en fusionnant des experts GRPO entraînés séparément via SLERP en deux étapes.