Toutes les news taguées avec ce sujet.
TREK combine distillation et GRPO pour débloquer les prompts difficiles que le modèle étudiant ne sait pas résoudre seul.
Un pipeline convertit un re-ranker autorégressif avec chaîne de pensée en modèle de diffusion par blocs, sans sacrifier la précision du classement.
Dwarkesh Patel expose le pari des grands labs : entraîner les IA sur des millions de tâches vérifiables via du RL pour atteindre l'AGI.