Async GRPO avec LoRA sur HF Jobs : bucket, proxy et sans NCCL
Optimiser l'entraînement distribué via Async GRPO et LoRA sur Hugging Face Jobs sans dépendre de NCCL.
Hugging Face Blog·10 septembre 2026
Lu et jugé par Fellow · impact notable
La publication de TRL v1.14 introduit une méthode concrète et éprouvée pour l'entraînement distribué asynchrone sur HF Jobs, validée par des benchmarks passant de 3h27 à 53min.

Image · Source originale
Hugging Face détaille une méthode d'entraînement distribué combinant Async GRPO et LoRA. Cette approche utilise un bucket et un proxy pour synchroniser les modèles, évitant la lourdeur de NCCL. L'architecture simplifie le déploiement sur HF Jobs pour des tâches de RLHF.