GRPO Async avec LoRA sur HF Jobs : entraînement RL distribué sans NCCL
14 septembre 2026 · IA
Hugging Face présente une architecture d'entraînement RL asynchrone (AsyncGRPOTrainer) utilisant des adaptateurs LoRA pour synchroniser les poids entre un trainer et des répliques vLLM sur des Jobs séparés, sans NCCL ni réseau partagé. La synchronisation ne transite que par un Storage Bucket monté dans chaque Job, réduisant les transferts de ~3 Go (modèle complet) à quelques mégaoctets (adaptateur LoRA). Un proxy maison gère le routage par préfixe KV et la diffusion des mises à jour d'adaptateurs. Cette approche réduit le temps d'entraînement de 500 steps de 3h27 à 53 minutes sur cinq itérations d'optimisation.
Impact marchés
Impact sur l'écosystème MLOps et RL distribué : Hugging Face consolide son offre plateforme (Jobs + Buckets) pour l'entraînement RL à grande échelle. Concurrence directe avec AWS SageMaker, GCP Vertex AI et les clusters Slurm traditionnels. TRL v1.14 et vLLM sont les bibliothèques open-source concernées.
Opportunités
Opportunité pour Hugging Face de capturer des workloads RL d'entreprise sur sa plateforme cloud. Risque : dépendance à vLLM (version épinglée v0.27.1) et latence FUSE du Storage Bucket pouvant devenir un goulot d'étranglement à grande échelle.