Toutes les news taguées avec ce sujet.
DEED optimise le post-entraînement de robots humanoïdes VLA pour un réapprovisionnement fiable en supermarché, avec un seul GPU.
Une méthode d'apprentissage par renforcement affine le crédit accordé à chaque action d'un agent, sans critique additionnelle ni supervision coûteuse.
Une méthode sans données pour renforcer des circuits probabilistes pré-entraînés face aux perturbations et aux changements de distribution.
Une étude systématique révèle que les gains du RL post-training se concentrent dans quelques couches médianes d'un transformer, voire une seule.
Des chercheurs montrent que le fine-tuning par RL produit implicitement un signal d'évaluation step-level performant, sans entraîner de reward model dédié.