Toutes les news taguées avec ce sujet.
Un framework permet aux agents GUI de s'améliorer après déploiement sur des interfaces inconnues, sans annotation humaine, via un cycle exploration-réflexion-internalisation.
Une méthode de self-distillation on-policy qui se concentre sur les pivots de raisonnement pour améliorer le transfert de compétences multilingue des LLM.
Une nouvelle méthode de post-entraînement corrige le déséquilibre texte-image dans les modèles multimodaux pour améliorer le raisonnement visuel.