Toutes les news taguées avec ce sujet.
Une méthode anytime-valid accélère l'évaluation d'agents LLM dans les jeux à information imparfaite.