Toutes les news taguées avec ce sujet.
Deux campagnes préenregistrées montrent que les LLM utilisés comme juges produisent des classements incohérents, même sur des requêtes strictement identiques.
Une réévaluation montre que les agents à mémoire textuelle progressent surtout grâce à l'ordre des tâches, pas à une réelle amélioration.