Toutes les news taguées avec ce sujet.
Deux campagnes préenregistrées montrent que les LLM utilisés comme juges produisent des classements incohérents, même sur des requêtes strictement identiques.
Un ingénieur tire les leçons d'un système de réconciliation financière à très grande échelle pour penser la fiabilité des systèmes IA.
Un chercheur propose de mesurer la régularité des réponses des LLM plutôt que leur performance moyenne, jugée saturée sur les benchmarks actuels.