Toutes les news taguées avec ce sujet.
Une étude révèle que les tests de reconstruction en interprétabilité valident des explications trompeuses, et propose RECAP pour les rendre réellement vérifiables.
Une méthode qui transforme les évaluations par rubrique en diagnostic précis des capacités faibles d'un modèle, pour générer des données de fine-tuning ciblées.
Moonshot AI dévoile Kimi K3, un modèle open-weights de 2,8T de paramètres qui rivaliserait avec les meilleurs modèles fermés du marché.
Un framework multi-agents qui externalise l'état de recherche pour éviter les boucles répétitives et améliorer la complétude des réponses.
Une étude montre que les estimations probabilistes des LLM violent souvent les règles de base de la théorie des probabilités.
Une étude propose PAT, un système RAG combinant spécifications utilisateur et corpus comparables pour une traduction de documents entiers, au-delà de la phrase par phrase.
Un nouveau benchmark évalue la capacité des LLM à produire et vérifier des preuves de niveau universitaire à doctoral, au-delà des olympiades.
Une revue des avancées des LLM dans l'automatisation de la conception électronique, de l'assistance ponctuelle à l'exécution agentique autonome.
Un article pédagogique détaille la mécanique interne des LLM, du tokenisation à la génération du premier token en sortie.
Un outil open-source qui valide le SQL produit par des LLM via des contrôles sémantiques déterministes, avant toute exécution en base.
Un développeur implémente un agent fonctionnel avec appels d'outils en seulement 100 lignes de Lisp, démontrant la concision du langage pour ce cas d'usage.
Iroh propose une architecture peer-to-peer pour faire tourner des LLM en distribué, sans infrastructure centralisée.
Un développeur teste les limites des LLM en tentant de reproduire un jeu rétro des années 80 — et documente ce que l'IA comprend vraiment du code legacy.
Un plaidoyer pour repenser l'organisation de la documentation à l'ère des LLM et des agents IA qui doivent la consommer.
Un benchmark applicatif oppose 12 modèles IA récents sur la construction de quatre applications identiques, révélant des écarts significatifs.
Des chercheurs proposent Prismata, un mécanisme de confinement des attaques par injection de prompt cross-site visant les agents web autonomes.
Un rapport documente l'usage concret d'outils d'IA frontier par Boko Haram à des fins de recrutement, propagande et opérations terroristes.
Xiaomi détaille les techniques d'optimisation d'inférence de son modèle MiMo v2.5, centré sur l'architecture Hybrid Sliding Window Attention.
OpenAI affirme qu'un modèle GPT-5.6 a généré une preuve formelle d'un problème ouvert majeur en théorie des graphes, la CDC Conjecture.
Un décryptage technique de l'architecture mémoire unifiée d'Apple Silicon et de ses avantages concrets pour l'inférence locale de LLM de grande taille.
NVIDIA détaille comment les choix d'architecture d'un LLM influencent directement le débit de tokens et la latence perçue par l'utilisateur.
NVIDIA détaille comment le host offloading permet de dépasser les limites de mémoire HBM des GPU lors de l'entraînement de LLM avec JAX.
Hugging Face publie la troisième partie de sa série sur le profilage PyTorch, focalisée sur les mécanismes d'attention et leur analyse de performance.
Des chercheurs proposent un module mémoire plug-and-play qui intervient sélectivement pour contrer la dégradation comportementale dans les tâches longues.
Un modèle portugais de 9B paramètres annotait bien en surface, mais échoue les tests de validité théorique — accord n'est pas validité.
Les paramètres jugés critiques dans les LLMs ne sont pas pour autant les meilleurs cibles d'entraînement — une étude remet en question le concept de Super Weights.
La précision et la perplexité ne suffisent pas à évaluer la quantization : une nouvelle métrique comportementale révèle des divergences invisibles.
Une proposition conceptuelle pour représenter les workflows LLM comme des objets de connaissance persistants, inspectables et reprenables.
Un framework de génération de mouvements 3D humains en temps réel, pilotable via des prompts textuels et des contraintes cinématiques flexibles.
Kastra.ai propose un outil d'enforcement de politiques pour encadrer l'usage des assistants de code IA en entreprise.