Toutes les news taguées avec ce sujet.
DeepSeek dévoile v4.1 Flash, un modèle plus rapide et économique que sa version Pro actuelle.
Un thread Twitter met en avant la capacité de GPT-3 à générer du code à partir de simples instructions en langage naturel.
Nouveau modèle textuel optimisé pour le temps réel et l'efficacité.
Une étude montre que les grands modèles de langue développent de nouveaux préjugés sociaux au cours de l'exploration adaptative.
Les revendications d'OpenAI sur une avancée majeure en raisonnement mathématique sont contestées par la communauté scientifique.
Un projet open source permet d'observer comment un LLM répartit son attention entre les tokens d'un texte.
Hugging Face explore comment affiner le refus de l'IA sur des parties sensibles d'un sujet sans bloquer l'intégralité du contexte.
Analyse empirique de la capacité des agents IA à appliquer correctement les méthodes de vérification et de tests logiciels.
Une infrastructure open source permettant à des agents LLM de collaborer pour exécuter des stratégies de trading financières.
Latent Space publie un tracker analysant les choix de modèles d'IA sur 161 catégories via 6 prompts et 7 modèles.
Une étude compare quatre formats de mémoire d'agent face aux migrations de modèles : les graphes de connaissances à schéma fixe l'emportent nettement.
Une méthode distille le raisonnement d'LLMs dans un classifieur léger avec adaptation locale par type de produit.
Une étude auditant 22 modèles frontières révèle un phénomène massif de mémorisation littérale sur les benchmarks de propriétés moléculaires.
Un thread suggère que les LLM encoderaient des structures proches de la logique symbolique, malgré une architecture purement statistique.
Un papier propose de modéliser la propagation des idées générées par les LLM comme un phénomène épidémique affectant la cognition humaine.
Nouveau modèle d'Anthropic avec des progrès marqués en coding et benchmarks scientifiques, testé sur le "pelican benchmark".
CodeRabbit évalue un modèle nommé « GPT-6 Astra » sur des tâches de revue de code, avec un regard sur ses coûts et implications de confidentialité.
L'outil interne de Spotify optimise drastiquement la consommation de tokens pour les assistants de code.
OpenRouter intègre le modèle GPT-6 Astra, élargissant son catalogue de LLM.
Les LLM ne se limitent pas à la prédiction statistique du mot suivant.
Les grandes entreprises adoptent massivement les modèles open-source pour maîtriser leurs coûts et leurs données.
Une étude montre que la distillation on-policy peut atteindre des performances quasi-optimales avec une seule donnée d'entraînement.
Une étude contrôlée montre que reformuler les connaissances, plutôt que les répéter, aide les LLM à mieux apprendre pendant le pré-entraînement.
OpenAI dévoile GPT-6 Astra, présenté comme son modèle le plus intelligent et aligné à ce jour, avec un accueil viral inédit.
Un développeur utilise un LLM pour transpiler du code assembleur 68000 vers GDScript afin de moderniser un classique.
Un nouveau projet propose six modèles open-weights conçus pour fonctionner ensemble comme une flotte coordonnée.
StartLux, jeune acteur du secteur des grands modèles en Chine, fait son entrée dans une compétition déjà dominée par les géants nationaux.
Un framework de raisonnement structuré vise à réduire les hallucinations des LLM appliqués au diagnostic de pannes réseau 5G/6G.
Un cadre basé sur des LLM améliore la cohérence spatiale et le suivi des entités dans la traduction texte-langue des signes au-delà de la phrase isolée.
Un nouveau schéma de quantification FP4 simplifie le pré-entraînement en basse précision et améliore les performances face à la recette NVIDIA existante.