Toutes les news taguées avec ce sujet.
Opus 5 et Fable 5 nécessitent 80 % moins d'instructions système.
Une preuve assistée par ordinateur montre que BB1 ne converge pas superlinéairement sur un ensemble ouvert de problèmes quadratiques.
Hugging Face intègre Nunchaku pour accélérer l'inférence Stable Diffusion via la quantification 4-bit.
Un billet technique détaille les optimisations apportées au chargement des données vidéo pour l'entraînement de modèles robotiques via LeRobot.
Des chercheurs établissent des SLLN pour des fonctions localement Lipschitziennes, étendant les résultats aux structures o-minimales et aux applications d'optimisation.
Une nouvelle approche exploite la structure spectrale des poids pour accélérer et fusionner des modèles entraînés par RLVR, avec des gains d'efficacité mesurables.
Une alternative lisse au clipping de PPO et GRPO testée sur Llama-3.2-1B pour le post-entraînement de LLM par RLHF.
Un nouveau framework guide des agents de codage pour transformer des implémentations de référence en déploiements multi-GPU optimisés, avec des gains massifs de latence.
Un chercheur accélère deux étapes clés des algorithmes IKPLS, avec des gains allant jusqu'à deux ordres de grandeur sur certaines opérations.
Une étude exploratoire compare Muon à AdamW en post-training RL sur des tâches agentiques à récompense éparse, avec des gains significatifs sous certaines conditions.
Une étude compare trois méthodes d'optimisation d'agents et montre que la plupart des gains ne se maintiennent pas dans un cadre d'apprentissage continu.
Une nouvelle stratégie de reset guidé par des configurations performantes améliore l'efficacité et la généralisation du RL pour la conception de circuits.
Inférence d'un modèle 26B sur du matériel obsolète via optimisation logicielle.
Palmer Luckey prévoit une ère d'optimisation radicale inspirée par les méthodes de John Carmack.
Un outil permettant aux coding agents de mettre en cache leurs recherches de code pour éviter de dupliquer les efforts.
Un retour d'expérience détaillé sur la transition vers GPT-5.6 et les gains observés en production.
Un essai explore comment Claude peut assister la recherche scientifique via des méthodes d'optimisation contrainte.
H Company détaille des techniques pour diagnostiquer et corriger les fuites de VRAM lors de l'entraînement de modèles d'IA.
Alors que les dépenses en IA s'envolent, les organisations cherchent en urgence des stratégies pour maîtriser des factures de plus en plus difficiles à justifier.
Xiaomi détaille les techniques d'optimisation d'inférence de son modèle MiMo v2.5, centré sur l'architecture Hybrid Sliding Window Attention.
NVIDIA détaille comment les choix d'architecture d'un LLM influencent directement le débit de tokens et la latence perçue par l'utilisateur.
NVIDIA explique comment la fusion de kernels CUDA permet de réduire les goulots d'étranglement mémoire et les latences de lancement sur GPU.
Hugging Face publie la troisième partie de sa série sur le profilage PyTorch, focalisée sur les mécanismes d'attention et leur analyse de performance.
Un développeur décortique le mécanisme CUDA-checkpoint de Nvidia pour réduire drastiquement les temps de démarrage des processus GPU.
Un framework qui filtre les traces d'exécution redondantes et localise les causes racines des échecs pour optimiser plus efficacement les agents LLM long-horizon.
Des chercheurs proposent un système de contrôle à deux couches combinant tarification dynamique et DRL multi-agents pour optimiser l'intégration des énergies renouvelables dans le secteur laitier irlandais.
Un framework multi-agents transforme une description en langage naturel en formulation mathématique et code prêt à l'emploi pour la recherche opérationnelle.
Hugging Face annonce des évolutions importantes de sa bibliothèque Kernels, dédiée à l'optimisation des opérations bas niveau pour les modèles d'IA.
Une approche architecturale pour alléger la charge cognitive des LLM dans les applications cartographiques via des couches de données en mémoire.
Brick-SR1 propose un système de routage intelligent pour optimiser l'utilisation des tokens dans Claude Code et réduire les coûts.