Toutes les news taguées avec ce sujet.
Une preuve théorique borne les limites d'accélération de la descente de gradient par des pas prédéterminés, confirmant l'optimalité du schéma silver.
L'outil interne de Spotify optimise drastiquement la consommation de tokens pour les assistants de code.
NVIDIA permet désormais le déploiement de modèles de raisonnement complexes directement sur le matériel Edge via Jetson.
Un nouveau cadre exploite le parallélisme des opérateurs sur les SoC hétérogènes pour optimiser latence et débit.
Après deux décennies, le problème Model-RB frb100-40 est résolu via un ensemble indépendant certifié et une étude préenregistrée.
Troisième volet d'une série sur le co-design de modèles IA, avec cinq règles pratiques pour choisir la longueur et le mécanisme de draft.
NVIDIA détaille une méthode concrète pour optimiser du code CUDA, entre profilage, bibliothèques modernes et bonnes pratiques de performance.
Une étude identifie une divergence entre les directions de gradient et les mises à jour réelles des optimiseurs dans les PINNs.
Une analyse technique décortique les choix d'ingénierie de DeepSeek-V3 face aux limites théoriques du matériel.
Baseten explore les compromis entre coût, latence et débit pour optimiser le déploiement des LLM en production.
Une revue de littérature dresse un état des lieux des méthodes d'optimisation modernes, entre géométrie matricielle, gestion de l'horizon et contraintes systèmes.
Une nouvelle architecture d'exécution GPU vise à améliorer l'efficacité des calculs tensoriels en dissociant threads et registres.
Un framework qui améliore les performances d'agents IA en entreprise en optimisant l'environnement d'exécution plutôt que le modèle lui-même.
Un développeur détaille son approche pour concevoir un petit modèle de langage optimisé pour l'exécution CPU, sans GPU.
Un nouvel algorithme résout efficacement le problème du voyageur de commerce sur des graphes d'ensembles convexes.
Un nouvel algorithme d'optimisation convexe atteint une vitesse de convergence record avec une seule résolution linéaire par itération.
Prime Intellect documente les progrès de la communauté sur le speedrun NanoGPT, un défi d'optimisation d'entraînement de LLM.
Liquid AI dévoile LFM2.5-DSpark, une nouvelle version de son modèle optimisée pour accélérer l'inférence sur une large gamme de matériel.
Un papier théorique explore si des architectures fixes peuvent être entraînées par descente de gradient pour atteindre n'importe quel réseau cible.
NVIDIA lance SkillEvaluator, un outil pour mesurer l'efficacité des compétences des agents IA et réduire les étapes inutiles.
Llama.cpp adopte le paramètre 'medium' par défaut pour le modèle Qwen3.8-27B.
Un article technique décortique la technique de swizzling pour éviter les conflits de banques en mémoire partagée CUDA.
Google DeepMind combine optimisation ML et AlphaEvolve pour affiner la borne théorique de la multiplication de matrices, un problème vieux de plusieurs décennies.
Un retour d'expérience montre comment réorganiser l'ordonnancement des tâches GPU améliore fortement le taux d'utilisation, sans matériel supplémentaire.
Un nouveau cadre théorique optimise les schedules de diffusion discrète en s'appuyant sur la géométrie des données, avec des gains prouvés en grande dimension.
L'utilisation du GPU passthrough sur macOS VM optimise l'inférence avec Llama.cpp.
IBM Research et Hugging Face présentent une méthode pour réduire la consommation de tokens sans perdre en qualité.
Une étude montre que les modèles entraînés avec l'optimiseur Muon apprennent plus vite mais perdent leur généralisation après le grokking.
Une analyse théorique montre que le WPG converge exponentiellement vers la politique optimale linéaire-gaussienne, sans dégradation près de zéro température.
Un outil open-source permettant de construire des agents optimisés pour réduire la consommation de tokens.