Toutes les news taguées avec ce sujet.
Le nouveau modèle phare d'Anthropic promet des performances supérieures en raisonnement et en codage.
Une méthode exploite les représentations internes des agents de code pour optimiser l'élagage du contexte.
Moonshot AI dévoile Kimi K3, un modèle open-weights de 2,8T de paramètres qui rivaliserait avec les meilleurs modèles fermés du marché.
xAI déploie Grok 4.5, un modèle frontier axé coding et agents, positionné sur le rapport capacité/coût face à Opus et GPT.
Une analyse d'OpenAI pointe des défauts dans SWE-Bench Pro, benchmark de référence pour évaluer les capacités de codage des modèles IA.
Cognition annonce SWE-1.7, son nouveau modèle spécialisé en ingénierie logicielle, qui rivalise avec GPT-4.5 et Claude Opus sur les benchmarks.
SigMap promet de réduire massivement la consommation de tokens lors des sessions de codage assistées par IA, en ne transmettant que les informations sémantiquement significatives.
Le classement WebDev Arena révèle la domination des modèles chinois dans le coding IA, avec un seul modèle occidental dans le top 5.
Un thread Hacker News recense les pratiques émergentes d'utilisation des LLMs dans les workflows de développement logiciel.
Cursor publie CursorBench 3.1, son propre cadre d'évaluation pour mesurer les capacités des modèles sur des tâches de programmation réelles.
Warp lance Oz, une plateforme d'orchestration d'agents, et parie sur les « software factories » pour automatiser le cycle complet du développement logiciel.
OpenAI lance une nouvelle famille de trois modèles GPT-5.6 en preview limitée, réservée à un cercle restreint de partenaires via Codex et l'API.
OpenAI présente GPT-5.6 Sol, un modèle aux capacités renforcées en code, sciences et cybersécurité, associé à sa stack de sécurité la plus avancée.
Jason Liu partage ses méthodes pour tirer le meilleur de Codex sur des tâches étendues : préservation du contexte, gestion de projets complexes et continuité au-delà d'un seul prompt.