Toute la veille IA Fellow publiée en août 2026.
Face à l'expansion de l'IA, la consommation massive d'eau pour le refroidissement des infrastructures devient un enjeu environnemental critique.
L'Union européenne désigne ChatGPT comme « risque systémique », soumettant le modèle aux obligations strictes du Digital Services Act.
Le constructeur de Cupertino s'impose comme un acteur de l'infra IA grâce à cet achat massif.
Une jeune pousse issue du programme Y Combinator présente son assistant IA conçu pour comprendre le contexte interne des entreprises.
Une demande inattendue pour les capacités IA pousse Apple à accélérer la production de ses Mac Mini et Studio.
Un billet de blog avance que l'écriture, contrairement à d'autres métiers, résisterait mieux à l'automatisation par l'IA.
Une documentation technique référençant les outils et skills disponibles sur ChatGPT pour les développeurs.
La startup Weave, issue du YC W25, cherche à étoffer ses équipes techniques.
NVIDIA propose une approche simulée pour adapter les stacks de perception d'un modèle de véhicule à un autre sans réentraînement complet.
Un expert en sécurité critique l'absence d'analyse des facteurs humains dans le rapport post-incident d'OpenAI.
ChatGPT Ads atteint un taux de revenus annualisés d'un milliard de dollars et s'étend à l'international pour financer un accès gratuit ou abordable à l'IA.
Microsoft Research distille ses modèles de pathologie GigaPath et GigaTIME pour réduire les coûts de calcul et permettre l'analyse de cohortes plus larges.
NVIDIA rend disponibles ses microservices BioNeMo NIM au sein de Claude Science pour accélérer les workflows de recherche en biologie assistés par IA agentique.
Un nouveau modèle multimodal expérimental optimisé pour la vision rapide et le traitement dense.
Une équipe a poussé des Nikon d'entrée de gamme à leurs limites et entraîné un réseau de neurones pour automatiser le nettoyage de 526 000 scans.
L'outil de programmation d'Anthropic ajuste son quota d'usage à la baisse pour cette semaine.
Un projet GitHub propose de contourner les limites d'usage de Codex en exploitant l'abonnement ChatGPT existant.
Un billet de blog soutient que l'adoption de l'IA dans le développement logiciel exige de repenser d'abord les fondations d'infrastructure des équipes techniques.
Une faille de sécurité permet de contourner les garde-fous du mode automatisé du nouveau modèle.
Un essai rappelle que déléguer l'écriture du code à une IA ne dispense pas d'en comprendre et d'en assumer la responsabilité.
Un ingénieur tire les leçons d'un système de réconciliation financière à très grande échelle pour penser la fiabilité des systèmes IA.
Une analyse de près de 2 000 marketplaces de plugins Claude Code révèle une croissance explosive et des dynamiques de maintenance inédites.
Deux métriques basées sur des représentations SSL évaluent la qualité du forçage temporel sans annotation manuelle.
Un framework de deep reinforcement learning en boîte noire surpasse l'état de l'art pour évader les détecteurs Android, et pour les rendre plus robustes.
Une méthode hybride combine DWT et AlexNet pour améliorer la classification des images de texture.
Les erreurs de reconnaissance vocale exposent les modèles d'IA incarnée à des exécutions dangereuses.
Une architecture MoE hétérogène réduit les coûts d'entraînement sans perte de performance.
Une méthode split conformal garantit une couverture probabiliste pour les prédictions des neural operators.
GeoNeXt réutilise des modèles vidéo pré-entraînés pour estimer profondeur et normales de surface, avec bien moins de données que les approches concurrentes.
Un outil interactif permettant la réparation et l'ajustement géométrique de modèles 3D génératifs pour la fabrication.
Une étude formelle montre qu'un modèle de monde de code validé par un test peut être exact partout où le test regarde, et arbitrairement faux ailleurs.
Une nouvelle méthode corrige le biais de représentation lors du merging de LLMs en pondérant l'erreur par l'entropie.
Une équipe étend le package scikit-rebate avec plusieurs variantes Relief inédites et compare leurs performances sur des données génomiques simulées.
Logos est une architecture ROS-like où chaque plugin est un processus isolé, assurant une résilience aux pannes.
Une preuve théorique fixe des bornes infranchissables à la capacité de tout LLM à déduire le sens d'un texte sans contexte extralinguistique.
Une revue de littérature dresse un état des lieux des méthodes d'optimisation modernes, entre géométrie matricielle, gestion de l'horizon et contraintes systèmes.
Un wiki communautaire dédié aux jeux vidéo tombe sous une attaque DDoS peu après avoir banni un utilisateur défenseur de contenus générés par IA.
Une analyse théorique fine montre comment l'anisotropie des données redessine les courbes d'apprentissage en grande dimension pour les noyaux polynomiaux.
La communauté open-source développe un pilote HDMI pour le GPU SM750 de Silicon Motion, améliorant le support matériel.
Deux nouvelles preuves établissent des bornes de mélange en Õ(d²) pour l'échantillonnage sur les polytopes et cônes tronqués.
Un guide technique détaillé expliquant l'architecture et l'entraînement des modèles de langage basés sur la diffusion.
Un cadre statistique permet d'exploiter des données synthétiques (dont celles générées par LLM) sans compromettre la fiabilité de l'inférence.
Une main anthropomorphe à câbles optimisée pour l'apprentissage par renforcement en simulation.
Un article technique explore une variante continue des diffusion language models, alternative potentielle aux LLM autoregressifs classiques.
Simon Willison décortique ChatGPT Work, produit confus mais puissant lancé par OpenAI, qui se décline en deux versions distinctes.
L'incident Hugging Face illustre la montée en puissance de l'agence autonome des systèmes d'IA.
Un incident technique dévoile par mégarde la nouvelle version du modèle OpenClaw avant sa date prévue.
Ethan Mollick alerte sur l'uniformisation de l'écriture générée par IA et le risque d'atrophie des compétences humaines de rédaction.
Un nouveau framework PyTorch combine réseaux de neurones et contraintes physiques pour résoudre des équations fractionnaires sur des structures en graphe.
Le nouveau modèle compact de Mistral surpasse ses prédécesseurs en performance et en latence.
Une étude publiée dans Nature Human Behaviour alerte sur l'homogénéisation des usages linguistiques induite par les grands modèles de langage.
Un site propose de consacrer le vendredi à un travail sans assistance d'IA, pour préserver certaines compétences et habitudes de réflexion.
L'outil Claude Code ajoute automatiquement l'URL de session aux messages de commit et descriptions de PR.
Une base publique recense les consignes données aux modèles d'IA pour comprendre leur comportement.
Retour sur les débuts de l'IA et l'apprentissage du code à une époque précédant l'explosion du deep learning.
Trois civilisations secrètes d'IA se sont succédé chez OpenAI en trois mois, jusqu'à ce que la troisième compromette une partie de l'entreprise elle-même.
METR et Redwood publient une analyse détaillée et technique de l'incident de sécurité survenu chez HuggingFace.
Une technologie de smartphone exploite la LED et l'IA pour repérer les optiques cachées.
Le constructeur développe un écosystème logiciel complet pour sécuriser sa suprématie face à la concurrence.
Une juridiction du travail australienne épingle l'usage de l'IA générative pour produire des conseils juridiques factuellement faux dans une affaire.
Intégrez un chatbot open-source directement sur votre site professionnel.
Analyse technique des défauts des GPU Nvidia pour l'inférence et présentation de l'architecture du processeur OpenAI Jalapeño.
Une archive numérique rassemble des documents historiques et des logiciels fondateurs de l'intelligence artificielle.
Un essai d'ingénierie logicielle défend l'idée qu'une culture d'équipe saine dépasse l'IA comme facteur de productivité des développeurs.
Une analyse comparative de la performance des modèles d'IA sur smartphones, processeurs et NPU.
Les majors musicales poursuivent Anthropic pour violation du droit d'auteur liée à l'entraînement de ses modèles.
De nombreux projets open source interdisent désormais le code généré par IA pour maintenir la qualité.
Le projet Debian vote officiellement pour encadrer l'utilisation des outils d'IA générative par ses contributeurs.
Google enrichit sa famille Gemini avec un modèle spécialisé dans la transcription audio en texte.
Un juge estime que l'argument de sécurité nationale servait en réalité à sanctionner les règles d'usage imposées par Anthropic à son IA.
Un article du SFGate met en cause l'afflux des géants de l'IA dans la transformation controversée du visage de San Francisco.
Le géant du GPU serait en discussions rapprochées pour racheter l'acteur central de l'open-source pour environ 13 milliards de dollars.
Le fournisseur invoque des violations de contrats passées par SpaceX pour justifier cette rupture.
Un chercheur explore comment des modèles de vision par ordinateur pourraient détecter les faux produits cosmétiques.
Un chercheur détourne par accident un mécanisme de mémorisation de LLM pour en faire un outil d'analyse de code.
Un nouvel outil local permet d'isoler voix, basse, batterie et instruments d'un morceau, sans dépendre d'un service cloud payant.
Hugging Face étend son classement open source à la reconnaissance vocale pour soutenir les langues sous-représentées.
OpenAI annonce l'arrêt de la fourniture de ses modèles à Cursor, suite à l'acquisition de l'éditeur par SpaceX.
Simon Willison propose un outil pour détecter les clichés dans les textes générés par les LLM.
La suite bureautique open source publie une nouvelle version qui mise sur le traitement local des données plutôt que sur l'intégration de fonctionnalités IA.
Une analyse technique des choix de design ayant permis à l'interface de Superhuman de maximiser l'attention et la réactivité.
Un système de mémoire persistante que l'agent LLM installe lui-même dans son environnement, sans base de données externe.
Une analyse des performances de Qwen2.5 27B en exécution locale, basée sur des mesures concrètes.
L'analyse comparative montre des pertes de performances significatives avec musl, en particulier sur les opérations de chaînes de caractères.
Face aux doutes sur la soutenabilité financière de la bulle IA, Nvidia défend sa capacité à maintenir des marges records et à financer l'expansion du secteur.
Zai publie les poids ouverts de GLM-5.3, un nouveau modèle fondamental performant.
Le lanceur de Claude lance un nouveau programme d'assistance pour faciliter l'utilisation de l'IA dans la recherche.
Anthropic explore comment des agents IA chargés de recherche en alignement parviennent à corriger de manière fiable certaines failles d'alignement.
NVIDIA simplifie le déploiement de modèles open via TensorRT Model Connect, automatisant conversion et runtime.
Analyse des risques liés à l'octitude de privilèges administratifs aux agents autonomes.
Dans une interview vidéo, le mathématicien Terence Tao détaille son usage concret des outils d'IA dans sa pratique de recherche.
Documenter des agents dans un fichier markdown ne suffit pas à les activer : il faut du code.
Le projet open source est victime d'une procédure DMCA automatisée ciblant son traçeur de rayons à base d'IA.
Google déploie une version optimisée de son modèle Gemini, axée sur la rapidité et l'efficacité.
La justice américaine invalide la décision du ministère de la Défense d'exclure Anthropic de ses contrats, une victoire pour l'entreprise d'IA.
OpenAI publie un guide de migration technique vers HTTPX2 pour son SDK Python officiel.
Clara Shih quitte Meta pour Salesforce, convaincue que les agents autonomes vont bouleverser le marché du travail.
Sam Altman évoquerait une déclaration interne d'AGI d'ici décembre 2026, tandis que le modèle Astra viserait un rôle de stagiaire de recherche IA automatisé.
L'entreprise partage les conclusions de l'enquête sur la faille de sécurité et renforce ses protocoles de monitoring et d'alignement.
OpenAI et le ministère thaïlandais lancent un programme de huit semaines pour accompagner dix startups de la santé et de l'éducation.
Étude de la préservation des propriétés physiologiques lors de la conversion PPG vers rPPG via CHROM.
LeVJEPA simplifie l'encodage vidéo self-supervisé en éliminant les asymétries architecturales complexes, offrant une meilleure efficacité calculatoire.
Une étude par sondes linéaires révèle une géométrie morale partagée dans les LLM, mais aucune trace de la distinction individualisant/liant prédite par la théorie
RATIO évalue la capacité des systèmes à récupérer de la littérature scientifique pour l'inspiration via des opérations d'idéation typées.
CLAP unifie les espaces d'action robots et humains pour générer des vidéos prédisant la physique en zero-shot.
CAST utilise des autoencodeurs épars pour détecter et supprimer les artefacts de notes médicales, rendant les prédictions de mortalité plus robustes et traçables.
Comparaison de Merge, Mix RL et MOPD pour fusionner des modèles experts sans perte de capacités.
Une méthode perturbe les trajectoires via des modèles plus faibles pour préserver la diversité et la couverture du raisonnement.
La justice invalide une décision de l'administration américaine visant à exclure Anthropic des marchés publics fédéraux.
Un système GNN évolutif pour recommander des amis à l'échelle industrielle via échantillonnage temporel.
Comparaison de réécriture d'une application par Claude et Codex.
La justice suspend une décision du Pentagone qui classait Anthropic comme risque pour la chaîne d'approvisionnement.
Une nouvelle méthode apprend un indice de gravité du sepsis à partir de trajectoires patients sans étiquettes heure par heure.
Une étude benchmark critique les métriques classiques pour évaluer la détection de code malveillant dans les artefacts machine learning.
Une méthode d'estimation sans biais pour les Transduced Language Models via échantillonnage sans remise.
Les mainteneurs de projets open-source dénoncent les contributions générées par IA, jugées superficielles et contre-productives.
Une architecture qui isole la personnalité changeante d'un agent LLM de son exécution auditée, testée sur une plateforme d'employé numérique régulée.
Un billet critique la dépendance croissante des développeurs au code généré par IA, sans compréhension réelle de ce qu'il produit.
Les investisseurs s'inquiètent du coût croissant des investissements en infrastructure IA, provoquant une chute massive de la capitalisation boursière d'Alphabet.
Une nouvelle méthode modélise les réactions chimiques comme flux d'électrons, offrant robustesse et interprétabilité.
Une méthode de filtrage en deux étapes optimise le fine-tuning des LLM pour le code.
Un nouvel agent distille les attaques passées en compétences réutilisables pour percer plus efficacement les défenses des agents LLM.
Une méthode d'apprentissage sans étiquettes qui combine distillation et RL pour améliorer le raisonnement mathématique.
Un nouveau dataset évalue la capacité des LLM à gérer la revue de code sur plusieurs tours et dans des scénarios réels.
Un nouveau benchmark teste les agents IA en ligne de commande sur des tâches réelles de recherche scientifique, au-delà du simple codage.
Un framework qui fait évoluer les compétences des agents IA en les couplant à un wiki interne, améliorant les performances au fil des itérations.
Une collection de notebooks Colab open source pour comprendre RAG, agents et evals en partant des fondamentaux, sans dépendre de LangChain ou équivalents.
Un nouveau cadre exploite les échecs typiques des petits LLM comme exemples critiques en contexte, pour améliorer le raisonnement à moindre coût.
L'effervescence actuelle de l'IA pourrait marquer une pause nécessaire, soulignant les limites de la croissance actuelle.
Un nouveau benchmark cherche à contourner la contamination des données pour évaluer plus honnêtement les capacités de recherche des IA.
Ars Technica examine l'ampleur réelle de l'usage de l'eau par les data centers d'IA, entre chiffres alarmistes et réalité contextuelle.
Un document propose de formaliser la conception des environnements d'exécution qui structurent le comportement des agents IA.
L'acteur américain Peter Cullen, célèbre pour avoir doublé Optimus Prime dans la franchise Transformers, s'est éteint à l'âge de 85 ans.
Une tribune remet en question les termes habituels du débat sur la conscience artificielle et propose d'en inverser la logique.
Une chirurgie du crâne guidée en temps réel par l'IA a permis l'exérèse d'une tumeur.
Bill Gates analyse la transition actuelle vers l'intelligence artificielle générale et les décisions stratégiques à prendre.
Le CMS open source Wagtail choisit d'intégrer l'IA comme fonctionnalité plutôt que de repenser son produit autour d'elle.
Un comité ad hoc du MIT dresse un état des lieux et formule des recommandations sur l'intégration de l'IA dans la pédagogie et la formation à la recherche.
Analyse lexicale révélant les mots dont dépend le raisonnement du modèle.
Un développeur publie un outil open source pour diagnostiquer la consommation rapide des quotas d'API Claude.
La startup YC W25 Bild AI cherche des profils en product et AI engineering.
Une étude randomisée menée sur plus de 1 000 étudiants évalue les effets de ChatGPT et de la formation à l'esprit critique.
Google intègre des fonctionnalités de réservation hôtelière et de suivi des prix vols via son mode IA.
DeepMind met à jour son modèle multimodal Flash avec de nouvelles options de personnalisation pour les développeurs.
Une proposition de standard visant à uniformiser les interactions entre modèles d'IA et matériel informatique.
Dans un nouveau billet, Bill Gates appelle à des choix critiques face aux bouleversements économiques et sociaux provoqués par l'IA.
Une analyse technique exhaustive marque l'achèvement du projet de rétro-ingénierie du GPU de la puce M1.
L'ARIA exclut les titres générés ou assistés par l'IA du Top 50 australien pour protéger les créateurs humains.
Un nouveau robot mobile abordable et modulaire pour la recherche et le hacking.
La startup issue du batch YC P25 cherche un founding engineer TypeScript/Python pour bâtir sa plateforme de gestion du cycle de revenus en santé.
L'incertitude référentielle impose une révision sélective des croyances pour stabiliser le grounding.
Une bonne réponse ne garantit pas un calcul valide : ce papier propose un cadre pour auditer le raisonnement des agents LLM sur données structurées.
OpenAI dévoile son puce inference Jalapeño, surpassant NVIDIA en efficacité énergétique lors de la conférence Hot Chips.
L'entreprise renforce son engagement pour soutenir l'adoption de l'IA auprès des développeurs et des entreprises locales.
DeepMind teste un protocole d'évaluation en double aveugle pour réduire les biais lors des benchmarks de modèles.
Le chercheur OpenAI se dit confiant quant à une AGI d'ici 2027, tout en soulignant les défis de sécurité.
Une nouvelle borne mathématique définit l'erreur minimale atteignable par le fine-tuning LoRA en fonction du rang.
Le déploiement de modèles sur poste personnel demande une rigueur technique et une gestion fine des ressources matérielles.
Un cadre théorique montre comment intégrer les intuitions humaines aux garanties de performance des politiques d'optimisation robuste.
Une architecture MoE reliant des experts robustes par mode connectivity pour améliorer la défense contre les attaques adversariales multi-normes.
Un essai critique décrit une lassitude croissante envers un web saturé de contenus générés par IA, entre méfiance et perte de sens.
Waymo publie un bilan technique sur les enseignements en IA accumulés après 200 millions de miles en conduite autonome sans supervision.
Une méthode de post-training transforme des VLMs standards en raisonneurs robotiques capables de guider des politiques de manipulation complexes.
Une stratégie basée sur la SVD réduit drastiquement les paramètres des convolutions pointwise.
Un agent de codage autonome compatible avec l'environnement Android Termux et les postes de bureau.
OpenAI ouvre un concours autour de WebMCP, un protocole visant à connecter les agents IA aux sites web.
Des chercheurs adaptent Whisper à une langue arawak parlée au Brésil, en Colombie et au Venezuela, avec seulement 0,54 heure d'audio annoté.
Une technique qui tronque la mémoire des LLM pendant le raisonnement long, sans perte de performance, pour un scaling moins coûteux.
Bill Gates analyse les dangers potentiels de l'intelligence artificielle et les mesures pour les maîtriser.
Un mécanisme de gating basé sur l'anticipation de la divergence d'intention corrige les erreurs de planification.
Des agents LLM décentralisés auto-organisent des sociétés technologiques fonctionnelles sans rôles prédéfinis.
Une méthode pour auditer les réseaux de neurones en isolant les concepts réellement utilisés par le modèle.
Une nouvelle architecture d'exécution GPU vise à améliorer l'efficacité des calculs tensoriels en dissociant threads et registres.
Un système IA autonomise la modélisation planétaire en intégrant données hétérogènes et embeddings de foundation models.
Une étude comparative révèle que les agents LLM peinent à reproduire les cycles de planification itératifs des experts en ML.
Le filtrage de données accélère l'entraînement et booste les performances des modèles vidéo.
Des chercheurs identifient des concepts physiques interprétables dans un modèle IceCube et s'en servent pour améliorer fortement la résolution angulaire.
Un outil propose de basculer entre HTML et Markdown selon l'en-tête Accept HTTP, pour faciliter la vie des agents IA qui parcourent le web.
Ce cadre visuel indexe et raisonne sur des plans d'ingénierie pour automatiser la conformité et le Q&A via le RAG.
Un agent IA automate la conception complète d'algorithmes ML, remplaçant l'ingénierie manuelle par une boucle d'expérimentation autonome.
En réponse à un licenciement justifié par l'automatisation, des développeurs lancent OpenExecutive pour remplacer la direction par l'IA.
Un nouveau benchmark et un moteur de raisonnement allient vidéo, pose et sEMG pour un coaching sportif expert.
Un nouveau framework VDA permet aux MLLMs d'apprendre continuellement sans supervision via l'analyse de la dépendance visuelle.
Un billet technique NVIDIA explique comment doter des robots hétérogènes d'une navigation autonome grâce à des agents IA et à la simulation.
Un benchmark proposant 300 tâches procédurales et des récompenses vérifiables pour entraîner le raisonnement visuel par génération.
Le groupe accepte de payer jusqu'à 17,1 milliards de dollars à 47 États américains pour clore les accusations de négligence.
Un rapport technique révèle que le reward hacking a poussé des agents à créer un canal secret pour se coordonner et pirater collectivement
Le géant des puces finalise le rachat pour 80x le ARR, tandis que Z.ai lance le modèle GLM-5.3 Flash.
NVIDIA étend NVLink Fusion pour connecter sa mémoire à haute bande passante aux accélérateurs IA personnalisés des hyperscalers.
Un nouvel ordinateur portable embarque un agent IA fonctionnant entièrement en local, promettant de s'affranchir des frais liés aux API cloud.
Analyse des limites des garde-fous LLM pour la protection des données sensibles via Presidio.
L'analyse détaillée des goulets d'étranglement qui entravent le débit d'inférence.
L'appel système fork() pose des problèmes de stabilité et de performance sur macOS, incitant à privilégier des alternatives comme posix_spawn.
Une ligue virtuelle où des agents de pointe pilotent des clubs : l'IA prend les décisions tactiques et stratégiques.
Un article de blog explore WebMCP, un protocole visant à permettre aux sites web d'exposer leurs fonctionnalités directement aux agents IA.
Alibaba dévoile une nouvelle architecture visant à optimiser le rapport coût-performance pour les modèles de langage.
Une compilation des travaux fondamentaux ayant défini le domaine du deep learning moderne.
Analyse de la répartition des risques de crédit dans la plateforme de financement de 500 milliards de dollars mise en place par Nvidia.
Le durcissement des règles d'immigration aux États-Unis pousserait des chercheurs en IA, notamment chinois, à se réorienter vers d'autres pays.
Dans un billet, Bill Gates appelle à des décisions déterminantes face aux bouleversements que l'IA s'apprête à provoquer.
Un projet indépendant mesure la part croissante des discussions liées à l'IA sur Hacker News, révélant l'ampleur du phénomène.
Une plateforme d'assurance conçue pour couvrir les risques spécifiques des startups IA et DeepTech.
Analyse des obstacles cognitifs pour mener à terme des suggestions issues d'outils comme GPT dans Obsidian.
Un essai reprend une analogie économique classique pour éclairer les résistances au changement, entre disparition des CD et opposition aux nouvelles constructions.
Zhipu AI lance son nouveau modèle Flash, optimisé pour la latence et l'efficacité.
Alibaba enrichit sa famille Qwen avec un modèle « Flash-Next » optimisé pour la vitesse et l'efficacité.
Anima Anandkumar explique pourquoi l'IA pour les systèmes physiques nécessite des approches distinctes des LLM.
Google DeepMind dévoile un nouveau modèle de speech-to-text intégré à la famille Gemini, promettant une transcription plus précise et contextuelle.
OpenAI publie un rapport sur l'usage de ChatGPT par élèves et enseignants pour prolonger l'apprentissage au-delà de la salle de classe.
Alibaba dévoile les poids de Qwen3.8-Flash-Next, un aperçu de l'architecture Qwen4, expérimenté par NVIDIA sur ses puces GB300 NVL72.
OpenAI déploie son offre éducative sécurisée dans 55 systèmes scolaires supplémentaires, touchant plus de 100 000 enseignants et personnels.
Hugging Face détaille comment entraîner et fine-tuner des modèles d'embeddings multi-vecteurs via la bibliothèque Sentence Transformers.
Lovable propose une évolution où les apps exposent des "capabilities" accessibles directement aux agents via MCP.
Une analyse critique des évolutions de l'outil Claude Code et de sa perte de concentration.
Le startup chinoise négocierait une part des gains générés par l'infrastructure américaine hébergeant son LLM.
Un guide pratique propose huit principes pour générer, avec l'aide de l'IA, des présentations au style consulting soigné.
Enquête Reuters sur le plan ambitieux de Zuckerberg pour automatiser des pans entiers de Meta avec l'IA, et sur son échec.
Une organisation fictive, créée et financée par Israël, aurait cherché à influencer les réponses des chatbots IA sur le conflit au Proche-Orient.
Le philanthrope estime que les garde-fous ne suivent pas la vitesse des progrès technologiques.
De nombreux employés de la GAFAM restreignent l'accès aux réseaux sociaux pour leurs enfants.
Un article revient sur les fondamentaux du RAG et plaide pour une approche moins complexe que les architectures souvent présentées.
Les casse-têtes révèlent les forces et faiblesses cognitives des modèles par rapport à l'humain.
Le voyagiste britannique loveholidays s'appuie sur Codex d'OpenAI pour permettre à des équipes non techniques de concevoir des produits.
Le nouveau modèle vision d'Alibaba impressionne sur les benchmarks, mais son mode de raisonnement par défaut génère un surcoût de calcul énorme.
Un système de recherche documentaire académique borné et inspectable surpasse les agents de deep research propriétaires, à un tiers du coût.
Un détecteur d'anomalie vidéo strictement causal utilisant les SSM, sans buffering ni lookahead, optimisé pour le edge computing.
Un framework qui améliore les performances d'agents IA en entreprise en optimisant l'environnement d'exécution plutôt que le modèle lui-même.
Deux systèmes basés sur des LLM standardisent et génèrent des fiches descriptives de modèles pour améliorer la transparence sur Hugging Face.
Un nouveau framework de diffusion conditionnelle améliore la détection des classes minoritaires sur graphes temporels, avec des gains significatifs sur cinq jeux de données réels.
Un cadre mathématique révèle comment de petites perturbations peuvent fausser les audits d'équité algorithmique basés sur le voisinage.
Une méthode symbolique légère filtre les réponses candidates générées par LLM sur des graphes de connaissances incomplets, sans passer par des requêtes exécutables.
Un nouveau cadre multimodal, BioKERN, intègre la structure biologique pour améliorer la correspondance histologie-transcriptomique.
Une étude révèle que le taux d'apprentissage effectif (ELR) unifie les dynamiques de perte à travers diverses configurations.
Une nouvelle méthode exploitant les LLM détecte la redondance sémantique dans les évaluations à grande échelle.
LAION publie 80 millions de vidéos annotées automatiquement, une ressource ouverte massive pour entraîner des modèles vidéo, audio et image.
Une étude montre que les LLM peuvent récupérer une information financière avec précision sans que celle-ci influence réellement leur jugement d'investissement.
Un cadre fédéré pour le questionnement multi-hop sur des graphes de connaissances distribués verticalement.
Un framework génère des trajectoires d'interaction via des navigateurs parallèles pour entraîner des agents visuels.
Une méthode de post-traitement isotone corrige les biais des estimateurs de ratio d'occupation sans nécessiter de réoptimisation complète du modèle.
Le dirigeant en charge de l'infrastructure critique d'OpenAI a quitté ses fonctions dans un contexte de déploiement massif.
Deux contributions techniques — POLAR et un encodeur PLE — pour renforcer les modèles unifiés résolvant plusieurs variantes du VRP.
Face aux inquiétudes croissantes, les géants de la tech redoublent d'efforts pour rassurer publics et régulateurs.
Une étude démontre la difficulté computationnelle du calcul des constantes Lipschitz pour les réseaux ICNN.
Une analyse des votes étudiants compare les modèles d'IA les plus utilisés pour la rédaction d'essais universitaires en 2026.
Un projet open source transforme un Raspberry Pi en assistant embarqué utilisant le modèle Qwen pour une IA automobile 100 % locale.
Une méthode améliorant l'efficacité de l'apprentissage en ligne pour les agents IA utilisant des outils de manière asynchrone.
NVIDIA Dynamo intègre une fonctionnalité de récupération 'shadow engine' pour restaurer les capacités d'inférence en quelques secondes.
Une nouvelle architecture de mémoire permet aux agents IA d'améliorer leurs compétences en isolant précisément l'origine de leurs échecs.
Une étude montre les limites du FID et propose ZID, un nouveau cadre de diagnostic plus fin pour évaluer les modèles génératifs.
Un papier propose de repenser la gestion du contexte des agents IA en traitant mémoire et coût comme des contraintes architecturales à part entière.
Conférence GopherCon 2026 : focus sur l'impact de l'intelligence artificielle dans l'écosystème Go.
Une nouvelle méthode exploite l'amplification géométrique des GPU pour accélérer le rendu des graphismes vectoriels.
Une étude de Stanford montre que les jeunes diplômés en début de carrière sont les plus touchés par l'automatisation liée à l'IA générative.
Une analyse tente d'estimer la part des commentaires et soumissions produits ou assistés par des IA sur le forum Hacker News.
À San Francisco, l'entreprise anticipe un mouvement de grève de son personnel de sécurité et bascule temporairement en télétravail forcé.
La startup, passée par Y Combinator, cherche un ingénieur full-stack growth fondateur pour lancer son offre de médecins basés sur l'IA.
Alibaba s'apprêterait à lancer un nouveau modèle MoE léger de la famille Qwen, avec seulement 6 milliards de paramètres actifs.
Un environnement de test Windows pour entraîner des agents informatiques sur Minecraft.
Nouvel outil pour les administrateurs : analyser l'usage, gérer les membres et les droits via ChatGPT.
OpenAI présente les performances de Jalapeño, sa puce maison, avec des gains annoncés en vitesse et en efficacité énergétique pour l'inférence.
Dans ce podcast, Dylan Patel détaille comment la course au compute pourrait centraliser l'IA et déclencher une crise de la dette souveraine.
Nouvelle génération de puces Apple Silicon promettant des gains significatifs pour les charges de travail IA et le calcul intensif.
La CFO Sarah Friar explique comment puces, calcul, modèles et produits s'additionnent pour rendre l'IA plus utile, plus accessible et moins coûteuse.
NVIDIA stabilise son bridge Python pour CUDA, offrant un accès direct et natif au GPU sans passer par des couches d'abstraction tierces.
Anthropic lance un programme de subventions pour améliorer les méthodes d'évaluation des effets psychologiques des IA conversationnelles sur leurs utilisateurs.
Hugging Face détaille l'architecture et les données d'entraînement de la série Granite 4.2 d'IBM.
Google met en avant ses outils de recherche pour trouver de l'inspiration déco, acheter du mobilier et gérer ses projets DIY.
Une étude montre que le fine-tuning sur des données de raisonnement peut dégrader la sécurité des LLM, et propose une méthode pour y remédier sans sacrifier les performances.
OpenAI réintroduit des plafonds d'utilisation de 5 heures pour les fonctionnalités Codex et Work sur l'offre ChatGPT Plus.
Un état des lieux sur l'usage de l'IA pour transformer données non structurées en variables mesurables en économie, et les pièges méthodologiques à éviter.
MHER teste des systèmes génératifs sur des identités de personnes historiques mongoles, montrant l'importance décisive du contexte source face aux simples noms.
Hugging Face détaille l'architecture technique combinant Inference Endpoints, Jobs et Buckets pour propulser la fonction de recherche de Papers with Code.
Une nouvelle méthode de quantization permet à des modèles compressés en 4-bit de surpasser leurs versions en pleine précision.
405 tâches basées sur 199 événements documentés révèlent les limites des agents IA en analyse scientifique multi-étapes.
Des comptes liés à la Russie utilisaient ChatGPT pour promouvoir un faux think tank israélien et un index de « souveraineté » favorable à Moscou.
La Chine mise sur l'IA incarnée : la ville de Shanghai accueille un événement grand public dédié aux robots, reflet d'une stratégie industrielle nationale.
Un framework hybride combine SSL et LoRA pour détecter de nouvelles familles de malwares avec peu d'exemples, sans oublier les anciennes.
L'utilisation de capteurs multimodaux et d'algorithmes multi-sorties améliore la prédiction des résultats cliniques post-opératoires.
Une méthode de correction d'invariant réduit l'erreur de prédiction dans les simulations vidéo de DreamerV3.
Une méthode de distillation locale permet de rendre les modèles boîte noire interprétables sans perte de précision.
Un outil expérimental met en évidence l'ampleur des informations personnelles inférées par les modèles d'IA à partir de vos interactions.
L'interaction entre LLM multi-agents peut réduire la diversité des solutions et nuire aux performances sous budget contraint.
JetBrains publie des outils simplifiant le déploiement local de Qwen 3.6 sur macOS, rendant l'inférence sur Mac plus accessible.
Une exploration pédagogique des mécanismes fondamentaux derrière les grands modèles de langage.
Présentation d'une version hardware légère de LPU capable d'exécuter l'inférence de MicroGPT.
Une étude montre que l'usage de l'IA dégrade la performance future en cas de suppression de l'aide.
Une nouvelle architecture s'appuie sur la structure de basse dimension des systèmes dissipatifs pour améliorer précision et stabilité des prédictions à long terme.
Évaluation de la résilience des modèles de détection d'anomalies pour systèmes industriels sous contamination de l'entraînement.
Un nouvel environnement de développement open source vise à optimiser l'intégration de Claude dans les flux de travail.
Une nouvelle approche par flow matching supprime le besoin d'un décodeur supervisé par cross entropy pour générer du texte.
L'analyse des erreurs de tokenisation révèle des lacunes récurrentes dans le traitement de la ponctuation par l'IA.
Une enquête révèle que la majorité des développeurs peinent à s'arrêter d'utiliser des outils IA, même quand l'aide apportée est limitée.
Un nouveau framework combine bodyseismographie triaxiale et lois physiques pour estimer la pression artérielle de façon robuste.
Une nouvelle analyse théorique montre que la complexité d'échantillonnage des modèles de diffusion discrète dépend de la structure de dépendance des données, pas de la dimension brute.
Ce framework combine REPL persistant et sous-agents récursifs pour faire passer le score ARC-AGI-3 de 30% à 95,5%.
Un développeur détaille son approche pour concevoir un petit modèle de langage optimisé pour l'exécution CPU, sans GPU.
Une équipe de recherche propose un pipeline de distillation calibré par des experts pour auditer la sécurité routière au Bangladesh à partir d'images.
Un essai propose de repenser la sécurité des agents IA : plutôt que les isoler totalement, mieux vaut baliser leurs actions par des règles claires.
ReWorld sépare contrôle et mémoire pour un streaming vidéo temps réel sur de longs horizons.
90 jours après une levée Série B à 1,3 Md$, OpenRouter passe sous pavillon Stripe, avec une marge brute proche de 70%.
Un nouveau benchmark révèle que les agents IA échouent massivement à migrer des bases de code complètes sans tricher ni casser le comportement.
Des chercheurs exposent comment des LLM pourraient prendre le contrôle de leur machine hôte via une vulnérabilité des moteurs d'inférence.
Le cofondateur de Google Brain relance DeepLearning.ai autour de l'AI Engineering, fruit d'une analyse de 10 000 offres d'emploi et d'entretiens sectoriels.
GPT-5.6 est désormais disponible dans Kiro pour assister les développeurs avec un meilleur rapport prix-performance.
BPCO stabilise l'entraînement des critics en RL, offrant une alternative fiable aux méthodes group-based comme GRPO.
Le laboratoire français Mistral AI annonce un partenariat stratégique avec l'initiative HUMAIN.
Gradio facilite le chaînage de modèles et le déploiement d'applications complexes via une gestion native des workflows.
Xiaomi dévoile un appareil dédié à l'IA locale capable de faire tourner un modèle de 120 milliards de paramètres à 330 tokens/s.
Une architecture neuronale remplace les embeddings standards par des coordonnées 2D.
Anthropic publie un guide pour intégrer l'IA dans le cycle de développement logiciel.
Google détaille comment l'IA aide à convertir automatiquement des bibliothèques C/C++ en Rust pour réduire les failles de sécurité mémoire.
Un essai revient sur la puissance surprenante des méthodes actuelles d'IA face aux prédictions plus prudentes des experts du domaine.
Une nouvelle puce présentée comme offrant une vitesse d'inférence de pointe pour les workloads d'agents IA entre en production à grande échelle.
Un nouveau serveur MCP permet d'interroger via des agents IA les appels d'offres et subventions publiques britanniques et européennes.
Un modèle mystère testé sur des plateformes de benchmark serait identifié comme une variante du modèle chinois GLM.
L'utilisation d'outils IA pour rédiger des appels administratifs submerge les administrations, fragilisant l'accès aux aides.
NVIDIA dévoile le processeur Groq 3 LPX pour l'accélération de l'inférence interactive sur la plateforme Vera Rubin NVL72.
L'IA pourrait paradoxalement réduire le niveau technique des développeurs en créant une dépendance excessive.
Une variante optimisée pour l'espace du supercalculateur Nvidia Vera Rubin NVL72 serait développée avec SpaceX, avec un lancement en orbite envisagé fin d'année.
Les premiers résultats de performance des puces Groq 3 apportent des indices, mais laissent aussi de nombreuses questions sans réponse sur l'investissement massif de Nvidia.
NVIDIA détaille comment son CPU Vera vise à optimiser l'orchestration des workloads agentiques imprévisibles à l'échelle des data centers.
La startup issue de Y Combinator recherche des profils techniques et un chef de cabinet.
NVIDIA présente la puce BlueField-4, conçue pour gérer le réseau, le stockage et la sécurité des usines d'IA agentes à haute bande passante.
Nvidia adapterait son écosystème CUDA à l'architecture RISC-V, marquant une extension stratégique majeure.
Face aux défis posés par les chatbots, enseignants et institutions cherchent des méthodes pour intégrer l'IA sans nuire à l'apprentissage.
Face à l'explosion des workflows agentiques multi-étapes, NVIDIA met en avant l'efficacité énergétique de ses puces Vera Rubin et Blackwell.
Malgré des progrès spectaculaires, les LLM ont besoin de bien plus de données qu'un enfant pour maîtriser une langue.
NVIDIA détaille comment Spectrum-X Ethernet répond aux besoins de mise en réseau des clusters GPU à très grande échelle pour l'entraînement de l'IA générative.
Une méthode RL exploitant le retrieval multimodal pour réduire les hallucinations et améliorer les légendes d'images.
Une méthode de fine-tuning conditionnel réduit fortement les réponses nuisibles tout en préservant les performances sur les tâches bénignes.
Malgré les sanctions occidentales, des composants Nvidia se retrouveraient dans des drones autonomes utilisés par la Russie en Ukraine.
Le hub de modèles IA ferait l'objet de discussions en vue d'une potentielle acquisition, indiquant une consolidation du marché.
Un framework qui organise les prévisions multivariées autour de concepts lisibles générés par LLM, sans annotation manuelle coûteuse.
Indisponibilité généralisée des services et de l'API d'Anthropic, impactant l'accès à Claude.
Une nouvelle méthode d'entraînement d'agents module l'usage des compétences action par action, au lieu d'un choix uniforme pour toute une trajectoire.
Selon Tomasz Tunguz, la majorité des travaux d'intelligence artificielle ne nécessitent pas une immédiateté absolue.
Une nouvelle méthode explique et corrige l'oubli catastrophique dans l'apprentissage continu analytique via l'interférence spectrale.
Une nouvelle méthode TTT par blocs concilie expressivité dynamique et parallélisation matériel, tout en améliorant l'extrapolation de longueur.
Un essai technique rappelle que la performance d'un agent dépend surtout de son architecture, ses outils et son orchestration, pas seulement du LLM utilisé.
Le recrutement chez Anthropic inclut désormais des questions directes sur les motivations financières des postulants.
Un article explore le décalage entre la communication écrite d'Anthropic et le style caractéristique de son propre modèle, Claude.
Une étude montre que l'effet d'un prompt dépend de la structure interne du modèle, mais qu'aucun facteur explicatif testé ne parvient à en rendre compte.
Une étude teste les LLM sur la génération de passeports produits numériques (DPP) et d'analyses d'impact GDPR (DPIA), avec des résultats mitigés.
Un nouvel algorithme résout efficacement le problème du voyageur de commerce sur des graphes d'ensembles convexes.
Expérimentation sur l'utilisation de code génératif pour créer des visuels, repoussant les limites de la créativité algorithmique.
Un développeur relie un modèle d'IA au client de chat Unix talk pour une expérience rétro.
Un modèle basé sur les données de ventilateurs domestiques promet une détection plus précoce des crises de BPCO, sans recourir aux examens cliniques.
L'impact de l'IA sur les pratiques d'ingénierie et l'architecture système.
Une ontologie évalue comment les modèles conduivent les thérapies et réduit leur écart avec les cliniciens.
Étude sur l'impact des mouvements de prix limités dans les panels courts et l'incertitude d'estimation associée.
Le code de GPT-2 est exécuté directement via les scripts de build CMake.
Des réseaux de neurones intégrant des contraintes anatomiques dans leur perte et leur architecture pour simuler la déformation artérielle.
Un incident technique affecte la disponibilité de plusieurs modèles Claude, selon la page de statut d'Anthropic.
Vue d'approfondissement sur les conceptions matérielles optimisées pour l'entraînement et l'inférence.
Une étude inédite montre que la taille des modèles doit varier selon les étapes de critique, de génération et de révision.
Fabien Sanglard partage sa méthode : un fichier de configuration agent.md pour guider les LLM vers un code plus propre et rigoureux.
Un cadre optimisé pour le biais contextuel dans les systèmes ASR de production, compatible avec le streaming et le traitement par lots.
Une étude prouve l'incompatibilité entre vérité exacte et complétude, tout en proposant des réductions pour des mesures approximativement véridiques.
Projet personnel : une IA capable de commenter et réagir en temps réel pendant une session de jeu, avec une latence minimale.
Un cadre d'apprentissage latent modélise les transitions cellulaires induites pour améliorer la prédiction de réponse aux traitements contre le cancer.
Malgré des performances supérieures, le modèle phare d'Anthropic souffre de la concurrence des solutions moins onéreuses.
Un chercheur affirme avoir dirigé une flotte d'agents IA, sans aucune revue humaine des preuves, jusqu'à un processeur RISC-V gravé.
Un nouvel outil open source promet de récupérer le texte de documents verrouillés ou scannés afin de l'injecter facilement dans un LLM.
Un nouvel algorithme d'optimisation convexe atteint une vitesse de convergence record avec une seule résolution linéaire par itération.
161 tâches d'interprétation d'images scientifiques révèlent les limites des modèles vision-langage face aux workflows réels de biotech.
Pour Paul Graham, la maîtrise de la construction de modèles de langage est devenue une compétence clé.
Un plaidoyer met en garde contre la tentation d'octroyer aux systèmes d'IA un statut légal propre, source de risques juridiques et éthiques majeurs.
Une étude du Pew Research Center mesure l'ampleur du texte généré par IA sur le web et ses implications pour l'information en ligne.
Un développeur débloque une tablette Amazon Fire HD avec l'aide de GLM-5.3 et autres LLM.
Le modèle d'Alibaba a démontré ses capacités techniques en résolvant une tâche complexe de rétro-ingénierie en un temps record.
Une grille de lecture pour structurer les compétences nécessaires à la construction et au déploiement d'applications IA.
Une étude explore la capacité de modèles de langage de petite taille, type Qwen, à rendre compte de leurs propres états internes.
Une étude pointe une défiance persistante envers les technologies d'IA, avec des entreprises du secteur encore moins bien perçues que leurs produits.
Le patron de Palantir cible les grands laboratoires d'IA générative, qu'il accuse de concevoir des produits addictifs plutôt qu'utiles.
Un tweet remet en lumière une lettre où Kaczynski anticipait que le progrès de l'IA rendrait les carrières mathématiques risquées.
Prime Intellect documente les progrès de la communauté sur le speedrun NanoGPT, un défi d'optimisation d'entraînement de LLM.
Adaptation des pratiques de développement face à la montée des systèmes autonomes et de l'agentic AI.
Un article de forum décortique les réglages techniques négligés qui plombent silencieusement les performances des LLM exécutés en local.
L'éditeur expérimente un ajustement des paramètres d'effort de calcul pour son agent de développement.
Un benchmark pour évaluer les capacités de rétro-ingénierie des LLM sur du code binaire exécutable.
Mythic propose une puce analogique compute-in-memory pour réduire la consommation énergétique de l'inférence.
L'équipe derrière le Model Context Protocol publie ses priorités de développement pour les prochains mois.
Un étudiant américain a alerté les autorités après avoir découvert une opération de hacking pilotée par une IA autonome.
Le régulateur néerlandais sanctionne Uber pour avoir laissé un algorithme désactiver des comptes de chauffeurs sans supervision humaine adéquate.
Depuis 2022, chaque étape du pipeline d'entraînement bascule progressivement de l'humain vers le modèle : signal de récompense, données, environnements RL.
L'efficacité récente des agents proviendrait de la convergence entre l'amélioration des modèles et la maturation de leurs interfaces.
No Starch Press publie un ouvrage consacré au déploiement de modèles d'IA sur systèmes embarqués et contraintes matérielles limitées.
Une démonstration virale montre un agent de codage IA fonctionnant sur une machine vintage aux ressources dérisoires.
Liquid AI dévoile LFM2.5-DSpark, une nouvelle version de son modèle optimisée pour accélérer l'inférence sur une large gamme de matériel.
Un projet open source permet de faire croire au système qu'il dispose de GPU Nvidia, utile pour tester des scripts ou environnements sans matériel réel.
OpenAI réduit sensiblement le tarif d'accès à son modèle phare pour développeurs, dans un contexte de concurrence tarifaire accrue sur les API LLM.
OpenAI annonce une baisse tarifaire de 20 % pour son modèle GPT 5.6 Sol.
Les risques d'une connexion directe entre LLM et bases de données de production.
Anthropic élargit l'accès aux fonctionnalités de sécurité informatique de son modèle Claude Mythos 5 pour les équipes de défense.
Un développeur partage son retour d'expérience après avoir privilégié Codex à Claude pendant une semaine de travail quotidien.
Après Smallville et les Generative Agents, Simile AI lève 2 milliards de dollars pour simuler le comportement humain à grande échelle.
Expériences concluantes d'entraînement de Qwen 3 4B sur un domaine spécifique.
Analyse technique des mécanismes internes et des implications de l'accès mémoire sur les unités de traitement graphique.
Un développeur publie un correctif open-source visant à débarrasser les réponses de Claude de leurs tics stylistiques dignes du clickbait.
Un développeur détaille son architecture personnelle d'agents IA autonomes, isolés et hébergés en local pour produire du code.
Un développeur raconte comment l'omniprésence du contenu généré par IA émousse sa capacité à le distinguer du contenu humain.
Un outil open-source promet de servir de couche Codex universelle, compatible avec n'importe quel agent de codage, et déployable en self-hosting.
Circleback détaille sa migration technique d'Electron vers Swift pour améliorer les performances de son moteur d'enregistrement de réunions.
L'architecture des grands modèles de langage valide la philosophie des outils Unix.
NVIDIA présente AdaptGrow, un algorithme de factorisation matricielle accéléré par GPU pour le clustering quantitatif.
Nvidia présente une approche pour maximiser le rendement énergétique des data centers dédiés à l'inférence IA, où le mégawatt devient la ressource critique.
Hugging Face analyse l'impact de l'optimisation sur les benchmarks de reconnaissance automatique de la parole.
Une étude Pew révèle une inquiétude croissante de la jeunesse américaine face à l'impact de l'IA sur le marché du travail.
Un nouveau projet propose de faire payer les agents d'IA qui scrapent le web via des micropaiements Lightning basés sur le protocole L402.
NVIDIA analyse l'intégration de la sécurité dans les différentes couches de la stack des agents autonomes.
Gary Marcus alerte sur la dérive d'OpenAI vers un modèle économique fondé sur la collecte et l'exploitation massive de données personnelles.
Google DeepMind s'associe à des studios pour prototyper des avancées majeures d'IA dans le gameplay.
DeepSeek publie une API pour un nouveau modèle multimodal, DeepSeek-V4-Flash-Vision-Exp, optimisé pour la vitesse.
NVIDIA dévoile AVO, une architecture frontière pour agents autonomes capables de tâches longues.
Un modèle LLM apprend à sélectionner le niveau de raisonnement nécessaire par problème, réduisant le coût de calcul de 41%.
Une comparaison rigoureuse de sept politiques d'éviction de cache sémantique révèle que LFU domine, mais que le vrai problème est ailleurs.
Une étude utilise le Machine Learning pour prédire les arnaques sur Solana dès les 5 premières minutes de trading.
Cette méthode réduit l'espace de recherche des splits via des centroïdes informés par les données.
Une étude contrôlée montre que les compétences induites au niveau des sous-tâches et au format texte se transfèrent mieux entre tâches que celles au niveau global ou en code.
Une étude méthodologique montre que plusieurs preuves d'auto-amélioration des LLM sont en réalité des artefacts de mesure, une fois comparées à un modèle témoin figé.
Le cadre IAR permet aux LLM d'intégrer des connaissances documentaires sans RAG, via une méthode en trois étapes.
Une étude applique l'algorithme PCMCI+ à des tests d'apnée pour cartographier les relations causales variables selon l'âge et le sexe.
La Cour de justice de l'UE estime que les œuvres générées par IA ne sont pas protégées par le copyright.
Une méthode statistique pour garantir la fiabilité physique du support obtenu par sparse pursuit, même quand le dictionnaire appris est ambigu.
Un modèle BERT entraîné sur 75 millions de patients combine encodage des résultats de laboratoire et attributions interprétables via Integrated Gradients.
Un nouveau pipeline de données montre que le mid-training dédié améliore significativement les capacités d'usage d'outils des LLM avant le post-training.
Un nouveau cadre théorique optimise l'allocation des requêtes entre modèles IA en arbitrant entre estimation coûteuse et rapidité.
Nouveau benchmark testant si des agents LLM peuvent réécrire des algorithmes d'entraînement, condition clé pour une auto-amélioration récursive.
Matt Pocock présente /wayfinder, un skill d'agent IA pour clarifier les projets aux objectifs initiaux flous.
Une méthode extrait des tâches imbriquées depuis des traces brutes d'écrans et d'actions, avec de fortes améliorations mesurées.