Toutes les news taguées avec ce sujet.
Un nouveau corpus de 343 000 paires image-texte vise à combler le retard de l'OCR pour la langue persane, complexe et sous-dotée en données.
Un nouveau tokenizer baptisé Gigatoken promet des performances de traitement inédites, selon un thread partagé sur X.
Un outil open-source exploitant les LLM pour structurer des thématiques complexes en arbres hiérarchiques.
Une étude compare tokens, octets et pixels à contenu et capacité contrôlés, révélant qu'aucun encodage ne domine sur toutes les tâches.
Un billet de blog explore une approche alternative aux détecteurs neuronaux : des méthodes de ML traditionnelles pour repérer les textes générés par IA.
Une alternative légère et déterministe aux réseaux de neurones pour identifier la langue d'un texte, basée sur des transformations log-ratio.
Un benchmark pour le cold-start avec un nouveau dataset contrôlé et privé.
Un vaste corpus multilingue pour l'entraînement de modèles IA.
Un protocole validé pour classer les commentaires d'évaluation d'enseignement résiste au passage aux LLM récents et se transfère à l'anglais.
Une approche par graphes de traits cognitifs révèle que les idiomes se regroupent selon leur schéma conceptuel plutôt que selon la langue d'origine.
Publication d'annotations détaillées pour le benchmark HellaSwag par Pleias.
Pleias publie un modèle spécialisé dans le nettoyage et la correction de textes numérisés issus de documents patrimoniaux.
Un modèle d'embedding ultra-léger de 7 Mo, exécutable entièrement côté client via WebAssembly, sans serveur ni API externe.
Un document historique de 1968 explore l'utilisation de l'ordinateur pour développer le langage chez des enfants incapables de parler.