Pleias publie Common Corpus, un vaste jeu de données ouvert pour l'entraînement de LLM
Le laboratoire français Pleias met à disposition une collection massive de textes libres de droits destinée à l'entraînement de modèles de langage.
Article composé de 2 sources

Image · Source originale
Common Corpus est une collection de données textuelles publiée par Pleias sur Hugging Face, composée de contenus dans le domaine public ou sous licences ouvertes. Elle vise à fournir une alternative transparente et légalement sûre aux corpus d'entraînement traditionnels des LLM, souvent opaques sur leurs sources.