Un pipeline NLP hybride non supervisé/supervisé pour détecter les propos accusateurs dans les marchés publics
Des chercheurs équatoriens combinent clustering et classification pour repérer les signalements d'irrégularités dans les commentaires publics des appels d'offres.
arXiv cs.AI · cs.LG · cs.CL·Bryan Torres, Daniel Riofrío, José Vega-Sánchez, Nathaly Orozco·12 août 2026

Image · Source originale
L'étude exploite les données du système équatorien SOCE pour analyser les commentaires laissés lors de la phase pré-contractuelle des marchés publics. Le pipeline combine des embeddings (Word2Vec, LLaMA, RoBERTa), un clustering par Gaussian Mixture Models, puis une classification supervisée pour identifier les commentaires accusateurs ou de type lanceur d'alerte. La combinaison Word2Vec entraîné sur le domaine, GMM et Random Forest obtient les meilleurs résultats, même avec un fort déséquilibre de classes.