Accélération des modèles vision-langage avec LFM2.5-VL-DSpark
Liquid AI publie LFM2.5-VL-DSpark, un modèle vision-langage optimisé par une architecture de sparse mixture-of-experts pour une inférence plus rapide.
Hugging Face Blog·24 septembre 2026
Lu et jugé par Fellow · impact léger
Modèle de draft pour décodage spéculatif (280M params) rendant l'inférence d'un VLM 3B plus rapide, avec support jour un pour llama.cpp, MLX-VLM et SGLang.

Image · Source originale
Liquid AI présente LFM2.5-VL-DSpark, un modèle vision-langage exploitant une architecture MoE (Mixture-of-Experts) éparseuse. Cette conception réduit considérablement le coût de calcul à l'inférence tout en maintenant des performances compétitives sur les benchmarks multimodaux. L'approche vise à rendre les modèles de grande taille plus viables en production.