Le modèle vision-langage 3B de Liquid AI cible l’edge avec la compréhension d’écran et une inférence CPU rapide

Liquid AI a publié LFM2.5-VL-3B, son modèle vision-langage le plus performant à ce jour, conçu pour le déploiement sur appareil et en périphérie (edge). Le modèle de 3,1 milliards de paramètres repose sur une architecture sans raisonnement explicite, qui répond directement au lieu de générer des chaînes de pensée, ce qui maintient une latence faible pour les applications en temps réel. L’entreprise affirme que le modèle offre des performances en vision comparables à celles de modèles deux fois plus gros, tout en tournant plus vite que des concurrents plus petits sur CPU et GPU.

La publication, annoncée mercredi, s’appuie sur LFM2-VL-3B d’octobre avec quatre améliorations. La compréhension des écrans et des interfaces en est la fonction phare : le modèle obtient en moyenne 80,7 sur ScreenSpot-v2, un benchmark de navigation dans les interfaces, devant les 51,2 de Gemma-4-E4B et les 78,5 de Qwen 3.5 4B, et juste derrière le plus grand InternVL-3.5-4B. L’appel de fonctions (function calling), nouveau dans la gamme vision de Liquid, a plus que doublé sur le benchmark ToolSandbox, passant de 26,4 à 59,5. Le grounding, soit la capacité à localiser des objets décrits en langage naturel et à renvoyer des boîtes englobantes, est passé de 57,1 à 87,9 sur la précision RefCOCO au premier rang. Le raisonnement multi-images s’est aussi nettement amélioré, avec BLINK passant de 50,2 à 61,5 et MUIRBench de 34,9 à 58,3.

Sur 28 benchmarks couvrant la compréhension multilingue, le suivi d’instructions, les mathématiques et les sciences visuelles, la compréhension de documents, la détection, le multi-image et la compréhension d’écran, Liquid annonce une moyenne de 69,4, au niveau d’InternVL-3.5-4B et à 0,7 point de Qwen3.5-4B, deux modèles de 4,7 milliards de paramètres. Le modèle domine sa catégorie de taille sur RealWorldQA, POPE et RefCOCO, qui couvrent les questions sur le monde physique, la résistance aux hallucinations et le grounding d’objets, ainsi que les documents, les graphiques et les éléments d’interface.

L’efficacité est l’argument qui le distingue. Le checkpoint fonctionne dans moins de 3,3 Go de mémoire, décode 228 jetons par seconde sur un Apple M5 Max et 116 jetons par seconde sur un AMD Ryzen AI Max+ 395, avec un résultat de niveau téléphone d’environ 20 jetons par seconde sur un Galaxy S26 Ultra, rapporté par des médias tiers. Il est distribué aux formats natif, GGUF, ONNX et MLX, avec une prise en charge dès le premier jour pour llama.cpp, MLX et vLLM, et une démo WebGPU tourne entièrement dans le navigateur, y compris la capture depuis la webcam.

Help us keep thoughtful, evidence-based journalism accessible to readers everywhere.

Become a supporter

Les détails de l’entraînement expliquent une partie du gain. Le modèle utilise la même architecture que les variantes vision plus petites de Liquid, associant le backbone texte LFM2.5-2.6B à un encodeur vision SigLIP2 400M. Le pré-entraînement a porté sur environ 34 000 milliards de jetons, avec un vocabulaire doublé à 128K pour prendre en charge les écritures non latines, et le pré-entraînement vision a été multiplié par quatre, avec des données sélectionnées et synthétiques couvrant les légendes, l’OCR, le grounding et le suivi d’instructions. Le post-entraînement a combiné un fine-tuning supervisé, incluant la distillation à partir d’un enseignant plus grand et la technique Antidoom de l’entreprise, avec un apprentissage par renforcement à récompenses multiples.

Le modèle est disponible sous la licence LFM Open License v1.0 sur Hugging Face, avec un usage commercial gratuit pour un chiffre d’affaires annuel inférieur à 10 millions de dollars, et peut être testé sur le playground de Liquid. C’est la troisième grande publication de la famille LFM2.5 ce mois-ci, après le modèle texte 2.6B et la gamme d’encodeurs destinée à l’inférence CPU à long contexte, alors que la startup issue du MIT défend une thèse plus large : des modèles de fondation assez petits et efficaces pour vivre sur les appareils que les gens transportent réellement avec eux.

Traduit par Lydie

Sources : LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge (Liquid AI, 12 août 2026) ; LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge (Hugging Face, 12 août 2026) ; Liquid AI Releases LFM2.5-VL-3B: A 3B Vision-Language Model That Reads Screens, Grounds Objects, and Calls Tools On-Device (MarkTechPost, 13 août 2026)

Scroll to Top