El modelo visión-lenguaje de 3B de Liquid AI apunta al edge con comprensión de pantallas e inferencia rápida en CPU

Liquid AI ha lanzado LFM2.5-VL-3B, su modelo visión-lenguaje más capaz hasta la fecha, diseñado para el despliegue en el propio dispositivo y en el edge. El modelo de 3.100 millones de parámetros utiliza una arquitectura sin razonamiento que responde directamente en lugar de generar cadenas de pensamiento, lo que mantiene una latencia baja para aplicaciones en tiempo real. La compañía afirma que ofrece un rendimiento de visión competitivo con modelos del doble de su tamaño, a la vez que funciona más rápido que rivales más pequeños en CPU y GPU.

El lanzamiento, anunciado el miércoles, se basa en el LFM2-VL-3B de octubre con cuatro mejoras. La comprensión de pantallas e interfaces de usuario es la característica estrella: el modelo promedia 80,7 en ScreenSpot-v2, un benchmark de navegación por interfaces, por delante del 51,2 de Gemma-4-E4B y del 78,5 de Qwen 3.5 4B, y apenas por detrás del más grande InternVL-3.5-4B. La llamada a funciones, nueva en la línea de visión de Liquid, se duplicó con creces en el benchmark ToolSandbox, al pasar de 26,4 a 59,5. La localización, la capacidad de ubicar objetos descritos en lenguaje natural y devolver cuadros delimitadores, saltó de 57,1 a 87,9 en la precisión de RefCOCO en el rango uno. El razonamiento con múltiples imágenes también mejoró sustancialmente, con BLINK pasando de 50,2 a 61,5 y MUIRBench de 34,9 a 58,3.

En 28 benchmarks que abarcan comprensión multilingüe, seguimiento de instrucciones, matemáticas y ciencia visuales, comprensión de documentos, detección, múltiples imágenes y comprensión de pantallas, Liquid reporta una media de 69,4, a la par con InternVL-3.5-4B y a menos de 0,7 puntos de Qwen3.5-4B, ambos modelos de 4.700 millones de parámetros. El modelo lidera su clase de tamaño en RealWorldQA, POPE y RefCOCO, que cubren preguntas sobre el mundo físico, resistencia a la alucinación y localización de objetos, además de documentos, gráficos y elementos de interfaz.

La eficiencia es el argumento que lo distingue. El checkpoint se ejecuta en menos de 3,3 GB de memoria, decodifica 228 tokens por segundo en un Apple M5 Max y 116 tokens por segundo en un AMD Ryzen AI Max+ 395, con un resultado de nivel telefónico de unos 20 tokens por segundo en un Galaxy S26 Ultra, según informes de terceros. Se distribuye en formatos nativos, GGUF, ONNX y MLX, con soporte desde el primer día para llama.cpp, MLX y vLLM, y una demo WebGPU se ejecuta íntegramente en el navegador, incluida la captura de la cámara web.

Our mission is simple: reliable news backed by careful research. Help us continue that mission.

Apoyar a 1ban.news

Los detalles del entrenamiento explican parte de la mejora. El modelo utiliza la misma arquitectura que las variantes de visión más pequeñas de Liquid, que empareja el tronco de texto LFM2.5-2.6B con un codificador de visión SigLIP2 400M. El preentrenamiento se ejecutó sobre aproximadamente 34.000 mil millones de tokens, con un vocabulario duplicado a 128K para admitir escrituras no latinas, y el preentrenamiento de visión se multiplicó por cuatro con datos curados y sintéticos que cubren pies de foto, OCR, localización y seguimiento de instrucciones. El postentrenamiento combinó el ajuste fino supervisado, incluida la destilación de un maestro más grande y la técnica Antidoom de la compañía, con aprendizaje por refuerzo multi-recompensa.

El modelo está disponible bajo la Licencia Abierta LFM v1.0 en Hugging Face, con uso comercial gratuito por debajo de 10 millones de dólares de ingresos anuales, y se puede probar en el playground de Liquid. Es el tercer lanzamiento importante de la familia LFM2.5 este mes, después del modelo de texto 2.6B y de la línea de codificadores orientada a la inferencia de contexto largo en CPU, mientras la startup nacida en el MIT impulsa una tesis más amplia: modelos fundacionales lo bastante pequeños y eficientes como para vivir en los dispositivos que la gente lleva realmente consigo.

Traducido por Alessandra

Fuentes: LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge (Liquid AI, 12 de agosto de 2026); LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge (Hugging Face, 12 de agosto de 2026); Liquid AI Releases LFM2.5-VL-3B: A 3B Vision-Language Model That Reads Screens, Grounds Objects, and Calls Tools On-Device (MarkTechPost, 13 de agosto de 2026)

Scroll to Top