Los pequeños encoders de Liquid AI ejecutan la inferencia de contexto largo 3,7× más rápido en CPU que ModernBERT

Los modelos de encoder, los caballos de batalla de la búsqueda, la clasificación y el filtrado de seguridad, tienen un problema. Cuando las entradas crecen hasta miles de tokens, la latencia de inferencia en CPU se dispara a minutos. El último lanzamiento de Liquid AI pretende resolverlo con un par de modelos de encoder pequeños diseñados específicamente para una inferencia eficiente de contexto largo en hardware de CPU.

La serie LFM2.5-Encoder, publicada en variantes de 230 y 350 millones de parámetros, procesa 8.192 tokens unas 3,7 veces más rápido que el modelo equivalente ModernBERT-base en CPU. Con esa longitud, ModernBERT-base tarda más de 90 segundos por pasada hacia delante. El LFM2.5-Encoder-230M lo hace en unos 28 segundos.

La ganancia de rendimiento proviene de la arquitectura subyacente. Ambos modelos se inicializan a partir de los backbones de decodificador LFM2.5 de Liquid AI y se convierten en encoders bidireccionales mediante tres modificaciones: una máscara de atención bidireccional que permite a los tokens ver ambos lados, convoluciones cortas no causales con padding simétrico y entrenamiento de modelado de lenguaje enmascarado con un 30 por ciento de tokens enmascarados. Un proceso de entrenamiento en dos etapas construye primero una competencia lingüística general con longitudes de contexto cortas y después se extiende a 8.192 tokens sobre un corpus mixto de datos factuales, legales y multilingües.

Los benchmarks cuentan una historia clara para la clase de tamaño del modelo. La variante de 350M ocupa el cuarto puesto entre los 14 modelos de encoder evaluados en tareas de GLUE, SuperGLUE y clasificación multilingüe, superada únicamente por modelos más grandes, incluido uno de 3,5 mil millones de parámetros. La variante de 230M supera a ModernBERT-base y a todos los modelos EuroBERT pese a ser más pequeña que la mayoría de ellos.

If you value careful, fact-driven reporting, consider supporting 1ban.news.

Keep quality journalism alive

Para los desarrolladores que despliegan en producción, la ventaja de velocidad en CPU es lo más destacado. Muchas cargas de trabajo de encoders (enrutamiento de intenciones, revisión de políticas, detección de PII, corrección ortográfica) se ejecutan de forma continua en las CPU de los servidores en lugar de en GPU, donde la latencia con entradas largas afecta directamente al rendimiento. Liquid AI ha publicado demos en vivo en Hugging Face Spaces que muestran enrutamiento de prompts zero-shot, revisión de políticas y detección de PII multilingüe ejecutándose íntegramente en CPU.

Los modelos están disponibles bajo licencias de código abierto permisivas y se integran a través del pipeline estándar de Hugging Face Transformers. Flash Attention 2 es opcional para la aceleración con GPU, pero la filosofía de diseño es clara: los encoders no deberían requerir una GPU para ser prácticos, ni siquiera cuando procesan miles de tokens por petición.

Traducido por Alessandra

Fuentes: Hugging Face Blog (Jul 28, 2026); Modelos de Liquid AI

Scroll to Top