Les petits encodeurs de Liquid AI exécutent l’inférence en contexte long 3,7 fois plus vite sur CPU que ModernBERT

Les modèles encodeurs, chevaux de trait de la recherche, de la classification et du filtrage de sécurité, ont un problème. Lorsque la longueur des entrées atteint des milliers de jetons, la latence d’inférence sur CPU grimpe à plusieurs minutes. La dernière sortie de Liquid AI vise à résoudre ce problème avec une paire de petits modèles encodeurs conçus spécifiquement pour une inférence en contexte long efficace sur matériel CPU.

La série LFM2.5-Encoder, déclinée en variantes de 230 millions et 350 millions de paramètres, traite 8 192 jetons environ 3,7 fois plus vite que le modèle ModernBERT-base équivalent sur CPU. À cette longueur, ModernBERT-base met plus de 90 secondes par passage avant. Le LFM2.5-Encoder-230M y parvient en environ 28 secondes.

Le gain de performance provient de l’architecture sous-jacente. Les deux modèles sont initialisés à partir des backbones décodeurs LFM2.5 de Liquid AI et convertis en encodeurs bidirectionnels grâce à trois modifications : un masque d’attention bidirectionnel qui permet aux jetons de voir des deux côtés, des convolutions courtes non causales avec un padding symétrique, et un apprentissage par modélisation de langage masqué avec masquage de 30 % des jetons. Un processus d’entraînement en deux étapes construit d’abord une compétence linguistique générale sur des longueurs de contexte courtes, puis s’étend à 8 192 jetons sur un corpus mixte de données factuelles, juridiques et multilingues.

Les benchmarks racontent une histoire claire pour cette classe de taille de modèles. La variante 350M se classe quatrième sur 14 modèles encodeurs testés sur GLUE, SuperGLUE et des tâches de classification multilingues, devancée uniquement par des modèles plus grands, dont un modèle à 3,5 milliards de paramètres. La variante 230M bat ModernBERT-base et tous les modèles EuroBERT tout en étant plus petite que la plupart d’entre eux.

Quality journalism takes time and resources. Your support helps us focus on accuracy instead of advertising.

Fund our reporting

Pour les développeurs qui déploient en production, l’avantage de vitesse sur CPU est le point central. De nombreuses charges de travail d’encodeurs (routage d’intentions, linting de politiques, détection de PII, vérification orthographique) tournent en continu sur des CPU de serveur plutôt que sur des GPU, où la latence sur de longues longueurs d’entrée affecte directement le débit. Liquid AI a publié des démos en direct sur Hugging Face Spaces montrant un routage de prompts zero-shot, un linting de politiques et une détection de PII multilingue fonctionnant entièrement sur CPU.

Les modèles sont disponibles sous des licences open source permissives et s’intègrent via le pipeline standard Hugging Face Transformers. Flash Attention 2 est facultatif pour l’accélération GPU, mais la philosophie de conception est claire : les encodeurs ne devraient pas nécessiter de GPU pour être pratiques, même lorsqu’ils traitent des milliers de jetons par requête.

Traduit par Lydie

Sources: Hugging Face Blog (Jul 28, 2026); Liquid AI models

Scroll to Top