Liquid AIの3Bビジョン言語モデル、画面理解と高速CPU推論でエッジを狙う

Liquid AIは、これまでで最も高性能なビジョン言語モデルLFM2.5-VL-3Bを公開した。オンデバイスおよびエッジでの展開を想定して設計されている。31億パラメータのこのモデルは、思考の連鎖を生成せず直接回答する非推論型アーキテクチャを採用し、リアルタイムアプリケーション向けにレイテンシを低く抑えている。同社によると、2倍の規模のモデルに匹敵するビジョン性能を実現しつつ、CPUとGPUの双方でより小型の競合モデルより高速に動作するという。

水曜日に発表された今回のリリースは、10月のLFM2-VL-3Bを基に4つの改善を加えている。目玉は画面およびUI理解だ。インターフェース操作のベンチマークであるScreenSpot-v2で平均80.7を記録し、Gemma-4-E4Bの51.2やQwen 3.5 4Bの78.5を上回り、より大規模なInternVL-3.5-4Bに迫る。Liquidのビジョンラインでは初となるファンクションコーリングは、ToolSandboxベンチマークで26.4から59.5へと2倍以上に伸びた。自然言語で記述された物体の位置を特定し、バウンディングボックスを返す能力であるグラウンディングは、RefCOCOのrank one精度で57.1から87.9へ跳ね上がった。マルチイメージ推論も大幅に改善し、BLINKは50.2から61.5に、MUIRBenchは34.9から58.3に上昇した。

多言語理解、指示追従、視覚的な数学と科学、文書理解、検出、マルチイメージ、画面理解を網羅する28のベンチマークで、Liquidは平均69.4を報告している。これはInternVL-3.5-4Bと同等で、どちらも47億パラメータのモデルであるQwen3.5-4Bとは0.7ポイント差以内だ。このモデルは、物理世界に関する質問、幻覚耐性、物体グラウンディングを扱うRealWorldQA、POPE、RefCOCOに加え、文書、チャート、UI要素でも同サイズクラスでトップの成績を収めている。

このモデルを際立たせているのは効率性だ。チェックポイントは3.3GB未満のメモリで動作し、Apple M5 Maxでは毎秒228トークン、AMD Ryzen AI Max+ 395では毎秒116トークンをデコードする。サードパーティの報道によると、Galaxy S26 Ultraではスマートフォンレベルの毎秒約20トークンという結果が出ている。ネイティブ、GGUF、ONNX、MLXの各形式で提供され、llama.cpp、MLX、vLLMを提供初日からサポートする。WebGPUデモはウェブカメラのキャプチャを含め、ブラウザ内だけで完全に動作する。

If our reporting has earned your trust, consider helping us continue our work.

Become a supporter

性能向上の一部は学習方法に由来する。このモデルはLiquidの小型ビジョン版と同じアーキテクチャを採用し、LFM2.5-2.6BテキストバックボーンとSigLIP2 400Mビジョンエンコーダを組み合わせている。事前学習はおよそ34兆トークンで実行され、非ラテン文字をサポートするために語彙は2倍の128Kに拡大された。ビジョンの事前学習は、キャプション、OCR、グラウンディング、指示追従をカバーする厳選データと合成データを用いて4倍に拡張された。事後学習では、より大規模な教師モデルからの蒸留と同社のAntidoom手法を含む教師ありファインチューニングと、複数報酬の強化学習を組み合わせている。

このモデルはHugging FaceでLFM Open License v1.0のもと公開されており、年間売上高が1000万ドル未満であれば商用利用は無料だ。Liquidのプレイグラウンドでも試すことができる。2.6Bテキストモデルと長文脈CPU推論を狙ったエンコーダラインに続き、今月のLFM2.5ファミリーのリリースは今回が3つ目となる。MIT発のスタートアップである同社は、人々が実際に持ち歩くデバイス上で動作できるほど小型かつ効率的なファウンデーションモデルという、より大きなテーゼを推し進めている。

雅子 訳

Sources: LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge (Liquid AI, Aug 12, 2026); LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge (Hugging Face, Aug 12, 2026); Liquid AI Releases LFM2.5-VL-3B: A 3B Vision-Language Model That Reads Screens, Grounds Objects, and Calls Tools On-Device (MarkTechPost, Aug 13, 2026)

Scroll to Top