Liquid AI 发布 3B 视觉语言模型,以屏幕理解和快速 CPU 推理瞄准边缘设备

Liquid AI 发布了迄今能力最强的视觉语言模型 LFM2.5-VL-3B,专为端侧与边缘部署而设计。这款拥有 31 亿参数的模型采用非推理架构,直接给出答案而不生成思维链,从而为实时应用保持低延迟。该公司表示,其视觉性能可与尺寸两倍于它的模型竞争,同时在 CPU 和 GPU 上的运行速度快于更小的同类产品。

此次发布于周三宣布,在去年 10 月的 LFM2-VL-3B 基础之上带来四项改进。屏幕与界面理解是旗舰能力:该模型在界面导航基准 ScreenSpot-v2 上平均得分 80.7,领先 Gemma-4-E4B 的 51.2 和 Qwen 3.5 4B 的 78.5,并紧追规模更大的 InternVL-3.5-4B。函数调用是 Liquid 视觉产品线新增的能力,在 ToolSandbox 基准上的得分从 26.4 提升至 59.5,翻了一倍多。定位能力,即根据自然语言描述找到物体并返回边界框的能力,在 RefCOCO 首位精度上从 57.1 跃升至 87.9。多图像推理也大幅改善,BLINK 从 50.2 升至 61.5,MUIRBench 从 34.9 升至 58.3。

在覆盖多语言理解、指令跟随、视觉数学与科学、文档理解、检测、多图像和屏幕理解等 28 项基准上,Liquid 报告的平均得分为 69.4,与 InternVL-3.5-4B 持平,与 Qwen3.5-4B 仅差 0.7 分,这两款模型均拥有 47 亿参数。该模型在 RealWorldQA、POPE 和 RefCOCO 上领先同尺寸级别,这些基准涵盖物理世界问答、幻觉抵抗、物体定位,以及文档、图表和 UI 元素。

效率是这款模型的独特卖点。该检查点运行时占用内存低于 3.3GB,在 Apple M5 Max 上每秒可解码 228 个 token,在 AMD Ryzen AI Max+ 395 上每秒 116 个 token,第三方报道称在 Galaxy S26 Ultra 上达到了约每秒 20 个 token 的手机级结果。模型提供原生、GGUF、ONNX 和 MLX 格式,发布首日即支持 llama.cpp、MLX 和 vLLM,WebGPU 演示可完全在浏览器中运行,包括摄像头捕捉功能。

Our mission is simple: reliable news backed by careful research. Help us continue that mission.

支持 1ban.news

训练细节解释了部分性能提升的来源。该模型采用与 Liquid 较小视觉版本相同的架构,将 LFM2.5-2.6B 文本骨干与 SigLIP2 400M 视觉编码器配对。预训练使用了约 34 万亿个 token,词表扩大一倍至 128K 以支持非拉丁文字,视觉预训练规模扩大四倍,使用涵盖字幕、OCR、定位和指令跟随的精选数据与合成数据。训练后阶段将监督微调(包括从更大教师模型蒸馏以及该公司自研的 Antidoom 技术)与多奖励强化学习相结合。

该模型以 LFM Open License v1.0 许可在 Hugging Face 上提供,年收入低于 1000 万美元的商业使用免费,并可在 Liquid 的演示平台试用。这是本月 LFM2.5 家族的第三次重大发布,此前已推出 2.6B 文本模型和面向长上下文 CPU 推理的编码器系列。这家诞生于 MIT 的初创公司正在推动一个更宏大的理念:让基础模型足够小、足够高效,能够运行在人们随身携带的设备上。

婷 翻译

Sources: LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge (Liquid AI, Aug 12, 2026); LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge (Hugging Face, Aug 12, 2026); Liquid AI Releases LFM2.5-VL-3B: A 3B Vision-Language Model That Reads Screens, Grounds Objects, and Calls Tools On-Device (MarkTechPost, Aug 13, 2026)

Scroll to Top