Skip to content

FASTVLM VS LFM2.5-VL

FastVLM vs LFM2.5-VL

LFM2.5-VL 是 Liquid AI 2026 年的边缘视觉系列:4 月发布的 450M 模型与 8 月发布的 3B 模型,后者新增目标定位、屏幕理解与函数调用。FastVLM 是 Apple 2025 年围绕编码器效率构建的系列。以下是双方的官方记录。

全部对比
项目FastVLMLFM2.5-VL
开发方Apple 研究人员Liquid AI
规模与发布0.5B · 1.5B · 7B(2025)450M(2026-04-08)· 3B = 2.6B 语言模型 + SigLIP2 400M NaFlex(2026-08-12)
目标定位(框)非官方记录的功能支持——RefCOCO-avg 87.9(3B)、RefCOCO-M 81.28(450M),Liquid 报告
屏幕 / 界面理解文档/OCR 分数较高;未公布 ScreenSpot 数据ScreenSpot-v2 桌面 78.7 · 移动 81.2 · 网页 82.2(3B,Liquid 报告)
函数 / 工具调用非官方记录的功能
多图官方示例为单图
浏览器(WebGPU)0.5B ONNX(本站)LFM2.5-VL-3B-ONNX 与官方 WebGPU Space
运行时Transformers · MLX(官方应用)· Core ML · Transformers.jsllama.cpp · MLX · vLLM · SGLang · ONNX · LEAP(发布当天,Liquid 声明)
官方端侧速度1152 像素下 TTFT 比 LLaVA-OneVision-0.5B 最高快 85 倍;未公布 tokens/s3B:M5 Max 228 tok/s,Galaxy S26 Ultra 20 tok/s,约 3 GB 内存(Liquid)
许可Apple ML Research 许可LFM Open License(以模型卡当前版本为准)

核对于 2026-09-17

选择摘要

  • LFM2.5-VL 记录了更多能力——框、工具调用、多图、GGUF——更适合代理式边缘应用。
  • FastVLM 仍是高分辨率下编码器效率的参考,并拥有最紧密的 Apple 平台集成(MLX 应用、Core ML 资源)。
  • 两者都有浏览器版本;3B 的 LFM 模型需要约为 FastVLM-0.5B 三倍的内存。

选择 FastVLM 的情况

  • 需要最小的高分辨率模型用于浏览器或 iPhone Demo
  • 流水线基于 Apple 硬件上的 MLX 或 Core ML
  • 优化目标是大图上的首 Token 延迟

选择 LFM2.5-VL 的情况

  • 需要边界框、界面定位或函数调用
  • 通过 llama.cpp/GGUF 在 Android、Windows 与 Linux 上发布
  • 希望以 Liquid 公布的吞吐数据作为起点

如何阅读这张表

上述所有数字都是厂商在自家硬件与评测框架上的报告。FastVLM 的 85 倍是特定分辨率下的 TTFT 比值;Liquid 的 tokens/s 是特定设备上的解码速率。两者都不是通用排名。

常见问题

FastVLM 支持边界框吗?

Apple 的模型卡没有记录定位输出。你可以让它用文字描述位置,但没有像 LFM2.5-VL 那样经过评测的框格式。

哪个能在 Android 运行?

LFM2.5-VL 提供 llama.cpp 的 GGUF,Liquid 也公布了手机数据。FastVLM 没有官方 Android 路径;社区可能有 GGUF 或 ONNX 移植,但本页不涉及。