选择 FastVLM 的情况
- 需要最小的高分辨率模型用于浏览器或 iPhone Demo
- 流水线基于 Apple 硬件上的 MLX 或 Core ML
- 优化目标是大图上的首 Token 延迟
FASTVLM VS LFM2.5-VL
LFM2.5-VL 是 Liquid AI 2026 年的边缘视觉系列:4 月发布的 450M 模型与 8 月发布的 3B 模型,后者新增目标定位、屏幕理解与函数调用。FastVLM 是 Apple 2025 年围绕编码器效率构建的系列。以下是双方的官方记录。
| 项目 | FastVLM | LFM2.5-VL |
|---|---|---|
| 开发方 | Apple 研究人员 | Liquid AI |
| 规模与发布 | 0.5B · 1.5B · 7B(2025) | 450M(2026-04-08)· 3B = 2.6B 语言模型 + SigLIP2 400M NaFlex(2026-08-12) |
| 目标定位(框) | 非官方记录的功能 | 支持——RefCOCO-avg 87.9(3B)、RefCOCO-M 81.28(450M),Liquid 报告 |
| 屏幕 / 界面理解 | 文档/OCR 分数较高;未公布 ScreenSpot 数据 | ScreenSpot-v2 桌面 78.7 · 移动 81.2 · 网页 82.2(3B,Liquid 报告) |
| 函数 / 工具调用 | 非官方记录的功能 | 是 |
| 多图 | 官方示例为单图 | 是 |
| 浏览器(WebGPU) | 0.5B ONNX(本站) | LFM2.5-VL-3B-ONNX 与官方 WebGPU Space |
| 运行时 | Transformers · MLX(官方应用)· Core ML · Transformers.js | llama.cpp · MLX · vLLM · SGLang · ONNX · LEAP(发布当天,Liquid 声明) |
| 官方端侧速度 | 1152 像素下 TTFT 比 LLaVA-OneVision-0.5B 最高快 85 倍;未公布 tokens/s | 3B:M5 Max 228 tok/s,Galaxy S26 Ultra 20 tok/s,约 3 GB 内存(Liquid) |
| 许可 | Apple ML Research 许可 | LFM Open License(以模型卡当前版本为准) |
核对于 2026-09-17
上述所有数字都是厂商在自家硬件与评测框架上的报告。FastVLM 的 85 倍是特定分辨率下的 TTFT 比值;Liquid 的 tokens/s 是特定设备上的解码速率。两者都不是通用排名。
Apple 的模型卡没有记录定位输出。你可以让它用文字描述位置,但没有像 LFM2.5-VL 那样经过评测的框格式。
LFM2.5-VL 提供 llama.cpp 的 GGUF,Liquid 也公布了手机数据。FastVLM 没有官方 Android 路径;社区可能有 GGUF 或 ONNX 移植,但本页不涉及。