Skip to content

端侧 VLM 中心

可在端侧运行的小型视觉语言模型

视觉语言模型能回答关于图像的问题。下列模型足够小,可以运行在笔记本、手机或支持 WebGPU 的浏览器中。先用表格筛选,再打开与 FastVLM 的一对一对比。

模型开发方规模图像视频多图浏览器MLX许可适合
FastVLM2025Apple0.5B · 1.5B · 7BApple AMLR高分辨率图像下的低首 Token 延迟;浏览器与 Apple Silicon
SmolVLM22025Hugging Face256M · 500M · 2.2B部分规模Apache 2.0带视频理解的超小模型;宽松许可
LFM2.5-VL2026Liquid AI450M · 3BLFM Open License端侧的目标定位、屏幕、文档与工具调用
Gemma 42026GoogleE2B · E4B · 12B · 26B-A4B · 31B取决于运行时Gemma Terms广泛多模态(图像、视频帧、E2B/E4B 的音频)与代理式用途
Gemma 3n2025GoogleE2B · E4B取决于运行时Gemma Terms面向手机、支持音频输入与逐层嵌入的模型
Qwen3-VL2025Alibaba2B · 4B · 8B (small)部分规模Apache 2.0小型稠密模型中出色的 OCR、文档与视频能力
Moondream2024–2025Moondream2B · 3 (9B MoE, 2B active)部分规模Apache 2.0 / BSL小体积下的指点、检测与描述
MiniCPM-V2025OpenBMB4.5 (8B)Apache 2.0 code · MiniCPM weights笔记本上的高分辨率图像与视频理解
PaliGemma 22024Google3B · 10B · 28BGemma Terms用于检测、分割与描述微调的基座

“浏览器”表示至少一个规模有维护中的 WebGPU/Transformers.js 或 ONNX 版本。“取决于运行时”的模型通过 MediaPipe、LiteRT 等厂商运行时运行,而非 Transformers.js。

数据于 2026-09-17 按官方模型卡与公告核对。发现过期信息可通过本站 GitHub 反馈。

如何选择

  1. 先看任务:OCR 与文档需要更高输入分辨率;视频需要在帧上训练过的模型;目标定位需要输出格式支持框。
  2. 再看运行时:浏览器 Demo 需要 ONNX 权重;iPhone 应用需要 MLX 或 Core ML;Linux 服务器则没有限制。
  3. 然后看许可:Apache 2.0 模型最容易发布;Apple AMLR 与 Gemma 条款有必须阅读的条件。
  4. 最后在自己的设备上测量——公开基准的协议各不相同,不能跨厂商直接比较。