端侧 VLM 中心
可在端侧运行的小型视觉语言模型
视觉语言模型能回答关于图像的问题。下列模型足够小,可以运行在笔记本、手机或支持 WebGPU 的浏览器中。先用表格筛选,再打开与 FastVLM 的一对一对比。
| 模型 | 开发方 | 规模 | 图像 | 视频 | 多图 | 浏览器 | MLX | 许可 | 适合 |
|---|---|---|---|---|---|---|---|---|---|
| FastVLM2025 | Apple | 0.5B · 1.5B · 7B | 是 | Apple AMLR | 高分辨率图像下的低首 Token 延迟;浏览器与 Apple Silicon | ||||
| SmolVLM22025 | Hugging Face | 256M · 500M · 2.2B | 部分规模 | Apache 2.0 | 带视频理解的超小模型;宽松许可 | ||||
| LFM2.5-VL2026 | Liquid AI | 450M · 3B | 是 | LFM Open License | 端侧的目标定位、屏幕、文档与工具调用 | ||||
| Gemma 42026 | E2B · E4B · 12B · 26B-A4B · 31B | 取决于运行时 | Gemma Terms | 广泛多模态(图像、视频帧、E2B/E4B 的音频)与代理式用途 | |||||
| Gemma 3n2025 | E2B · E4B | 取决于运行时 | Gemma Terms | 面向手机、支持音频输入与逐层嵌入的模型 | |||||
| Qwen3-VL2025 | Alibaba | 2B · 4B · 8B (small) | 部分规模 | Apache 2.0 | 小型稠密模型中出色的 OCR、文档与视频能力 | ||||
| Moondream2024–2025 | Moondream | 2B · 3 (9B MoE, 2B active) | 部分规模 | Apache 2.0 / BSL | 小体积下的指点、检测与描述 | ||||
| MiniCPM-V2025 | OpenBMB | 4.5 (8B) | 否 | Apache 2.0 code · MiniCPM weights | 笔记本上的高分辨率图像与视频理解 | ||||
| PaliGemma 22024 | 3B · 10B · 28B | 否 | Gemma Terms | 用于检测、分割与描述微调的基座 |
“浏览器”表示至少一个规模有维护中的 WebGPU/Transformers.js 或 ONNX 版本。“取决于运行时”的模型通过 MediaPipe、LiteRT 等厂商运行时运行,而非 Transformers.js。
数据于 2026-09-17 按官方模型卡与公告核对。发现过期信息可通过本站 GitHub 反馈。
与 FastVLM 一对一对比
在你的设备上测试 FastVLM如何选择
- 先看任务:OCR 与文档需要更高输入分辨率;视频需要在帧上训练过的模型;目标定位需要输出格式支持框。
- 再看运行时:浏览器 Demo 需要 ONNX 权重;iPhone 应用需要 MLX 或 Core ML;Linux 服务器则没有限制。
- 然后看许可:Apache 2.0 模型最容易发布;Apple AMLR 与 Gemma 条款有必须阅读的条件。
- 最后在自己的设备上测量——公开基准的协议各不相同,不能跨厂商直接比较。