选择 FastVLM 的情况
- 仅高分辨率图像输入
- 无需厂商运行时的浏览器 Demo
- 以 Apple 为主的部署
FASTVLM VS GEMMA 4 / GEMMA 3N
Gemma 4(2026 年 4 月)与 Gemma 3n(2025)是 Google 面向手机和笔记本的通用多模态模型;FastVLM 是以视觉为先的模型。范围差异比任何分数都重要:Gemma 提供音频、长上下文与代理工具,FastVLM 专注于快速的高分辨率图像理解。
| 项目 | FastVLM | Gemma 4 (E2B / E4B) | Gemma 3n (E2B / E4B) |
|---|---|---|---|
| 开发方 · 发布 | Apple · 2025 | Google · 2026 年 4 月 2 日 | Google · 2025 |
| 端侧规模 | 0.5B · 1.5B · 7B | E2B · E4B(工作站还有 12B、26B-A4B、31B) | E2B · E4B(有效参数) |
| 模态 | 图像 + 文本 | 图像、视频帧、文本;E2B/E4B 支持音频 | 图像、音频、文本 |
| 上下文窗口 | 短提示;不是长上下文模型 | 128K token(E2B/E4B,Google) | 32K token(Google) |
| 浏览器 | 0.5B 通过 Transformers.js(本站) | 取决于运行时(LiteRT / MediaPipe 类部署) | 取决于运行时(Google AI Edge) |
| MLX / Apple Silicon | 官方 MLX 应用 | 社区 mlx-vlm 转换 | 社区 mlx-vlm 转换 |
| 许可 | Apple ML Research 许可 | Gemma 使用条款 | Gemma 使用条款 |
核对于 2026-09-17
Gemma 的规模是“有效”参数量(E2B 约等于 2.3B 稠密模型的内存占用),其多模态基准使用 Google 的评测框架;FastVLM 的数字来自 Apple。本表记录的是有据可查的能力,而非实测质量。
请查看当前 Transformers.js 的模型列表;Google 面向浏览器和手机的参考路径是自家的 AI Edge 运行时。FastVLM-0.5B 已有可在本站试用的 ONNX 版本。