FastVLM-0.5B
适合 WebGPU、浏览器 Demo 和资源受限的端侧设备。
浏览器 · 移动设备 · 边缘端
查看模型从这里开始
打开内嵌 FastVLM Demo,在准备好后授权摄像头,通过 Transformers.js 与 WebGPU 运行 0.5B 模型。原有 Demo 完整保留在独立体验页中。
理解 FastVLM
FastVLM 是 Apple 研究人员推出的开放视觉语言模型。其 FastViTHD 混合视觉编码器可减少视觉 Token 和编码延迟,改善高分辨率图像与端侧运行中的准确率—延迟权衡。
官方结果
数据来自 Apple 的 Hugging Face 模型卡。分数越高越好;不同基准的协议不同,应在同一行内比较。
| 基准 | 0.5B | 1.5B | 7B |
|---|---|---|---|
| AI2D | 68.0 | 77.4 | 83.6 |
| ScienceQA | 85.2 | 94.4 | 96.7 |
| MMMU | 33.9 | 37.8 | 45.4 |
| ChartQA | 76.0 | 80.1 | 85.0 |
| TextVQA | 64.5 | 70.4 | 74.9 |
| DocVQA | 82.5 | 88.3 | 93.2 |
灵活部署
无需安装本地运行时,直接体验 0.5B WebGPU Demo。
打开 Playground加载 Hugging Face 官方 checkpoint 进行本地推理。
Python 指南使用 MLX 等面向 Apple Silicon 的官方资源。
Mac 指南了解 Apple 官方 iOS/macOS Demo 与 Core ML 资源。
iPhone 指南热门指南
明确权衡
了解不同规模在准确率和资源占用上的取舍,并查看带有原始来源限定的 LLaVA-OneVision 对比。
常见问题
可以。页面中的 FastVLM-0.5B Demo 使用 Transformers.js 与 WebGPU,在兼容浏览器中直接执行推理。首次下载模型和编译需要一些时间。
浏览器和资源受限设备选择 0.5B;均衡的本地配置选择 1.5B;更重视公开基准质量时选择 7B。
不是。FastVLM.net 是独立开发者资源。本站会持续链接 Apple Research、官方 GitHub 与 Hugging Face 页面作为一手来源。
不是。FastVLM 支持端侧部署,但隐私和数据流取决于你选择的运行时与应用。WebGPU Playground 旨在浏览器内执行推理。
一手资料