Skip to content

在线体验 · 模型 · 部署

在浏览器中运行 FastVLM

用 WebGPU 体验实时视觉语言推理,对比 FastVLM-0.5B、1.5B 与 7B,并查看浏览器、Python、Mac 和 iPhone 的实用部署指南。

  • 浏览器内运行
  • WebGPU 加速
  • FastVLM-0.5B
实时 PLAYGROUND WebGPU 已就绪
FastVLM-0.5B

看看 FastVLM 看到了什么

prompt › 描述摄像头前正在发生的事情。
FastVLM FastVLM 在浏览器中处理视觉流,并实时生成描述。
FastViTHDTransformers.jsWebGPUMLXCore ML

从这里开始

真正的 FastVLM WebGPU Playground

打开内嵌 FastVLM Demo,在准备好后授权摄像头,通过 Transformers.js 与 WebGPU 运行 0.5B 模型。原有 Demo 完整保留在独立体验页中。

apple/FastVLM-0.5BWebGPU

选择模型

三种模型规模,共用高效视觉编码器

浏览器和端侧实验优先从 0.5B 开始;1.5B 提供更均衡的能力;重视基准质量时选择 7B。

速度最快

FastVLM-0.5B

适合 WebGPU、浏览器 Demo 和资源受限的端侧设备。

浏览器 · 移动设备 · 边缘端

查看模型
均衡之选

FastVLM-1.5B

适合本地开发和 Apple Silicon 的实用中间档。

Mac · 工作站

查看模型
质量最佳

FastVLM-7B

在官方公开评测表中整体得分最高的版本。

桌面端 · 原生部署

查看模型

理解 FastVLM

以更低 Token 成本理解高分辨率图像

FastVLM 是 Apple 研究人员推出的开放视觉语言模型。其 FastViTHD 混合视觉编码器可减少视觉 Token 和编码延迟,改善高分辨率图像与端侧运行中的准确率—延迟权衡。

Apple-reported comparison 在 Apple 公布的最高分辨率对比条件下,FastVLM-0.5B 相比 LLaVA-OneVision-0.5B 的首 Token 时间最高改善 85 倍,同时视觉编码器小 3.4 倍。
图像
FastViTHD
视觉 Token
语言模型
回答

官方结果

FastVLM 基准测试速览

数据来自 Apple 的 Hugging Face 模型卡。分数越高越好;不同基准的协议不同,应在同一行内比较。

查看完整基准
基准0.5B1.5B7B
AI2D68.077.483.6
ScienceQA85.294.496.7
MMMU33.937.845.4
ChartQA76.080.185.0
TextVQA64.570.474.9
DocVQA82.588.393.2
来源:Apple FastVLM 模型卡 Hugging Face

灵活部署

让 FastVLM 运行在应用所在的位置

浏览器

无需安装本地运行时,直接体验 0.5B WebGPU Demo。

打开 Playground

Python

加载 Hugging Face 官方 checkpoint 进行本地推理。

Python 指南

Mac

使用 MLX 等面向 Apple Silicon 的官方资源。

Mac 指南

iPhone

了解 Apple 官方 iOS/macOS Demo 与 Core ML 资源。

iPhone 指南

明确权衡

部署前先对比 FastVLM

了解不同规模在准确率和资源占用上的取舍,并查看带有原始来源限定的 LLaVA-OneVision 对比。

常见问题

FastVLM 常见问题

FastVLM 真的能在浏览器运行吗?

可以。页面中的 FastVLM-0.5B Demo 使用 Transformers.js 与 WebGPU,在兼容浏览器中直接执行推理。首次下载模型和编译需要一些时间。

应该从哪个 FastVLM 模型开始?

浏览器和资源受限设备选择 0.5B;均衡的本地配置选择 1.5B;更重视公开基准质量时选择 7B。

FastVLM.net 是 Apple 官方网站吗?

不是。FastVLM.net 是独立开发者资源。本站会持续链接 Apple Research、官方 GitHub 与 Hugging Face 页面作为一手来源。

所有 FastVLM 运行方式都是完全端侧的吗?

不是。FastVLM 支持端侧部署,但隐私和数据流取决于你选择的运行时与应用。WebGPU Playground 旨在浏览器内执行推理。

一手资料

继续查看 FastVLM 官方资源