Skip to content

浏览器 AI 基准 · FASTVLM-0.5B

测试你的设备

看看真实的视觉语言模型在你的硬件上跑得多快。测试只下载一次 FastVLM-0.5B,用固定的图片和问题运行两次,并报告热运行结果:加载时间、首 Token 和解码速度。除了你选择分享的数字,没有任何内容离开设备。

你的设备

浏览器

操作系统

GPU 适配器

正在检测…

WebGPU

正在检测…

shader-f16

正在检测…

浏览器报告内存

方法:通过 Transformers.js 与 WebGPU 运行 FastVLM-0.5B ONNX(q4,fp16 嵌入);固定的 1024 像素收据样例与提示词;一次预热、一次测量;tokens/s = 生成 Token 数 ÷(图片→回答 − 首 Token)。数值受 GPU、驱动、浏览器和其他标签页影响。

图片和回答留在本机。使用统计记录步骤名与耗时;GPU 名称与分享文本只包含在你复制的链接里。

这个数字意味着什么

  • 低于 10 tokens/s:改用 Python、MLX 或 Core ML 运行 FastVLM,或选择 SmolVLM-256M 等更小模型。
  • 10–60 tokens/s:单图问答没问题,每次回答需要几秒。
  • 高于 60 tokens/s:交互使用很流畅;可以尝试原生运行 1.5B 以获得更好的准确率。较新的 Apple Silicon Mac 通常远高于 100。