浏览器 AI 基准 · FASTVLM-0.5B
测试你的设备
看看真实的视觉语言模型在你的硬件上跑得多快。测试只下载一次 FastVLM-0.5B,用固定的图片和问题运行两次,并报告热运行结果:加载时间、首 Token 和解码速度。除了你选择分享的数字,没有任何内容离开设备。
你的设备
浏览器
—
操作系统
—
GPU 适配器
正在检测…
WebGPU
正在检测…
shader-f16
正在检测…
浏览器报告内存
—
方法:通过 Transformers.js 与 WebGPU 运行 FastVLM-0.5B ONNX(q4,fp16 嵌入);固定的 1024 像素收据样例与提示词;一次预热、一次测量;tokens/s = 生成 Token 数 ÷(图片→回答 − 首 Token)。数值受 GPU、驱动、浏览器和其他标签页影响。
图片和回答留在本机。使用统计记录步骤名与耗时;GPU 名称与分享文本只包含在你复制的链接里。
这个数字意味着什么
- 低于 10 tokens/s:改用 Python、MLX 或 Core ML 运行 FastVLM,或选择 SmolVLM-256M 等更小模型。
- 10–60 tokens/s:单图问答没问题,每次回答需要几秒。
- 高于 60 tokens/s:交互使用很流畅;可以尝试原生运行 1.5B 以获得更好的准确率。较新的 Apple Silicon Mac 通常远高于 100。