Skip to content

FASTVLM-0.5B · TRANSFORMERS.JS · WEBGPU

FastVLM Playground

对照片或截图提问、提取文字、解释图表。FastVLM 在你的设备上运行,支持导出回答与实测耗时。

浏览器内推理 图片与摄像头 无需本地安装

FASTVLM · IMAGE PLAYGROUND

用你自己的图片提问

上传照片、粘贴截图,或先试一个样例。FastVLM-0.5B 在你的设备上运行。

正在检查浏览器兼容性,不会下载模型…

JPEG、PNG 或 WebP · 最大 10 MB · Ctrl/Cmd+V 粘贴

首次运行会从 Hugging Face 下载约 1.1 GB 模型文件,后续可复用浏览器缓存。准备好后再开始。

通过 Python 本地运行 →

回答

回答与本机实测耗时会显示在这里。

图片最长边会缩小至 1024 像素。模型生成的答案可能有误。

图片、问题和答案保留在本机。使用统计记录操作步骤、样例/上传/粘贴类型、错误类型和耗时。

onnx-community/FastVLM-0.5B-ONNX
图片问答

浏览器要求

  • 优先使用已启用 WebGPU 的最新版桌面 Chrome 或 Edge。
  • 需要支持 WebGPU 的 GPU,并为模型和浏览器标签页预留足够内存。
  • 只有实时摄像头输入需要摄像头权限,请在内嵌 Demo 请求时授权。
  • 首次模型下载明显慢于后续运行,具体时间取决于网络连接。

这个 Demo 使用什么模型?

浏览器 Playground 使用 FastVLM-0.5B,也就是最小的 FastVLM 版本。Apple 官方研究页面也链接了这个基于 Transformers.js + WebGPU 的实时体验。

Apple Research

隐私与数据流

模型推理设计为在浏览器内完成,FastVLM.net 不接收摄像头画面。内嵌 Hugging Face 应用和浏览器仍会处理常规请求、模型下载与权限;完整细节请查阅对应服务的政策。

故障排查

Demo 一直空白

等待 iframe 和模型资源加载,或尝试直接打开 Demo;必要时为内嵌应用关闭严格的内容拦截。

WebGPU 不可用

更新 Chrome 或 Edge,确认硬件加速已开启,并检查 GPU 是否被浏览器列入阻止列表。

摄像头无法启动

同时允许 fastvlm.net 与内嵌 Hugging Face 应用使用摄像头,然后刷新页面。

首次运行很慢

模型权重下载和 WebGPU shader 编译期间出现等待是正常的;浏览器缓存可让后续访问更快。

查看 Playground 实际效果

这是一段 FastVLM 摄像头体验录像。打开上方的摄像头体验即可亲自尝试。

继续使用 FastVLM 开发

对比模型规模,或从浏览器 Playground 转向可复现的 Transformers 工作流。