这些工具如何工作
- 模型首次使用时从 Hugging Face 获取,并由浏览器缓存。
- 推理在 Web Worker 中调用你的 GPU;FastVLM.net 不会收到你的图片。
- 使用统计只记录固定的步骤名、模型和耗时,不包含任何内容。
工具 · 在你的设备上运行
每个工具首次使用时下载一次开放模型,然后通过 WebGPU(或标注的 WebAssembly)在你的 GPU 上运行。图片、标签与结果都留在本机。
对照片或截图提问、提取文字、解释图表。
把一张图片转换成深度图并下载 PNG。
输入自定义标签,对图片打分排序,无需训练。
用 CLIP 向量计算句子与图片的匹配程度。
把一张照片变成可看邻近视角的 3D Gaussian,或可重打光的 3D 资产。
测量模型加载、首 Token 和每秒 Token 数,并分享结果。
每个工具都链接到背后的 Apple 模型页面,包含 Python、MLX 与浏览器运行说明。
浏览 Apple 模型