ツールの仕組み
- モデルは初回に Hugging Face から取得され、ブラウザにキャッシュされます。
- 推論は Web Worker 内で GPU を使って実行され、FastVLM.net は画像を受信しません。
- 利用統計は固定のステップ名、モデル、所要時間のみを記録し、内容は含みません。
ツール · 端末内で実行
各ツールは初回にオープンモデルを一度ダウンロードし、その後は WebGPU(記載がある場合は WebAssembly)で GPU 上で実行します。画像、ラベル、結果は端末内に残ります。
写真やスクリーンショットに質問し、文字を読み取り、グラフを説明。
1枚の画像から深度マップを生成して PNG で保存。
自分のラベルを入力し、画像に対してスコア順に並べます。学習不要。
CLIP 埋め込みで文章と画像の一致度をスコア化。
1枚の写真から近傍視点用の 3D Gaussian、または再照明可能なアセットへ。
モデル読み込み、最初のトークン、トークン/秒を計測して結果を共有。
各ツールは背後にある Apple モデルのページにリンクし、Python、MLX、ブラウザでの実行方法を掲載しています。
Apple モデルを見る