Skip to content

PLAYGROUND · モデル · デプロイ

ブラウザで FastVLM を実行

WebGPU によるリアルタイムの視覚言語推論を試し、FastVLM-0.5B・1.5B・7B を比較。ブラウザ、Python、Mac、iPhone 向けの実践的な導入ガイドを確認できます。

  • ブラウザ内で実行
  • WebGPU アクセラレーション
  • FastVLM-0.5B
LIVE PLAYGROUND WebGPU ready
FastVLM-0.5B

FastVLM が見ているものを確認

prompt › カメラの前で起きていることを説明してください。
FastVLM FastVLM がブラウザ内で映像を処理し、リアルタイムに説明を生成します。
FastViTHDTransformers.jsWebGPUMLXCore ML

ここから開始

実際に動く FastVLM WebGPU Playground

埋め込み FastVLM デモを開き、準備ができたらカメラを許可して、Transformers.js と WebGPU で 0.5B モデルを実行できます。従来のデモは専用ページにそのまま保持しています。

apple/FastVLM-0.5BWebGPU

モデルを選ぶ

3つのモデルサイズ、1つの効率的な視覚エンコーダ

ブラウザとエッジ用途は 0.5B、バランス重視なら 1.5B、公開ベンチマークの品質を優先するなら 7B が出発点です。

最速

FastVLM-0.5B

WebGPU、ブラウザデモ、リソースの限られたエッジ端末に最適。

ブラウザ · モバイル · エッジ

モデルを見る
バランス

FastVLM-1.5B

ローカル開発と Apple Silicon に適した中間モデル。

Mac · ワークステーション

モデルを見る
最高品質

FastVLM-7B

公開評価表で最も高い総合スコアを持つ公式モデル。

デスクトップ · ネイティブ

モデルを見る

FastVLM の仕組み

高解像度画像を、通常より少ないトークンコストで

FastVLM は Apple の研究者が公開した視覚言語モデルです。ハイブリッド視覚エンコーダ FastViTHD が視覚トークンとエンコード遅延を減らし、高解像度画像とオンデバイス用途の精度—遅延トレードオフを改善します。

Apple-reported comparison Apple が報告した最高解像度での比較では、FastVLM-0.5B は LLaVA-OneVision-0.5B に対して TTFT を最大 85 倍改善し、視覚エンコーダは 3.4 倍小型でした。
画像
FastViTHD
視覚トークン
LLM
応答

公式結果

FastVLM ベンチマーク概要

Apple の Hugging Face モデルカードで公開された評価値です。高いほど良い値ですが、比較は同じ行の中で行ってください。

全ベンチマークを見る
ベンチマーク0.5B1.5B7B
AI2D68.077.483.6
ScienceQA85.294.496.7
MMMU33.937.845.4
ChartQA76.080.185.0
TextVQA64.570.474.9
DocVQA82.588.393.2
出典:Apple FastVLM モデルカード Hugging Face

柔軟なデプロイ

アプリケーションに合った場所で FastVLM を実行

ブラウザ

ローカルランタイムを入れずに 0.5B WebGPU デモを試せます。

Playground を開く

Python

公式 Hugging Face チェックポイントでローカル推論。

Python ガイド

Mac

MLX など Apple Silicon 向け公式リソースを活用。

Mac ガイド

iPhone

Apple 公式 iOS/macOS デモと Core ML リソースを確認。

iPhone ガイド

トレードオフを明確に

デプロイ前に FastVLM を比較

モデルサイズごとの精度とリソースの違い、出典条件を明記した LLaVA-OneVision との比較を確認できます。

FAQ

FastVLM のよくある質問

FastVLM は本当にブラウザで動きますか?

はい。FastVLM-0.5B デモは Transformers.js と WebGPU を使用し、対応ブラウザ内で推論します。初回のモデル取得とコンパイルには時間がかかる場合があります。

どの FastVLM モデルから始めるべきですか?

ブラウザと制約のある端末は 0.5B、バランスの取れたローカル構成は 1.5B、公開ベンチマーク品質を優先する場合は 7B が適しています。

FastVLM.net は Apple の公式サイトですか?

いいえ。FastVLM.net は独立した開発者向けリソースです。Apple Research、公式 GitHub、Hugging Face を一次情報としてリンクしています。

すべての FastVLM 実行方法が完全オンデバイスですか?

いいえ。FastVLM はオンデバイス展開に対応しますが、プライバシーとデータフローは選択したランタイムやアプリに依存します。WebGPU Playground はブラウザ内推論向けです。

一次情報

FastVLM の公式リソースを確認