FastVLM-0.5B
WebGPU、ブラウザデモ、リソースの限られたエッジ端末に最適。
ブラウザ · モバイル · エッジ
モデルを見るPLAYGROUND · モデル · デプロイ
WebGPU によるリアルタイムの視覚言語推論を試し、FastVLM-0.5B・1.5B・7B を比較。ブラウザ、Python、Mac、iPhone 向けの実践的な導入ガイドを確認できます。
FastVLM が見ているものを確認
ここから開始
埋め込み FastVLM デモを開き、準備ができたらカメラを許可して、Transformers.js と WebGPU で 0.5B モデルを実行できます。従来のデモは専用ページにそのまま保持しています。
モデルを選ぶ
ブラウザとエッジ用途は 0.5B、バランス重視なら 1.5B、公開ベンチマークの品質を優先するなら 7B が出発点です。
FastVLM の仕組み
FastVLM は Apple の研究者が公開した視覚言語モデルです。ハイブリッド視覚エンコーダ FastViTHD が視覚トークンとエンコード遅延を減らし、高解像度画像とオンデバイス用途の精度—遅延トレードオフを改善します。
公式結果
Apple の Hugging Face モデルカードで公開された評価値です。高いほど良い値ですが、比較は同じ行の中で行ってください。
| ベンチマーク | 0.5B | 1.5B | 7B |
|---|---|---|---|
| AI2D | 68.0 | 77.4 | 83.6 |
| ScienceQA | 85.2 | 94.4 | 96.7 |
| MMMU | 33.9 | 37.8 | 45.4 |
| ChartQA | 76.0 | 80.1 | 85.0 |
| TextVQA | 64.5 | 70.4 | 74.9 |
| DocVQA | 82.5 | 88.3 | 93.2 |
柔軟なデプロイ
ローカルランタイムを入れずに 0.5B WebGPU デモを試せます。
Playground を開く公式 Hugging Face チェックポイントでローカル推論。
Python ガイドMLX など Apple Silicon 向け公式リソースを活用。
Mac ガイドApple 公式 iOS/macOS デモと Core ML リソースを確認。
iPhone ガイド人気ガイド
トレードオフを明確に
モデルサイズごとの精度とリソースの違い、出典条件を明記した LLaVA-OneVision との比較を確認できます。
FAQ
はい。FastVLM-0.5B デモは Transformers.js と WebGPU を使用し、対応ブラウザ内で推論します。初回のモデル取得とコンパイルには時間がかかる場合があります。
ブラウザと制約のある端末は 0.5B、バランスの取れたローカル構成は 1.5B、公開ベンチマーク品質を優先する場合は 7B が適しています。
いいえ。FastVLM.net は独立した開発者向けリソースです。Apple Research、公式 GitHub、Hugging Face を一次情報としてリンクしています。
いいえ。FastVLM はオンデバイス展開に対応しますが、プライバシーとデータフローは選択したランタイムやアプリに依存します。WebGPU Playground はブラウザ内推論向けです。
一次情報