FastVLM を選ぶ場合
- 高解像度の画像のみの入力
- ベンダーランタイム不要のブラウザデモ
- Apple 優先の導入
FASTVLM VS GEMMA 4 / GEMMA 3N
Gemma 4(2026年4月)と Gemma 3n(2025年)は Google のスマートフォン・ノート PC 向け汎用マルチモーダルモデルで、FastVLM は視覚優先のモデルです。スコアよりも範囲の違いが重要で、Gemma は音声、長いコンテキスト、エージェントツールに対応し、FastVLM は高速な高解像度画像理解に集中しています。
| 項目 | FastVLM | Gemma 4 (E2B / E4B) | Gemma 3n (E2B / E4B) |
|---|---|---|---|
| 開発元 · 公開 | Apple · 2025年 | Google · 2026年4月2日 | Google · 2025年 |
| オンデバイスサイズ | 0.5B · 1.5B · 7B | E2B · E4B(ワークステーション向けに 12B、26B-A4B、31B) | E2B · E4B(実効パラメータ) |
| モダリティ | 画像 + テキスト | 画像、フレームとしての動画、テキスト。E2B/E4B は音声も | 画像、音声、テキスト |
| コンテキスト長 | 短いプロンプト向け。長文脈モデルではない | 128K トークン(E2B/E4B、Google) | 32K トークン(Google) |
| ブラウザ | 0.5B は Transformers.js(本サイト) | ランタイム依存(LiteRT / MediaPipe 系の導入) | ランタイム依存(Google AI Edge) |
| MLX / Apple Silicon | 公式 MLX アプリ | コミュニティの mlx-vlm 変換 | コミュニティの mlx-vlm 変換 |
| ライセンス | Apple ML Research ライセンス | Gemma 利用規約 | Gemma 利用規約 |
確認日 2026-09-17
Gemma のサイズは「実効」パラメータ数(E2B は密な 2.3B 相当のメモリ)で、マルチモーダルベンチマークは Google の環境、FastVLM の数値は Apple の環境によるものです。表は文書化された機能を記録しており、計測した品質ではありません。
現行の Transformers.js モデル一覧を確認してください。Google のブラウザ・スマートフォン向け参照経路は独自の AI Edge ランタイムです。FastVLM-0.5B はここで試せる ONNX ビルドがあります。