オンデバイス VLM ハブ
オンデバイスで動く小型視覚言語モデル
視覚言語モデルは画像についての質問に答えます。以下のモデルはノート PC、スマートフォン、WebGPU ブラウザで動く小ささです。表で候補を絞り、FastVLM との1対1比較を開いてください。
| モデル | 開発元 | サイズ | 画像 | 動画 | 複数画像 | ブラウザ | MLX | ライセンス | 適した用途 |
|---|---|---|---|---|---|---|---|---|---|
| FastVLM2025 | Apple | 0.5B · 1.5B · 7B | 対応 | Apple AMLR | 高解像度画像での低い TTFT。ブラウザと Apple Silicon | ||||
| SmolVLM22025 | Hugging Face | 256M · 500M · 2.2B | 一部サイズ | Apache 2.0 | 動画理解を備えた超小型モデル。寛容なライセンス | ||||
| LFM2.5-VL2026 | Liquid AI | 450M · 3B | 対応 | LFM Open License | エッジでのグラウンディング、画面、文書、ツール呼び出し | ||||
| Gemma 42026 | E2B · E4B · 12B · 26B-A4B · 31B | ランタイム依存 | Gemma Terms | 幅広いマルチモーダル(画像、動画フレーム、E2B/E4B の音声)とエージェント用途 | |||||
| Gemma 3n2025 | E2B · E4B | ランタイム依存 | Gemma Terms | 音声入力とレイヤーごとの埋め込みを持つスマートフォン向けモデル | |||||
| Qwen3-VL2025 | Alibaba | 2B · 4B · 8B (small) | 一部サイズ | Apache 2.0 | 小型密モデルでの強力な OCR、文書、動画 | ||||
| Moondream2024–2025 | Moondream | 2B · 3 (9B MoE, 2B active) | 一部サイズ | Apache 2.0 / BSL | 小さなフットプリントでのポインティング、検出、キャプション | ||||
| MiniCPM-V2025 | OpenBMB | 4.5 (8B) | 非対応 | Apache 2.0 code · MiniCPM weights | ノート PC での高解像度画像・動画理解 | ||||
| PaliGemma 22024 | 3B · 10B · 28B | 非対応 | Gemma Terms | 検出、セグメンテーション、キャプションの微調整ベース |
「ブラウザ」は少なくとも1サイズに維持されている WebGPU/Transformers.js または ONNX ビルドがあることを意味します。「ランタイム依存」は Transformers.js ではなく MediaPipe や LiteRT などベンダーのランタイムで動作します。
2026年9月17日に公式モデルカードと発表に照らして確認。古い情報はサイトの GitHub からご報告ください。
FastVLM との1対1比較
あなたのデバイスで FastVLM をベンチマーク選び方
- まずタスク:OCR や文書は高い入力解像度が有利、動画はフレームで学習したモデルが必要、グラウンディングは出力形式にボックスが必要。
- 次にランタイム:ブラウザデモには ONNX 重み、iPhone アプリには MLX か Core ML、Linux サーバーは何でも可。
- 次にライセンス:Apache 2.0 が最も配布しやすく、Apple AMLR と Gemma 規約には読むべき条件があります。
- 最後に自分のデバイスで計測。公開ベンチマークはプロトコルが異なり、ベンダー間で比較できません。