Skip to content

オンデバイス VLM ハブ

オンデバイスで動く小型視覚言語モデル

視覚言語モデルは画像についての質問に答えます。以下のモデルはノート PC、スマートフォン、WebGPU ブラウザで動く小ささです。表で候補を絞り、FastVLM との1対1比較を開いてください。

モデル開発元サイズ画像動画複数画像ブラウザMLXライセンス適した用途
FastVLM2025Apple0.5B · 1.5B · 7B対応Apple AMLR高解像度画像での低い TTFT。ブラウザと Apple Silicon
SmolVLM22025Hugging Face256M · 500M · 2.2B一部サイズApache 2.0動画理解を備えた超小型モデル。寛容なライセンス
LFM2.5-VL2026Liquid AI450M · 3B対応LFM Open Licenseエッジでのグラウンディング、画面、文書、ツール呼び出し
Gemma 42026GoogleE2B · E4B · 12B · 26B-A4B · 31Bランタイム依存Gemma Terms幅広いマルチモーダル(画像、動画フレーム、E2B/E4B の音声)とエージェント用途
Gemma 3n2025GoogleE2B · E4Bランタイム依存Gemma Terms音声入力とレイヤーごとの埋め込みを持つスマートフォン向けモデル
Qwen3-VL2025Alibaba2B · 4B · 8B (small)一部サイズApache 2.0小型密モデルでの強力な OCR、文書、動画
Moondream2024–2025Moondream2B · 3 (9B MoE, 2B active)一部サイズApache 2.0 / BSL小さなフットプリントでのポインティング、検出、キャプション
MiniCPM-V2025OpenBMB4.5 (8B)非対応Apache 2.0 code · MiniCPM weightsノート PC での高解像度画像・動画理解
PaliGemma 22024Google3B · 10B · 28B非対応Gemma Terms検出、セグメンテーション、キャプションの微調整ベース

「ブラウザ」は少なくとも1サイズに維持されている WebGPU/Transformers.js または ONNX ビルドがあることを意味します。「ランタイム依存」は Transformers.js ではなく MediaPipe や LiteRT などベンダーのランタイムで動作します。

2026年9月17日に公式モデルカードと発表に照らして確認。古い情報はサイトの GitHub からご報告ください。

選び方

  1. まずタスク:OCR や文書は高い入力解像度が有利、動画はフレームで学習したモデルが必要、グラウンディングは出力形式にボックスが必要。
  2. 次にランタイム:ブラウザデモには ONNX 重み、iPhone アプリには MLX か Core ML、Linux サーバーは何でも可。
  3. 次にライセンス:Apache 2.0 が最も配布しやすく、Apple AMLR と Gemma 規約には読むべき条件があります。
  4. 最後に自分のデバイスで計測。公開ベンチマークはプロトコルが異なり、ベンダー間で比較できません。