Skip to content

画像とテキストの類似度 · 端末内で実行

画像とテキストの類似度

複数のキャプションを入力し、それぞれが画像とどれだけ一致するかを確認します。MobileCLIP-S0 が文章と画像を同じ埋め込み空間に写像し、コサイン類似度が一致スコアになります。

Apple MobileCLIP を使用

MOBILECLIP-S0 · IN-BROWSER

ブラウザを確認中…

JPEG・PNG・WebP · 最大10 MB · Ctrl/Cmd+V で貼り付け

CLIP 系モデルのコサイン類似度はおおむね 0〜0.4 の範囲です。絶対値ではなく行同士を比較してください。

Apple MobileCLIP-S0(第1世代)の Transformers.js 移植版を使用します。MobileCLIP2 はブラウザ版が未提供のため、第2世代 S0〜S4 は Python ガイドをご利用ください。

一致スコア

結果と計測時間がここに表示されます。

画像の長辺を 512 px に縮小します。スコアは類似度であり事実ではありません。無関係なラベルも試してください。

画像、ラベル、結果は端末内に残ります。利用統計はモデル、ステップ、所要時間のみを記録します。

よくある質問

その他のツール
ゼロショットとは?

モデルはあなたのラベルで学習していません。画像の埋め込みと各ラベルのテキスト埋め込みを比較するため、任意の語句をクラスにできます。

良いラベルの書き方は?

短く具体的な名詞句を使い、テンプレートを有効にしてください。「something else」のような受け皿ラベルを加えると、モデルの不確かさが分かります。

これは MobileCLIP2 ですか?

いいえ。ブラウザツールは Transformers.js に移植された第1世代の MobileCLIP-S0 を使用します。MobileCLIP2 は Python でローカル実行できます。

画像はアップロードされますか?

いいえ。埋め込みはブラウザの Web Worker 内で行われ、初回のモデル取得のみ Hugging Face と通信します。