画像とテキストの類似度 · 端末内で実行
画像とテキストの類似度
複数のキャプションを入力し、それぞれが画像とどれだけ一致するかを確認します。MobileCLIP-S0 が文章と画像を同じ埋め込み空間に写像し、コサイン類似度が一致スコアになります。
Apple MobileCLIP を使用
MOBILECLIP-S0 · IN-BROWSER
ブラウザを確認中…
JPEG・PNG・WebP · 最大10 MB · Ctrl/Cmd+V で貼り付け
CLIP 系モデルのコサイン類似度はおおむね 0〜0.4 の範囲です。絶対値ではなく行同士を比較してください。
Apple MobileCLIP-S0(第1世代)の Transformers.js 移植版を使用します。MobileCLIP2 はブラウザ版が未提供のため、第2世代 S0〜S4 は Python ガイドをご利用ください。
一致スコア
結果と計測時間がここに表示されます。
画像の長辺を 512 px に縮小します。スコアは類似度であり事実ではありません。無関係なラベルも試してください。
画像、ラベル、結果は端末内に残ります。利用統計はモデル、ステップ、所要時間のみを記録します。
よくある質問
その他のツールゼロショットとは?
モデルはあなたのラベルで学習していません。画像の埋め込みと各ラベルのテキスト埋め込みを比較するため、任意の語句をクラスにできます。
良いラベルの書き方は?
短く具体的な名詞句を使い、テンプレートを有効にしてください。「something else」のような受け皿ラベルを加えると、モデルの不確かさが分かります。
これは MobileCLIP2 ですか?
いいえ。ブラウザツールは Transformers.js に移植された第1世代の MobileCLIP-S0 を使用します。MobileCLIP2 は Python でローカル実行できます。
画像はアップロードされますか?
いいえ。埋め込みはブラウザの Web Worker 内で行われ、初回のモデル取得のみ Hugging Face と通信します。