概要
jina-clip-v2 は 865M パラメータの多言語マルチモーダル埋め込みモデルで、89 言語と 512×512 画像入力をサポートします。jina-clip-v1 をクロスリンガルな画像-テキストアラインメント、次元削減のための Matryoshka 表現学習(1024→64)、ビジュアルに富んだ文書での性能向上で拡張しています。テキスト単独や単一モダリティで強い性能を維持しながら、クロスリンガル画像検索で state-of-the-art を達成します。
方法
モデルはデュアルエンコーダアーキテクチャを採用し、Jina XLM-RoBERTa テキストエンコーダ(561M パラメータ、89 言語、696,320 トークンコンテキスト)と EVA02-L14 ビジュアルエンコーダ(304M パラメータ、512×512 ピクセル入力)を組み合わせます。学習はマルチタスク・マルチステージの対比学習パラダイムを使用します:モデルはテキストペア、テキストトリプレット、画像-テキストペアで同時に学習され、テキスト単独タスクとクロスモーダルタスクの両方をサポートします。学習データセットは、29 の非英語言語(ヒンディー語、中国語、ドイツ語、フランス語を含む)の多言語テキストと、ビジュアルに富んだ文書の画像を含めるよう拡張されました。Matryoshka 表現学習により、性能の 99% 以上を維持しながら埋め込み次元を 1024 から 64 次元まで削減できます。モデルは最終埋め込みに Last-Token-Pooling を使用します。
パフォーマンス
モデルは Flickr30k の画像からテキスト検索で 98.0% の正解率を達成し、jina-clip-v1 と NLLB-CLIP-SigLIP の両方を上回っています。多言語シナリオでは、クロスリンガル画像検索で NLLB-CLIP-SigLIP に対して最大 4% の改善を示します。埋め込み圧縮は非常に効果的で、次元を 75% 削減(1024→256)しても、テキスト・画像・クロスモーダルの各タスクで性能の 99% 以上を維持します。Multilingual MTEB では、検索で 69.86%、意味類似度で 67.77% を達成し、特化したテキスト埋め込みモデルと競争力のある性能です。89 言語サポートとビジュアルに富んだ文書処理により、グローバルな Eコマースやコンテンツ管理に特に適しています。
ベストプラクティス
処理前に画像を 512×512 ピクセルにリサイズしてください — 大きな画像は自動的にタイル化され、トークン使用量と処理時間が増えます。モデルは 89 言語で画像を説明文とマッチさせることに長けており、グローバルな EC プロダクト検索、コンテンツレコメンド、多言語ビジュアル検索に最適です。抽象的概念や極めて専門的なドメインコンテンツには苦手な場合があります。Matryoshka 次元削減を使用する場合、64 次元の埋め込みでもインデックス用に強い性能を維持します。重要アプリケーションのリランキングには 512 以上の次元を使用してください。モデルは CUDA 対応ハードウェアが必要です。テキスト専用ワークロードでは、jina-embeddings-v5-text-small の方がパラメータあたりの精度が高いです。コード検索には jina-code-embeddings-1.5b を使用してください。Jina API、AWS、Azure、GCP マーケットプレイスで利用可能です。











