I/O 図 1

テキスト

jina-clip-v1

ベクター

I/O 図 2

画像

jina-clip-v1

ベクター

パレートフロン
300M1B3.0B10B20406080100bge-visualized-m3BiModernVBERTDSE-Phi3dse-qwen2-2b-mrl-v1e5-vjina-clip-v2jina-embeddings-v3jina-embeddings-v4llama-nemoretriever-col…MoCa-3Bnemotron-colembed-vl-8b…nllb-siglip-largeONE-PEACESauerkrautLM-ColLFM2-45…SauerkrautLM-ColMinistr…siglip-so400m-patch14-3…SigLIP2-L-512/16VLM2VecVultronRetrieverFlash-Q…jina-clip-v1パラメータ数(対数)nDCG@5
このモデル
フロン上
Jina AI
その他
ViDoRe v1
17.72
パラメータ
223M
スコア順位
32 / 33
パレートフロン
フロン上
値の分布
AUC 0.8440
コーパス
翻訳ペア
ドキュメント検索
画像 / バナー
0.6750.000.200.400.600.80
関連20.2%
ハードネガティブ3.2%
無関連1.2%
推奨しきい値
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
バランス · 0.376
AUC
0.8440
ノイズ上限
0.779
再現率の崖
0.123
測定ペア数
119 / 11k
ベクトル成分
-0.18-0.010.15
σ 0.0361 · 183k 個の値
埋め込みの幾何
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.283
実効次元数
55 / 768
比較するモデルを選択してください
論文 (1)

概要

jina-clip-v1 は 223M パラメータのマルチモーダル埋め込みモデルで、テキスト間の検索とテキストから画像の検索の両方で state-of-the-art の性能を達成しました — CLIP ファミリーのモデルとしては初めてです。クロスモーダルアラインメントのためにテキスト単独検索を犠牲にする標準の CLIP モデルとは異なり、jina-clip-v1 はマルチタスク対比学習により、すべての検索組み合わせで高い性能を維持します。テキストコンテキストは 12,288 トークンに対応し、元の CLIP の 77 トークン制限の 100 倍です。

方法

アーキテクチャは、ALiBi により 12,288 トークンに対応する改造済み Jina BERT v2 テキストエンコーダと、Beijing Academy for AI の EVA-02 画像エンコーダを組み合わせています。重要な革新はマルチタスク対比学習手法です:モデルは同時に (1) クロスモーダルアラインメントのための画像キャプションペア、(2) テキスト単独検索品質を維持するためのテキスト間ペア、(3) テキスト長さの変化への頑健性を高める画像の AI 生成長文説明で学習します。最終段階ではハードネガティブなテキストトリプレットを用いて意味的区別を鋭くします。このマルチタスクアプローチにより、標準の CLIP 学習に見られるテキスト単独検索の壊滅的忘却(catastrophic forgetting)を防ぎます。画像エンコーダは 224×224 ピクセルのタイルを処理し、各タイルは 1,000 トークンの処理能力を消費します。

パフォーマンス

テキスト単独検索では、このモデルは OpenAI CLIP に対して 165% の性能向上を達成しました(MTEB で 0.429 vs 0.162)。画像タスクでは:テキストから画像の検索が 2% 向上(0.899)、画像からテキストの検索が 6%(0.803)、画像から画像の検索が 12%(0.916)。ゼロショット画像分類(CIFAR-100)では、標準 CLIP を上回ります。Flickr8k/30k と MSCOCO Captions でのクロスモーダル性能は、特化した単一モダリティモデルと競争力があります。12,288 トークンのテキストコンテキストは、画像とともに長文テキスト文書を検索する上で大きな優位性です。2026 年、jina-clip-v2 が 89 言語対応と 512×512 画像処理によりこのモデルを引き継ぎます。

ベストプラクティス

モデルは 224×224 ピクセルのタイルで画像を処理します。各タイルは 1,000 トークンを消費します。750×500 ピクセルの画像には 12 タイル(12,000 トークン)が必要です。テキストは単語あたり約 1.1 トークンです。マルチモーダルクエリでは、それに合わせてトークン予算を計画してください。モデルは現在英語のみ対応 — 多言語アプリケーションには jina-clip-v2 を使用してください。Jina Embeddings API 経由と、Hugging Face での Apache 2.0 ライセンスによるオープンソースリリースで利用可能です。本番環境では、AWS Marketplace と Azure のデプロイオプションが最適化されたインフラを提供します。クロスモーダル比較にはコサイン類似度を使用してください。新しいマルチモーダルプロジェクトでは、jina-clip-v2(89 言語、512×512 画像、MRL 対応)または jina-embeddings-v4(32K コンテキスト、マルチベクトルモード、コード対応)を優先してください。

このモデルについて言及しているブログ
6月 25, 2025 • 12 読む時間
Jina Embeddings v4:マルチモーダル多言語検索のためのユニバーサルなベクトルモデル (Embeddings)
Jina 向量模型 (Embeddings) v4 は、38 億のパラメータを持つユニバーサルな 向量模型 (Embedding) モデルであり、マルチモーダルおよび多言語の検索に対応し、シングルベクトルとマルチベクトルの 向量模型 (Embedding) 出力をサポートします。
4月 08, 2025 • 21 読む時間
jina-reranker-m0:多言語マルチモーダルドキュメントリランカー
視覚的なドキュメントを検索するための新しい多言語・マルチモーダルリランカー jina-reranker-m0 を紹介します。多言語の長文ドキュメントやコード検索タスクにおいて、最先端(SOTA)の性能を実現しています。
12月 12, 2024 • 12 読む時間
埋め込みモデルにおけるテスト時の計算リソースのスケーリング
より良い結果はコンピュート量に比例して向上します—より多くの学習、より多くの探索に。優れた事前学習モデルは大きな成果をもたらしますが、テスト時のコンピュート量を増やすことでさらなる向上が得られます。埋め込みモデルであっても、テスト時のコンピュート量をスケールさせるという新しいパラダイムを認識することが重要です。
12月 04, 2024 • 13 読む時間
長文脈モデルが全部処理できるのに、チャンキングはまだ必要なのか?
長いコンテキストの埋め込みモデルにおける異なるチャンク分割戦略のパフォーマンスを比較し、目的に最適なアプローチを見つける方法
11月 21, 2024 • 9 読む時間
Jina CLIP v2:テキストと画像のための多言語マルチモーダル埋め込み
89言語のマルチリンガルサポート、512x512 の高解像度画像対応、および Matryoshka 表現を備えた 0.9B のマルチモーダル埋め込みモデル、Jina-CLIP v2。