Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
Embeddings
copyright CC BY-NC 4.0
open_in_new リリース記事

jina-clip-v2

テキストと画像のための多言語およびマルチモーダルベクターモデル
ライセンス
copyright CC-BY-NC-4.0
発売日
calendar_month
2024-11-05
入力
image
画像
abc
テキスト
arrow_forward
出力
more_horiz
ベクター
Matryoshka 次元 help_outline
64
128
256
512
768
1024
モデル詳細
パラメータ: 865M
入力トークン長: 8K
入力画像サイズ: 512×512
出力寸法: 1024
ベースモデル help_outline
open_in_new
EVA02-L-14
link
jina-embeddings-v3
訓練された言語 help_outline
32 言語
サポートされている言語 help_outline
108 言語
関連機種
link
jina-clip-v1
以下の方法で入手できます
Elastic Inference Service
Jina API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
エアギャップ
I/O 図 1

テキスト

jina-clip-v2

ベクター

I/O 図 2

画像

jina-clip-v2

ベクター

パレートフロンhelp_outline
ViDoRe v1
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2パラメータ数(対数)i2t-recall@5
このモデル
フロン上
Jina AI
その他
CLIP Benchmark
89.73
パラメータ
865M
スコア順位
34 / 56
パレートフロン
フロン未満
値の分布help_outline
AUC 0.8383
コーパス
翻訳ペア
ドキュメント検索
画像 / バナー
画像 / ロゴ
タスク
default
retrieval.query
0.6040.000.200.400.60
関連20.2%
ハードネガティブ3.6%
無関連0.8%
推奨しきい値
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
バランス · 0.403
AUC
0.8383
ノイズ上限
0.666
再現率の崖
0.224
測定ペア数
119 / 11k
ベクトル成分help_outline
-0.43-0.070.29
σ 0.0313 · 244k 個の値
埋め込みの幾何help_outline
01024
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.420
実効次元数
52 / 1024
言語ペアhelp_outline
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき:0.064
比較するモデルを選択してください
論文 (2)
ICLR 2026
1月 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
12月 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

概要

jina-clip-v2 は 865M パラメータの多言語マルチモーダル埋め込みモデルで、89 言語と 512×512 画像入力をサポートします。jina-clip-v1 をクロスリンガルな画像-テキストアラインメント、次元削減のための Matryoshka 表現学習(1024→64)、ビジュアルに富んだ文書での性能向上で拡張しています。テキスト単独や単一モダリティで強い性能を維持しながら、クロスリンガル画像検索で state-of-the-art を達成します。

方法

モデルはデュアルエンコーダアーキテクチャを採用し、Jina XLM-RoBERTa テキストエンコーダ(561M パラメータ、89 言語、696,320 トークンコンテキスト)と EVA02-L14 ビジュアルエンコーダ(304M パラメータ、512×512 ピクセル入力)を組み合わせます。学習はマルチタスク・マルチステージの対比学習パラダイムを使用します:モデルはテキストペア、テキストトリプレット、画像-テキストペアで同時に学習され、テキスト単独タスクとクロスモーダルタスクの両方をサポートします。学習データセットは、29 の非英語言語(ヒンディー語、中国語、ドイツ語、フランス語を含む)の多言語テキストと、ビジュアルに富んだ文書の画像を含めるよう拡張されました。Matryoshka 表現学習により、性能の 99% 以上を維持しながら埋め込み次元を 1024 から 64 次元まで削減できます。モデルは最終埋め込みに Last-Token-Pooling を使用します。

パフォーマンス

モデルは Flickr30k の画像からテキスト検索で 98.0% の正解率を達成し、jina-clip-v1 と NLLB-CLIP-SigLIP の両方を上回っています。多言語シナリオでは、クロスリンガル画像検索で NLLB-CLIP-SigLIP に対して最大 4% の改善を示します。埋め込み圧縮は非常に効果的で、次元を 75% 削減(1024→256)しても、テキスト・画像・クロスモーダルの各タスクで性能の 99% 以上を維持します。Multilingual MTEB では、検索で 69.86%、意味類似度で 67.77% を達成し、特化したテキスト埋め込みモデルと競争力のある性能です。89 言語サポートとビジュアルに富んだ文書処理により、グローバルな Eコマースやコンテンツ管理に特に適しています。

ベストプラクティス

処理前に画像を 512×512 ピクセルにリサイズしてください — 大きな画像は自動的にタイル化され、トークン使用量と処理時間が増えます。モデルは 89 言語で画像を説明文とマッチさせることに長けており、グローバルな EC プロダクト検索、コンテンツレコメンド、多言語ビジュアル検索に最適です。抽象的概念や極めて専門的なドメインコンテンツには苦手な場合があります。Matryoshka 次元削減を使用する場合、64 次元の埋め込みでもインデックス用に強い性能を維持します。重要アプリケーションのリランキングには 512 以上の次元を使用してください。モデルは CUDA 対応ハードウェアが必要です。テキスト専用ワークロードでは、jina-embeddings-v5-text-small の方がパラメータあたりの精度が高いです。コード検索には jina-code-embeddings-1.5b を使用してください。Jina API、AWS、Azure、GCP マーケットプレイスで利用可能です。

このモデルについて言及しているブログ
7月 31, 2025 • 12 読む時間
How Image Resolution Impacts Visual Document Retrieval
Image resolution is crucial for embedding visually rich documents. Too small and models miss key details; too large and they can't connect the parts.
Maximilian Werk
Michael Günther
Scott Martens
Abstract composition with a dark background featuring a flower-like design, radiant eye-like feature, rainbow-colored curved
7月 25, 2025 • 8 読む時間
JinaVDR: New Visual Document Retrieval Benchmark with 95 Tasks in 20 Languages
JinaVDR is a new benchmark spanning 95 tasks across 20 languages for visual document retrieval, soon on MTEB.
Maximilian Werk
Alex C-G
Black-and-white design for "Jinavor Benchmark" with bold text. Below, "Visual Docs: 95 Tasks: 20 Languages" appears; an abstr
6月 25, 2025 • 12 読む時間
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
5月 28, 2025 • 4 読む時間
Correlations: Vibe-Testing Embeddings in GUI
As serious as we are about MTEB, we also love vibe-testing. Correlations is a simple GUI we use for validating citations in DeepSearch, debugging late chunking, and vibe-testing embeddings. Now it's open-source.
Jina AI
Technical screen showing green and yellow visual data, including charts in the lower half and a heat-map-like visualization a
5月 25, 2025 • 21 読む時間
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するコンテンツ、ソフトウェア、製品、サービスは、すべて専門的な利用を目的としています。消費者向けの利用は想定していません。