Elastic
Jina AI
ニュース
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
Elastic Inference Service
Elasticsearch内でJinaモデルをネイティブに実行する。
MCP terminalコマンドラインarticlellms.txtsmart_toyエージェントdata_objectスキーマmenu_bookドキュメント



ログイン
login
Embeddings
copyright CC BY-NC 4.0
open_in_new リリースノート

jina-clip-v2

テキストと画像のための多言語およびマルチモーダルベクターモデル
ライセンス
copyright CC-BY-NC-4.0
発売日
calendar_month
2024-11-05
入力
image
写真
abc
文章
arrow_forward
出力
more_horiz
ベクター
Matryoshka 次元 help_outline
64
128
256
512
768
1024
モデル詳細
パラメータ: 865M
入力トークン長: 8K
入力画像サイズ: 512×512
出力寸法: 1024
ベースモデル help_outline
open_in_new
XLM-RoBERTa Large
訓練された言語 help_outline
32 言語
サポートされている言語 help_outline
108 言語
関連機種
link
jina-clip-v1
以下の方法で入手できます
Elastic Inference Service
Jina API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
エアギャップ
I/O 図 1

文章

jina-clip-v2

ベクター

I/O 図 2

画像

jina-clip-v2

ベクター

値の分布help_outline
AUC 0.8383
コーパス
翻訳ペア
ドキュメント検索
画像 / バナー
画像 / ロゴ
タスク
default
retrieval.query
0.6040.000.200.400.60
関連20.2%
ハードネガティブ3.6%
無関連0.8%
グラフにカーソルを合わせるかクリックしてしきい値を動かせます
推奨しきい値
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
バランス · 0.403
AUC
0.8383
ノイズ上限
0.666
再現率の崖
0.224
測定ペア数
119 / 11k
ベクトル成分help_outline
-0.43-0.070.29
σ 0.0313 · 244k 個の値
埋め込みの幾何help_outline
01024
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.420
実効次元数
52 / 1024
言語ペアhelp_outline
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき: 0.064
比較するモデルを選択してください
論文 (2)
ICLR 2026
1月 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
12月 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

概要

Jina CLIP v2 は、89 の言語で視覚とテキストの理解のギャップを埋めることで、マルチモーダル AI に革命をもたらします。このモデルは、言語の壁に関係なく、正確な画像とテキストのマッチングを実現することで、グローバルな電子商取引、コンテンツ管理、異文化コミュニケーションにおける主要な課題に対処します。国際的に事業を拡大したり、多言語コンテンツを管理したりする企業にとって、言語ごとに個別のモデルや複雑な翻訳プロセスが不要になります。このモデルは、世界市場での製品発見や多言語デジタル資産管理など、言語の境界を越えた正確な視覚検索を必要とするシナリオで特に優れています。

方法

Jina CLIP v2 の中核となるのは、Jina XLM-RoBERTa テキスト エンコーダー (561M パラメータ) と EVA02-L14 ビジュアル エンコーダー (304M パラメータ) を組み合わせた高度なデュアル エンコーダー アーキテクチャです。テキスト エンコーダーは、696,320 トークンの大規模なコンテキスト ウィンドウを使用して 89 の言語のコンテンツを処理し、ビジュアル エンコーダーは最大 512 x 512 ピクセルの高解像度画像を処理します。このモデルは、パフォーマンスを維持しながら 1024 次元から 64 次元への動的なベクトル次元調整を可能にする革新的なマトリョーシカ表現学習を導入しています。このアーキテクチャは、独自のエンコーダーを介してテキストと画像を処理し、元のモダリティや言語に関係なく、同様の概念を調整できる共有セマンティック空間に投影します。

パフォーマンス

このモデルは、Flickr30k の画像からテキストへの検索タスクで 98.0% の精度を達成し、前モデルおよび NLLB-CLIP-SigLIP を上回り、最先端のパフォーマンスを実現しました。多言語シナリオでは、最大の競合モデルよりもパラメータが少ないにもかかわらず、言語間画像検索タスクで NLLB-CLIP-SigLIP に対して最大 4% の改善を示しています。モデルは、埋め込みが圧縮されても強力なパフォーマンスを維持します。次元を 75% 削減しても、テキスト、画像、クロスモーダル タスクで 99% を超えるパフォーマンスが維持されます。包括的な多言語 MTEB ベンチマークでは、検索タスクで 69.86%、意味的類似性タスクで 67.77% を達成し、専用のテキスト埋め込みモデルと比べても遜色のない性能を示しています。

ベストプラクティス

最適な展開のために、ユーザーはいくつかの重要な要素を考慮する必要があります。このモデルでは、効率的な処理のために CUDA 対応のハードウェアが必要であり、メモリ要件はバッチ サイズと画像解像度に応じて変化します。 API のコストとパフォーマンスを最適化するには、処理前に画像を 512 x 512 ピクセルにサイズ変更します。大きい画像は自動的にタイル化されるため、トークンの使用量と処理時間が増加します。このモデルは、言語間で画像と説明文を一致させることに優れていますが、抽象的な概念や高度に専門化されたドメイン固有のコンテンツの処理が難しい場合があります。これは、電子商取引の製品検索、コンテンツ推奨システム、およびビジュアル検索アプリケーションには特に効果的ですが、きめ細かい視覚的詳細の分析や高度に専門化されたドメインの専門知識を必要とするタスクには適さない可能性があります。 Matryoshka を使用して特徴を表現する場合は、次元削減とパフォーマンスのトレードオフを考慮してください。64 次元のベクトルは強力なパフォーマンスを維持しますが、重要なアプリケーションではより高い次元のメリットが得られる可能性があります。
このモデルについて言及しているブログ
11月 21, 2024 • 9 読む時間
Jina CLIP v2:テキストと画像のための多言語マルチモーダル埋め込み
89言語のマルチリンガルサポート、512x512 の高解像度画像対応、および Matryoshka 表現を備えた 0.9B のマルチモーダル埋め込みモデル、Jina-CLIP v2。
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
10月 29, 2024 • 11 読む時間
CLIP を超えて:Jina-CLIP がマルチモーダル検索をどのように進化させるのか
OpenAI の CLIP を改良した Jina-CLIP について、統一されたテキスト・画像埋め込みによって検索精度が向上し、より多様な結果が得られるようになった仕組みを解説します。
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
6月 05, 2024 • 9 読む時間
Jina CLIP v1:テキストと画像のための真のマルチモーダル埋め込みモデル
Jina AI の新しいマルチモーダル埋め込みモデルは、テキストと画像の検索において OpenAI CLIP を上回るだけでなく、優れた画像埋め込みモデルであると同時に最先端のテキスト埋め込みモデルでもあります。もはや異なるモダリティに対して異なるモデルを必要としません。
Sofia Vasileva
Scott Martens
Susana Guzmán
Abstract 3D render of a neon blue and green grid pattern on a black background, creating a sense of depth.
9月 27, 2024 • 15 読む時間
Jina Embeddings v2 から v3 への移行
Jina Embeddings v2 から v3 への移行に役立つヒントをいくつか集めました。
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
8月 30, 2024 • 10 読む時間
Jina ColBERT v2:多言語遅延インタラクション型エンベディング・リランキング検索システム
Jina ColBERT v2 は、優れた検索パフォーマンス、ユーザーが制御可能な出力次元、8192 トークン長をサポートし、89 の言語に対応しています。
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
Search Foundation
Reader
Embeddings
Reranker
Elastic Inference Service
open_in_new
Jina APIキーを取得する
レート制限
APIステータス
条項
セキュリティ
利用規約
プライバシー
Cookieを管理する
私の個人情報を販売したり、共有したりしないでください。
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
Elastic © 2020-2026.
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。