Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
Elastic Inference Service
Elasticsearch内でJinaモデルをネイティブに実行する。
MCP terminalコマンドラインarticlellms.txtsmart_toyエージェントdata_objectスキーマmenu_bookドキュメント



ログイン
login
warning
このモデルは、新しいモデルでは非推奨になりました。
Embeddings
copyright CC BY-NC 4.0
open_in_new リリースノート

jina-embeddings-v3

SOTA 性能を備えた最先端の多言語ベクトル モデル
ライセンス
copyright CC-BY-NC-4.0
発売日
calendar_month
2024-09-18
入力
abc
文章
arrow_forward
出力
more_horiz
ベクター
Matryoshka 次元 help_outline
32
64
128
256
512
768
1024
レイトチャンキング help_outline
check_circle
Yes
モデル詳細
パラメータ: 570M
入力トークン長: 8K
出力寸法: 1024
ベースモデル help_outline
open_in_new
XLM-RoBERTa Large
訓練された言語 help_outline
32 言語
サポートされている言語 help_outline
108 言語
関連機種
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-zh
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-es
link
jina-embeddings-v2-base-code
サポートされているタスク
search 検索
compare_arrows テキストマッチング
call_split 分離
label 分類
以下の方法で入手できます
Elastic Inference Service
Jina API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
エアギャップ
I/O 図

文章

jina-embeddings-v3

タスク

ベクター

値の分布help_outline
AUC 0.8525
コーパス
翻訳ペア
ドキュメント検索
コード
タスク
default
classification
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
separation
text-matching
0.7410.200.400.600.80
関連21.8%
ハードネガティブ3.0%
無関連1.0%
グラフにカーソルを合わせるかクリックしてしきい値を動かせます
推奨しきい値
FPR 0.1 · 0.618
FPR 0.01 · 0.741
FPR 0.001 · 0.797
FPR 0.0001 · 0.824
バランス · 0.597
AUC
0.8525
ノイズ上限
0.791
再現率の崖
0.385
測定ペア数
119 / 11k
ベクトル成分help_outline
-0.25-0.010.23
σ 0.0312 · 244k 個の値
埋め込みの幾何help_outline
01024
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.496
実効次元数
54 / 1024
次元の切り詰めhelp_outline
32641282565121024
classification · 要求した次元数ごとのしきい値
言語ペアhelp_outline
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき: 0.072
比較するモデルを選択してください
論文 (4)
ICLR 2026
1月 22, 2026
Embedding Compression via Spherical Coordinates
ACL 2025
12月 17, 2024
AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark
ECIR 2025
9月 18, 2024
jina-embeddings-v3: Multilingual Embeddings With Task LoRA
SIGIR 2025
9月 07, 2024
Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models

概要

Jina Embeddings v3 は、組織が言語を超えたテキストの理解と取得に取り組む方法を変える、画期的な多言語テキスト ベクトル モデルです。基本的に、計算要件を制御しながら、複数の言語およびタスクにわたって高いパフォーマンスを維持するという重要な課題を解決します。このモデルは、効率が重要な実稼働環境で特に優れています。わずか 5 億 7,000 万のパラメータで最先端のパフォーマンスを実現し、大規模なモデルの計算オーバーヘッドに余裕がないチームでも利用できるようになります。スケーラブルな多言語検索システムを構築したり、言語の壁を越えてコンテンツを分析したりする必要がある組織は、このモデルが特に価値があると考えられます。

方法

このモデルのアーキテクチャは、ベクトル テクノロジーにおける主要な革新を表しており、24 層の jina-XLM-RoBERTa に基づいて構築され、タスク固有の低ランク アダプティブ (LoRA) アダプターで強化されています。 LoRA アダプターは、パラメーターの数を大幅に増やすことなく、検索、分類、クラスタリングなどのさまざまなタスクに合わせてモデルを最適化する特殊なニューラル ネットワーク コンポーネントです。合計パラメーターの増加は 3% 未満です。このモデルには Matryoshka Representation Learning (MRL) が組み込まれており、パフォーマンスを維持しながらベクトルを 1024 次元から 32 次元に柔軟に削減できます。トレーニングには 3 つの段階が含まれます。89 言語の多言語テキストに関する最初の事前トレーニング、ベクトル品質を向上させるためのペアのテキストの微調整、タスクに合わせて最適化するための特殊なアダプター トレーニングです。このモデルは、回転位置ベクトル (RoPE) を介して最大 8,192 トークンのコンテキスト長をサポートし、革新的な基本周波数調整技術を使用して、短いテキストと長いテキストの両方のパフォーマンスを向上させます。

パフォーマンス

このモデルは、実世界のテストで優れた効率対パフォーマンス比を実証し、英語タスクではオープンソースの代替案や OpenAI や Cohere の独自ソリューションを上回っていると同時に、多言語シナリオでも良好なパフォーマンスを示しています。最も驚くべきことに、12 倍のパラメータを使用する e5-mistral-7b-instruct よりも優れた結果が得られ、その優れた効率性が強調されます。 MTEB ベンチマーク評価では、すべてのタスクで平均スコア 65.52 を達成し、特に分類精度 (82.58) と文の類似性 (85.80) で優れたパフォーマンスを示しました。このモデルは言語間で一貫したパフォーマンスを維持し、多言語タスクで 64.44 のスコアを獲得しました。次元削減に MRL を使用すると、より低い次元でも強力なパフォーマンスが維持されます。たとえば、64 次元では、完全な 1024 次元と比較して 92% の検索パフォーマンスが維持されます。

ベストプラクティス

Jina Embeddings v3 を効果的に導入するには、チームは特定のユースケースを考慮して適切なタスクアダプタを選択する必要があります。検索アプリケーションでは retrieval.query と retrieval.passage を、クラスタリングタスクでは separation を、分類では classification を、セマンティック類似性では text-matching を使用します。このモデルでは、最高のパフォーマンスを得るために CUDA 対応ハードウェアが必要ですが、効率的なアーキテクチャのため、大規模な代替手段に比べて GPU メモリの必要量が大幅に少なくて済みます。本番環境での導入では、AWS SageMaker との統合により、スケーラビリティへのシンプルなパスが提供されます。このモデルは多言語アプリケーションで良好なパフォーマンスを発揮しますが、リソースの少ない言語では追加の評価が必要になる場合があります。最大 8,192 トークンの長いドキュメントをサポートしていますが、非常に長いテキストにはレイトチャンキング機能を使用すると最高のパフォーマンスが得られます。このモデルは埋め込みと検索用に設計されており、リアルタイム生成や複雑な推論を必要とするタスク、テキスト生成や直接的な質問への回答には使用しないでください。
このモデルについて言及しているブログ
9月 18, 2024 • 10 読む時間
Jina Embeddings v3:最先端の多言語埋め込みモデル
jina-embeddings-v3 は、570M パラメータと 8192 トークン長を持つ最先端の多言語テキスト埋め込みモデルで、MTEB において OpenAI や Cohere の最新の商用埋め込みモデルを上回る性能を発揮します。
Jina AI
Dynamic image showing the characters "V3" formed by bright green dots varying in size on a black background.
9月 27, 2024 • 15 読む時間
Jina Embeddings v2 から v3 への移行
Jina Embeddings v2 から v3 への移行に役立つヒントをいくつか集めました。
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
5月 12, 2026 • 7 読む時間
jina-embeddings-v5-omni:テキスト、画像、音声、動画のための向量模型
1つのモデルで、テキスト、画像、音声、動画という4つのモダリティに対応。1.6Bおよび0.9Bのクラス最高レベルのオムニ・ベクトルモデルです。
Han Xiao
2月 19, 2026 • 7 読む時間
jina-embeddings-v5-text: 新しい SOTA 小型多言語ベクトルモデル
<input> 1B 未満の最高の性能を誇る 2 つの多言語対応ベクトルモデル(Embeddings)が、Elastic Inference Service、Llama.cpp、および MLX で利用可能になりました。 </input>
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
9月 04, 2025 • 6 読む時間
Jina Code Embeddings: 0.5B および 1.5B で SOTA のコード検索を実現
コード生成LLM → コードのベクトルモデル:0.5B/1.5Bのモデルが25のコード検索ベンチマークでSOTA(最高性能)を達成。
Jina AI
Green "Code Embeddings" text displayed in a LED dot style on a black background, evoking a futuristic and technological atmos
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。