I/O 図

テキスト

jina-embeddings-v2-base-en

ベクター

パレートフロン
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxlパラメータ数(対数)nDCG@10
このモデル
フロン上
Jina AI
その他
MTEB English · retrieval
49.05
パラメータ
137M
スコア順位
17 / 39
パレートフロン
フロン未満
値の分布
AUC 0.8376
コーパス
翻訳ペア
ドキュメント検索
0.8500.600.700.800.90
関連26.9%
ハードネガティブ2.7%
無関連1.1%
推奨しきい値
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
バランス · 0.762
AUC
0.8376
ノイズ上限
0.893
再現率の崖
0.691
測定ペア数
119 / 11k
ベクトル成分
-0.14-0.000.14
σ 0.0361 · 183k 個の値
埋め込みの幾何
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.751
実効次元数
59 / 768
比較するモデルを選択してください
論文 (1)

概要

jina-embeddings-v2-base-en137M パラメータの英語テキスト埋め込みモデルで、8,192 トークンのコンテキストウィンドウを備えています — その時代の標準 512 トークン制限の 16 倍です。対称双方向 ALiBi(Attention with Linear Biases)を備えた BERT-small バックボーン上に構築され、切り詰めやチャンキングなしで長文書をネイティブに処理した最初のオープンソース Jina 埋め込みでした。768 次元のベクトルを生成し、v3/v5 の多言語や長コンテキスト機能が不要な英語専用の検索では引き続き堅実な選択肢です。

方法

アーキテクチャは BERT-small トランスフォーマー(12 層、12 アテンションヘッド、768 隠れ次元)と対称双方向 ALiBi 位置エンコーディングを組み合わせます。ALiBi は学習済み位置埋め込みを線形的に減衰するアテンションバイアスに置き換え、モデルが 512 トークンの訓練長を大きく超えて 8,192 トークンまで性能劣化なしに外挿できるようにします。訓練は 2 段階のパイプラインに従いました:C4 での事前学習、その後困難負サンプルマイニングを伴う Jina がキュレーションした 40 以上の専門的文ペアデータセットでのファインチューニング。対称双方向のアテンションにより、各トークンが前後のコンテキストの両方に注意を払い、文のグローバルな意味を捉える表現が生成されます。全トークン表現に対する平均プーリングにより、最終的な 768 次元埋め込みが生成されます。

パフォーマンス

リリース時、モデルは OpenAI の text-embedding-ada-002 を複数の MTEB 英語サブタスクで上回りました:分類(73.45% vs 70.93%)、リランキング(85.38% vs 84.89%)、検索(56.98% vs 56.32%)、要約(31.6% vs 30.8%)。8,192 トークンのコンテキストは、512–2,048 トークンに制限された競合モデルに対する大きな優位性であり、チャンキングなしの文書レベル検索を可能にしました。コンパクトな 307MB のフットプリントにより、コンシューマー向け GPU でのデプロイができました。2026 年、jina-embeddings-v5-text-small677M パラメータ、32K コンテキスト、タスク固有 LoRA アダプタ)はほとんどの本番ワークロードでこれを上回りますが、軽量な英語専用パイプラインでは引き続き関連があります。

ベストプラクティス

8K コンテキストウィンドウが十分で、多言語やタスク固有アダプタが不要な英語専用の検索にこのモデルを使用してください。8,192 トークンを超えるドキュメントには、埋め込み前にセマンティックチャンキングを適用してください。モデルは主要なベクトルデータベース(Qdrant、Weaviate、MongoDB Atlas、Milvus)および RAG フレームワーク(LangChain、LlamaIndex、Haystack)と統合できます。多言語サポート、32K コンテキスト、タスク固有の最適化を必要とする新規プロジェクトには、jina-embeddings-v5-text-small を推奨します。本番のスループットには CUDA 対応 GPU を推奨します。CPU 推論も可能ですが、大幅に遅くなります。

このモデルについて言及しているブログ
12月 17, 2024 • 12 読む時間
テキスト埋め込みが語順を捉えられない問題とその解決方法
テキスト埋め込みモデルは、単語の順序、方向性のある関係、時間の順序、因果関係、比較、否定など、微妙な言語的ニュアンスを捉えることに苦労しています。これらの課題を理解することが、モデルのパフォーマンス向上への鍵となります。
10月 25, 2024 • 19 読む時間
小規模言語モデルを使用した長文書における最適な分割点の発見
長い文書をチャンクに分割するための小規模な言語モデルを3つ学習させ、そこから得た重要な教訓をご紹介します。
10月 15, 2024 • 9 読む時間
Jina Reader における新しい Grounding API によるファクトチェック
新しい g.jina.ai を使用すると、LLM の幻覚を抑制したり、人が書いたコンテンツの整合性を高めるために、簡単にステートメントの根拠付けを行うことができます。
9月 27, 2024 • 15 読む時間
Jina Embeddings v2 から v3 への移行
Jina Embeddings v2 から v3 への移行に役立つヒントをいくつか集めました。
9月 18, 2024 • 10 読む時間
Jina Embeddings v3:最先端の多言語埋め込みモデル
jina-embeddings-v3 は、570M パラメータと 8192 トークン長を持つ最先端の多言語テキスト埋め込みモデルで、MTEB において OpenAI や Cohere の最新の商用埋め込みモデルを上回る性能を発揮します。