概要
jina-embeddings-v2-base-en は 137M パラメータの英語テキスト埋め込みモデルで、8,192 トークンのコンテキストウィンドウを備えています — その時代の標準 512 トークン制限の 16 倍です。対称双方向 ALiBi(Attention with Linear Biases)を備えた BERT-small バックボーン上に構築され、切り詰めやチャンキングなしで長文書をネイティブに処理した最初のオープンソース Jina 埋め込みでした。768 次元のベクトルを生成し、v3/v5 の多言語や長コンテキスト機能が不要な英語専用の検索では引き続き堅実な選択肢です。
方法
アーキテクチャは BERT-small トランスフォーマー(12 層、12 アテンションヘッド、768 隠れ次元)と対称双方向 ALiBi 位置エンコーディングを組み合わせます。ALiBi は学習済み位置埋め込みを線形的に減衰するアテンションバイアスに置き換え、モデルが 512 トークンの訓練長を大きく超えて 8,192 トークンまで性能劣化なしに外挿できるようにします。訓練は 2 段階のパイプラインに従いました:C4 での事前学習、その後困難負サンプルマイニングを伴う Jina がキュレーションした 40 以上の専門的文ペアデータセットでのファインチューニング。対称双方向のアテンションにより、各トークンが前後のコンテキストの両方に注意を払い、文のグローバルな意味を捉える表現が生成されます。全トークン表現に対する平均プーリングにより、最終的な 768 次元埋め込みが生成されます。
パフォーマンス
リリース時、モデルは OpenAI の text-embedding-ada-002 を複数の MTEB 英語サブタスクで上回りました:分類(73.45% vs 70.93%)、リランキング(85.38% vs 84.89%)、検索(56.98% vs 56.32%)、要約(31.6% vs 30.8%)。8,192 トークンのコンテキストは、512–2,048 トークンに制限された競合モデルに対する大きな優位性であり、チャンキングなしの文書レベル検索を可能にしました。コンパクトな 307MB のフットプリントにより、コンシューマー向け GPU でのデプロイができました。2026 年、jina-embeddings-v5-text-small(677M パラメータ、32K コンテキスト、タスク固有 LoRA アダプタ)はほとんどの本番ワークロードでこれを上回りますが、軽量な英語専用パイプラインでは引き続き関連があります。
ベストプラクティス
8K コンテキストウィンドウが十分で、多言語やタスク固有アダプタが不要な英語専用の検索にこのモデルを使用してください。8,192 トークンを超えるドキュメントには、埋め込み前にセマンティックチャンキングを適用してください。モデルは主要なベクトルデータベース(Qdrant、Weaviate、MongoDB Atlas、Milvus)および RAG フレームワーク(LangChain、LlamaIndex、Haystack)と統合できます。多言語サポート、32K コンテキスト、タスク固有の最適化を必要とする新規プロジェクトには、jina-embeddings-v5-text-small を推奨します。本番のスループットには CUDA 対応 GPU を推奨します。CPU 推論も可能ですが、大幅に遅くなります。










