概要
jina-embeddings-v2-base-es はスペイン語・英語の 161M パラメータのバイリンガルテキスト埋め込みモデルで、8,192 トークンのコンテキストウィンドウと 768 次元の出力を備えます。スペイン語圏市場のクロスリンガル検索のために設計され、意味的に等価なスペイン語・英語コンテンツを共有埋め込み空間にマッピングします。モデルは重要なギャップに対応しています:当時、ほとんどの埋め込みモデルは英語中心で、スペイン語の性能が大幅に低下していました。
方法
モデルは対称双方向 ALiBi 位置エンコーディングを備えた BERT ベースのバックボーン、161M パラメータ、768 次元の出力空間を使用します。訓練は 3 段階のプロセスに従いました:(1) スペイン語-英語平行コーパスでの事前学習、(2) キュレーション済み文ペアでの困難負サンプルマイニングを伴う対比ファインチューニング、(3) 同じ概念のスペイン語・英語表現がまとまってクラスタリングされることを保証するクロスリンガルアラインメント。ALiBi メカニズムにより、学習済み位置埋め込みなしで 8,192 トークンのコンテキストが可能となり、モデルは 512 トークンの訓練長を超えて外挿できます。平均プーリングが最終的な埋め込みベクトルを生成します。
パフォーマンス
モデルは、それらのサイズの 15–30% しかなくながら、はるかに大きな多言語モデル(E5、BGE-M3)をスペイン語-英語検索タスクで上回りました。MTEB スペイン語サブタスク、特に検索とクラスタリングで強い性能を示しました。8,192 トークンのコンテキストウィンドウにより、多くの競合モデルがチャンキングを要した複数ページ文書で一貫した性能を発揮しました。2026 年、jina-embeddings-v5-text-small が 89 言語、32K コンテキスト、タスク固有 LoRA アダプタを提供し、このモデルに取って代わります。v2-base-es モデルは、専用スペイン語-英語パイプラインのコスト効率の良い選択肢のままです。
ベストプラクティス
スペイン語-英語のバイリンガル検索、コンテンツ推奨、クロスリンガル文書解析に最適です。8,192 トークンを超える文書には、セマンティックチャンキングまたは Jina API 経由の `late_chunking パラメータを使用してください。モデルは主要なベクトルデータベースと RAG フレームワークと統合できます。スペイン語-英語を超える多言語カバレッジ、32K コンテキスト、タスク固有の最適化を必要とする新規プロジェクトには、jina-embeddings-v5-text-small` を推奨します。本番には CUDA 対応 GPU を推奨します。入力テキストはスペイン語または英語にしてください。混合言語入力はサポートされていますが、性能は 2 つの訓練言語用に最適化されています。




