I/O 図

テキスト

jina-embeddings-v2-base-es

ベクター

パレートフロン
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…パラメータ数(対数)Spearman
このモデル
フロン上
Jina AI
その他
MTEB English · sts
83.50
パラメータ
161M
スコア順位
11 / 39
パレートフロン
フロン上
値の分布
AUC 0.8383
コーパス
翻訳ペア
ドキュメント検索
0.6830.000.200.400.600.80
関連17.6%
ハードネガティブ3.0%
無関連0.8%
推奨しきい値
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
バランス · 0.365
AUC
0.8383
ノイズ上限
0.774
再現率の崖
0.163
測定ペア数
119 / 11k
ベクトル成分
-0.160.000.17
σ 0.0361 · 183k 個の値
埋め込みの幾何
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.326
実効次元数
51 / 768
言語ペア
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき:0.315
比較するモデルを選択してください
論文 (1)

概要

jina-embeddings-v2-base-es はスペイン語・英語の 161M パラメータのバイリンガルテキスト埋め込みモデルで、8,192 トークンのコンテキストウィンドウと 768 次元の出力を備えます。スペイン語圏市場のクロスリンガル検索のために設計され、意味的に等価なスペイン語・英語コンテンツを共有埋め込み空間にマッピングします。モデルは重要なギャップに対応しています:当時、ほとんどの埋め込みモデルは英語中心で、スペイン語の性能が大幅に低下していました。

方法

モデルは対称双方向 ALiBi 位置エンコーディングを備えた BERT ベースのバックボーン、161M パラメータ、768 次元の出力空間を使用します。訓練は 3 段階のプロセスに従いました:(1) スペイン語-英語平行コーパスでの事前学習、(2) キュレーション済み文ペアでの困難負サンプルマイニングを伴う対比ファインチューニング、(3) 同じ概念のスペイン語・英語表現がまとまってクラスタリングされることを保証するクロスリンガルアラインメント。ALiBi メカニズムにより、学習済み位置埋め込みなしで 8,192 トークンのコンテキストが可能となり、モデルは 512 トークンの訓練長を超えて外挿できます。平均プーリングが最終的な埋め込みベクトルを生成します。

パフォーマンス

モデルは、それらのサイズの 15–30% しかなくながら、はるかに大きな多言語モデル(E5、BGE-M3)をスペイン語-英語検索タスクで上回りました。MTEB スペイン語サブタスク、特に検索とクラスタリングで強い性能を示しました。8,192 トークンのコンテキストウィンドウにより、多くの競合モデルがチャンキングを要した複数ページ文書で一貫した性能を発揮しました。2026 年、jina-embeddings-v5-text-small が 89 言語、32K コンテキスト、タスク固有 LoRA アダプタを提供し、このモデルに取って代わります。v2-base-es モデルは、専用スペイン語-英語パイプラインのコスト効率の良い選択肢のままです。

ベストプラクティス

スペイン語-英語のバイリンガル検索、コンテンツ推奨、クロスリンガル文書解析に最適です。8,192 トークンを超える文書には、セマンティックチャンキングまたは Jina API 経由の `late_chunking パラメータを使用してください。モデルは主要なベクトルデータベースと RAG フレームワークと統合できます。スペイン語-英語を超える多言語カバレッジ、32K コンテキスト、タスク固有の最適化を必要とする新規プロジェクトには、jina-embeddings-v5-text-small` を推奨します。本番には CUDA 対応 GPU を推奨します。入力テキストはスペイン語または英語にしてください。混合言語入力はサポートされていますが、性能は 2 つの訓練言語用に最適化されています。

このモデルについて言及しているブログ