E/A-Diagramm

Text

jina-embeddings-v2-base-es

Vektor

Pareto-Front
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parameter (log)Spearman
Dieses Modell
Auf der Front
Jina AI
Andere
MTEB English · sts
83.50
Parameter
161M
Rang nach Score
11 / 39
Pareto-Front
Darauf
Werteverteilung
AUC 0.8383
Korpus
Übersetzungspaare
Dokumentensuche
0.6830.000.200.400.600.80
Verwandt17.6%
Hartes Negativ3.0%
Unverwandt0.8%
Empfohlene Schwellenwerte
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
ausgewogen · 0.365
AUC
0.8383
Rauschgrenze
0.774
Recall-Kante
0.163
Gemessene Paare
119 / 11k
Vektorkomponenten
-0.160.000.17
σ 0.0361 · 183k Werte
Einbettungsgeometrie
0768
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.326
Effektive Dim.
51 / 768
Sprachpaare
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.315
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)

Überblick

jina-embeddings-v2-base-es ist ein 161M-Parameter zweisprachiges Text-Embedding-Modell für Spanisch und Englisch mit einem 8.192-Token-Kontextfenster und 768-dimensionalem Output. Es wurde für cross-sprachliches Retrieval auf spanischsprachigen Märkten entworfen und bildet semantisch äquivalente spanische und englische Inhalte in einen gemeinsamen Embedding-Raum ab. Das Modell adressiert eine kritische Lücke: die meisten Embedding-Modelle seiner Zeit waren englisch-zentriert, mit signifikant degradierter spanischer Performance.

Methoden

Das Modell verwendet einen BERT-basierten Backbone mit symmetrischen bidirektionalen ALiBi-Position-Encodings, 161M Parametern und einem 768-dimensionalen Output-Raum. Das Training folgte einem dreistufigen Prozess: (1) Pretraining auf spanisch-englischen Parallel-Korpora, (2) kontrastives Feintuning mit Hard-Negative-Mining auf kuratierten Satzpaaren und (3) cross-linguales Alignement, um sicherzustellen, dass Spanisch- und Englisch-Repräsentationen desselben Konzepts zusammen clustern. Der ALiBi-Mechanismus ermöglicht das 8.192-Token-Kontextfenster ohne erlernte Positions-Embeddings und erlaubt dem Modell, über seine 512-Token-Trainingslänge hinaus zu extrapolieren. Mean-Pooling erzeugt den finalen Embedding-Vektor.

Leistung

Das Modell übertraf signifikant größere mehrsprachige Modelle (E5, BGE-M3) in spanisch-englischen Retrieval-Aufgaben, während es nur 15–30 % ihrer Größe war. Es zeigte starke Performance auf MTEB-Spanisch-Unteraufgaben, insbesondere bei Retrieval und Clustering. Das 8.192-Token-Kontextfenster lieferte konsistente Performance auf mehrseitigen Dokumenten, bei denen die meisten konkurrierenden Modelle Chunking erforderten. Im Jahr 2026 ersetzt jina-embeddings-v5-text-small dieses Modell und bietet 89 Sprachen, 32K-Kontext und task-spezifische LoRA-Adapter. Das v2-base-es-Modell bleibt eine kostengünstige Option für dedizierte Spanisch-Englisch-Pipelines.

Anleitung

Ideal für spanisch-englische Zweisprach-Suche, Inhalts-Empfehlungen und cross-sprachliche Dokumentanalyse. Für Dokumente über 8.192 Tokens semantisches Chunking oder den `late_chunking-Parameter über die Jina-API verwenden. Das Modell integriert sich mit großen Vektor-Datenbanken und RAG-Frameworks. Für neue Projekte, die mehrsprachige Abdeckung jenseits von Spanisch-Englisch, 32K-Kontext oder task-spezifische Optimierung erfordern, jina-embeddings-v5-text-small` bevorzugen. CUDA-fähige GPU für Produktion empfohlen. Die Eingabe sollte auf Spanisch oder Englisch sein; gemischtsprachige Eingabe wird unterstützt, die Performance ist aber für die zwei trainierten Sprachen optimiert.

Blogs, die dieses Modell erwähnen