E/A-Diagramm

Text

jina-embeddings-v2-base-en

Vektor

Pareto-Front
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxlParameter (log)nDCG@10
Dieses Modell
Auf der Front
Jina AI
Andere
MTEB English · retrieval
49.05
Parameter
137M
Rang nach Score
17 / 39
Pareto-Front
Dahinter
Werteverteilung
AUC 0.8376
Korpus
Übersetzungspaare
Dokumentensuche
0.8500.600.700.800.90
Verwandt26.9%
Hartes Negativ2.7%
Unverwandt1.1%
Empfohlene Schwellenwerte
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
ausgewogen · 0.762
AUC
0.8376
Rauschgrenze
0.893
Recall-Kante
0.691
Gemessene Paare
119 / 11k
Vektorkomponenten
-0.14-0.000.14
σ 0.0361 · 183k Werte
Einbettungsgeometrie
0768
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.751
Effektive Dim.
59 / 768
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)

Überblick

jina-embeddings-v2-base-en ist ein 137M-Parameter Englisch-Text-Embedding-Modell mit einem 8.192-Token-Kontextfenster — das 16-Fache der 512-Token-Grenze seiner Ära. Auf einem BERT-small-Backbone mit symmetrischer bidirektionaler ALiBi (Attention with Linear Biases) gebaut, war es das erste Open-Source-Jina-Embedding, das lange Dokumente nativ ohne Trunkierung oder Chunking verarbeitete. Es erzeugt 768-dimensionale Vektoren und bleibt eine solide Wahl für englisch-spezifisches Retrieval, bei dem mehrsprachige oder Langkontext-Funktionen von v3/v5 nicht benötigt werden.

Methoden

Die Architektur kombiniert einen BERT-small-Transformer (12 Schichten, 12 Attention-Heads, 768 verborgene Dimensionen) mit symmetrischen bidirektionalen ALiBi-Position-Encodings. ALiBi ersetzt erlernte Positions-Embeddings durch einen linear abfallenden Attention-Bias, wodurch das Modell weit über seine 512-Token-Trainingslänge hinaus bis zu 8.192 Tokens extrapolieren kann, ohne Performance-Verluste. Das Training folgte einer zweistufigen Pipeline: Pretraining auf C4, dann Feintuning auf Jinas kuratierte Sammlung von 40+ spezialisierten Satzpaar-Datensätzen mit Hard-Negative-Mining. Symmetrische bidirektionale Aufmerksamkeit stellt sicher, dass jedes Token sowohl auf vorangegangenen als auch folgenden Kontext achtet und Repräsentationen erzeugt, die globale Satzbedeutung erfassen. Mean-Pooling über alle Token-Repräsentationen erzeugt das finale 768-dimensionale Embedding.

Leistung

Bei der Veröffentlichung übertraf das Modell OpenAIs text-embedding-ada-002 auf mehreren MTEB-Englisch-Unteraufgaben: Klassifikation (73,45 % vs. 70,93 %), Reranking (85,38 % vs. 84,89 %), Retrieval (56,98 % vs. 56,32 %) und Zusammenfassung (31,6 % vs. 30,8 %). Sein 8.192-Token-Kontext war ein erheblicher Vorteil gegenüber konkurrierenden Modellen mit Begrenzung auf 512–2.048 Tokens und ermöglichte Dokument-Ebenen-Retrieval ohne Chunking. Der kompakte 307MB-Fußabdruck machte es auf Consumer-GPUs deploybar. Im Jahr 2026 übertrifft jina-embeddings-v5-text-small (677M Parameter, 32K-Kontext, task-spezifische LoRA-Adapter) es für die meisten Produktions-Workloads, aber es bleibt für leichte englisch-spezifische Pipelines relevant.

Anleitung

Verwenden Sie dieses Modell für englisch-spezifisches Retrieval, bei dem das 8K-Kontextfenster ausreicht und mehrsprachige oder task-spezifische Adapter nicht benötigt werden. Für Dokumente über 8.192 Tokens semantisches Chunking vor dem Embedding anwenden. Das Modell integriert sich mit großen Vektor-Datenbanken (Qdrant, Weaviate, MongoDB Atlas, Milvus) und RAG-Frameworks (LangChain, LlamaIndex, Haystack). Für neue Projekte mit mehrsprachiger Unterstützung, 32K-Kontext oder task-spezifischer Optimierung jina-embeddings-v5-text-small bevorzugen. CUDA-fähige GPU für Produktions-Durchsatz empfohlen; CPU-Inferenz ist möglich, aber deutlich langsamer.

Blogs, die dieses Modell erwähnen
Dezember 17, 2024 • 12 Minuten gelesen
Texteinbettungen erfassen die Wortreihenfolge nicht - und wie man das beheben kann
Texteinbettungsmodelle haben Schwierigkeiten damit, subtile sprachliche Nuancen wie Wortstellung, direktionale Beziehungen, zeitliche Abfolgen, kausale Zusammenhänge, Vergleiche und Verneinungen zu erfassen. Das Verständnis dieser Herausforderungen ist der Schlüssel zur Verbesserung der Modellleistung.
Oktober 25, 2024 • 19 Minuten gelesen
Optimale Umbruchpunkte in langen Dokumenten mit Small Language Models finden
Wir haben drei kleine Language Models trainiert, um lange Dokumente besser in Teilstücke zu segmentieren, und hier sind die wichtigsten Erkenntnisse, die wir dabei gewonnen haben.
Oktober 15, 2024 • 9 Minuten gelesen
Faktenprüfung mit der neuen Grounding API in Jina Reader
Mit dem neuen g.jina.ai können Sie ganz einfach Aussagen verifizieren, um LLM-Halluzinationen zu reduzieren oder die Integrität von menschlich verfasstem Content zu verbessern.
September 27, 2024 • 15 Minuten gelesen
Migration von Jina Embeddings v2 zu v3
Wir haben einige Tipps zusammengestellt, die Ihnen bei der Migration von Jina Embeddings v2 auf v3 helfen.
September 18, 2024 • 10 Minuten gelesen
Jina Embeddings v3: Ein wegweisendes mehrsprachiges Embedding-Modell
jina-embeddings-v3 ist ein wegweisendes mehrsprachiges Text-Embedding-Modell mit 570M Parametern und einer Token-Länge von 8192, das die neuesten proprietären Embeddings von OpenAI und Cohere bei MTEB übertrifft.