Überblick
jina-embeddings-v2-base-en ist ein 137M-Parameter Englisch-Text-Embedding-Modell mit einem 8.192-Token-Kontextfenster — das 16-Fache der 512-Token-Grenze seiner Ära. Auf einem BERT-small-Backbone mit symmetrischer bidirektionaler ALiBi (Attention with Linear Biases) gebaut, war es das erste Open-Source-Jina-Embedding, das lange Dokumente nativ ohne Trunkierung oder Chunking verarbeitete. Es erzeugt 768-dimensionale Vektoren und bleibt eine solide Wahl für englisch-spezifisches Retrieval, bei dem mehrsprachige oder Langkontext-Funktionen von v3/v5 nicht benötigt werden.
Methoden
Die Architektur kombiniert einen BERT-small-Transformer (12 Schichten, 12 Attention-Heads, 768 verborgene Dimensionen) mit symmetrischen bidirektionalen ALiBi-Position-Encodings. ALiBi ersetzt erlernte Positions-Embeddings durch einen linear abfallenden Attention-Bias, wodurch das Modell weit über seine 512-Token-Trainingslänge hinaus bis zu 8.192 Tokens extrapolieren kann, ohne Performance-Verluste. Das Training folgte einer zweistufigen Pipeline: Pretraining auf C4, dann Feintuning auf Jinas kuratierte Sammlung von 40+ spezialisierten Satzpaar-Datensätzen mit Hard-Negative-Mining. Symmetrische bidirektionale Aufmerksamkeit stellt sicher, dass jedes Token sowohl auf vorangegangenen als auch folgenden Kontext achtet und Repräsentationen erzeugt, die globale Satzbedeutung erfassen. Mean-Pooling über alle Token-Repräsentationen erzeugt das finale 768-dimensionale Embedding.
Leistung
Bei der Veröffentlichung übertraf das Modell OpenAIs text-embedding-ada-002 auf mehreren MTEB-Englisch-Unteraufgaben: Klassifikation (73,45 % vs. 70,93 %), Reranking (85,38 % vs. 84,89 %), Retrieval (56,98 % vs. 56,32 %) und Zusammenfassung (31,6 % vs. 30,8 %). Sein 8.192-Token-Kontext war ein erheblicher Vorteil gegenüber konkurrierenden Modellen mit Begrenzung auf 512–2.048 Tokens und ermöglichte Dokument-Ebenen-Retrieval ohne Chunking. Der kompakte 307MB-Fußabdruck machte es auf Consumer-GPUs deploybar. Im Jahr 2026 übertrifft jina-embeddings-v5-text-small (677M Parameter, 32K-Kontext, task-spezifische LoRA-Adapter) es für die meisten Produktions-Workloads, aber es bleibt für leichte englisch-spezifische Pipelines relevant.
Anleitung
Verwenden Sie dieses Modell für englisch-spezifisches Retrieval, bei dem das 8K-Kontextfenster ausreicht und mehrsprachige oder task-spezifische Adapter nicht benötigt werden. Für Dokumente über 8.192 Tokens semantisches Chunking vor dem Embedding anwenden. Das Modell integriert sich mit großen Vektor-Datenbanken (Qdrant, Weaviate, MongoDB Atlas, Milvus) und RAG-Frameworks (LangChain, LlamaIndex, Haystack). Für neue Projekte mit mehrsprachiger Unterstützung, 32K-Kontext oder task-spezifischer Optimierung jina-embeddings-v5-text-small bevorzugen. CUDA-fähige GPU für Produktions-Durchsatz empfohlen; CPU-Inferenz ist möglich, aber deutlich langsamer.










