Überblick
jina-embedding-b-en-v1 war Jinas erstes öffentlich veröffentlichtes Text-Embedding-Modell: ein 110M-Parameter bidirektionaler Encoder, der englischen Text in 768-dimensionale Vektoren abbildet. Es wurde für semantische Suche, Ähnlichkeitsvergleiche und Inhalts-Empfehlungen zu einer Zeit entworfen, in der 512-Token-Kontexte der Industriestandard waren, und etablierte Jinas Einstieg in den Open-Source-Embedding-Bereich. Das Modell ist jetzt Legacy und wurde von den v2- und v3-Familien überholt, die 8K+-Token-Kontexte und mehrsprachige Eingabe unterstützen.
Methoden
Das Modell verwendet eine T5-Encoder-Architektur mit Mean-Pooling, um festlängige 768-dimensionale Repräsentationen zu erzeugen. Das Training folgte einem zwei-phasischen kontrastiven Rezept auf dem Linnaeus-Clean-Datensatz (385M Satzpaare, gefiltert aus 1,6B Kandidaten): zuerst InfoNCE-Loss auf positiven Textpaaren zum Lernen der semantischen Ausrichtung; zweitens Triplet-Loss zur Schärfung der Diskriminierung zwischen ähnlichen, aber semantisch unterschiedlichen Texten. Eine zentrale Designentscheidung war die Mean-Pooling-Strategie, die Repräsentationen auf Token-Ebene zu einem einzigen Vektor durchschnittet, der globale Satzbedeutung erfasst. Das 512-Token-Kontextfenster war für seine Ära Standard, begrenzt aber den Nutzen des Modells für Langdokument-Anwendungen.
Leistung
Auf STS12 erreichte das Modell einen Korrelationswert von 0,751 und übertraf bei der Veröffentlichung all-mpnet-base-v2 und all-minilm-l6-v2. Es zeigte starke Performance über Standard-Englisch-Satz-Embedding-Aufgaben und behielt dabei schnelle, für die Produktion geeignete Inferenzeiten. Sein 512-Token-Kontextfenster und der nur-englische Fokus machten es für die Langdokument- und mehrsprachigen Workloads ungeeignet, die bis 2025 Standard wurden. Das Modell wurde durch jina-embeddings-v2-base-en (8K-Kontext, bidirektionales ALiBi) und jina-embeddings-v3 (570M Parameter, 89 Sprachen, task-spezifische LoRA-Adapter) ersetzt.
Anleitung
Dieses Modell ist Legacy und sollte nicht für neue Projekte verwendet werden. Beim Migrationsweg von jina-embedding-b-en-v1 auf jina-embeddings-v5-text-small für aktuelle Workloads aktualisieren — es unterstützt 32K-Token-Kontext, 89 Sprachen und task-spezifische LoRA-Adapter. Für code-spezifische Embedding-Bedarfe jina-code-embeddings-1.5b verwenden. Das Modell benötigt CUDA-fähige Hardware für optimale Performance und akzeptiert Eingaben bis zu 512 Tokens. Es ist nicht für mehrsprachige Inhalte, lange Dokumente oder code-zentrierte Anwendungen geeignet.
