E/A-Diagramm

Text

jina-embedding-b-en-v1

Vektor

Pareto-Front
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Parameter (log)Spearman
Dieses Modell
Auf der Front
Jina AI
Andere
MTEB English · sts
79.93
Parameter
110M
Rang nach Score
28 / 39
Pareto-Front
Dahinter
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)

Überblick

jina-embedding-b-en-v1 war Jinas erstes öffentlich veröffentlichtes Text-Embedding-Modell: ein 110M-Parameter bidirektionaler Encoder, der englischen Text in 768-dimensionale Vektoren abbildet. Es wurde für semantische Suche, Ähnlichkeitsvergleiche und Inhalts-Empfehlungen zu einer Zeit entworfen, in der 512-Token-Kontexte der Industriestandard waren, und etablierte Jinas Einstieg in den Open-Source-Embedding-Bereich. Das Modell ist jetzt Legacy und wurde von den v2- und v3-Familien überholt, die 8K+-Token-Kontexte und mehrsprachige Eingabe unterstützen.

Methoden

Das Modell verwendet eine T5-Encoder-Architektur mit Mean-Pooling, um festlängige 768-dimensionale Repräsentationen zu erzeugen. Das Training folgte einem zwei-phasischen kontrastiven Rezept auf dem Linnaeus-Clean-Datensatz (385M Satzpaare, gefiltert aus 1,6B Kandidaten): zuerst InfoNCE-Loss auf positiven Textpaaren zum Lernen der semantischen Ausrichtung; zweitens Triplet-Loss zur Schärfung der Diskriminierung zwischen ähnlichen, aber semantisch unterschiedlichen Texten. Eine zentrale Designentscheidung war die Mean-Pooling-Strategie, die Repräsentationen auf Token-Ebene zu einem einzigen Vektor durchschnittet, der globale Satzbedeutung erfasst. Das 512-Token-Kontextfenster war für seine Ära Standard, begrenzt aber den Nutzen des Modells für Langdokument-Anwendungen.

Leistung

Auf STS12 erreichte das Modell einen Korrelationswert von 0,751 und übertraf bei der Veröffentlichung all-mpnet-base-v2 und all-minilm-l6-v2. Es zeigte starke Performance über Standard-Englisch-Satz-Embedding-Aufgaben und behielt dabei schnelle, für die Produktion geeignete Inferenzeiten. Sein 512-Token-Kontextfenster und der nur-englische Fokus machten es für die Langdokument- und mehrsprachigen Workloads ungeeignet, die bis 2025 Standard wurden. Das Modell wurde durch jina-embeddings-v2-base-en (8K-Kontext, bidirektionales ALiBi) und jina-embeddings-v3 (570M Parameter, 89 Sprachen, task-spezifische LoRA-Adapter) ersetzt.

Anleitung

Dieses Modell ist Legacy und sollte nicht für neue Projekte verwendet werden. Beim Migrationsweg von jina-embedding-b-en-v1 auf jina-embeddings-v5-text-small für aktuelle Workloads aktualisieren — es unterstützt 32K-Token-Kontext, 89 Sprachen und task-spezifische LoRA-Adapter. Für code-spezifische Embedding-Bedarfe jina-code-embeddings-1.5b verwenden. Das Modell benötigt CUDA-fähige Hardware für optimale Performance und akzeptiert Eingaben bis zu 512 Tokens. Es ist nicht für mehrsprachige Inhalte, lange Dokumente oder code-zentrierte Anwendungen geeignet.