Überblick
jina-embeddings-v5-text-small ist ein mehrsprachiges Text-Embedding-Modell mit 677M Parametern, aufgebaut auf dem Qwen3-0,6B-Base-Backbone. Es unterstützt einen 32K-Token-Kontext, erzeugt 1024-dimensionale Embeddings mit Matryoshka-Verkürzung bis hinab zu 32 Dimensionen und erreicht den höchsten MTEB-Durchschnitt aller Modelle mit unter 1B Parametern. Es ist das Standard-Embedding-Modell der Jina-API und die primäre Empfehlung für produktive RAG-Pipelines.
Methoden
Das Modell basiert auf Qwen3-0,6B-Base, einem mehrsprachigen Sprachmodell, das auf 119 Sprachen vortrainiert wurde. Es verwendet Last-Token-Pooling, um Embeddings zu erzeugen. Das Training folgt einem zweistufigen Regime: (1) Embedding-Destillation von Qwen3-Embedding-4B (einem 4B-Parameter-Lehrer) überträgt hochqualitative Embedding-Darstellungen auf den 677M-Schüler; (2) ein aufgaben-spezifischer kontrastiver Verlust feinabstimmt das Modell auf Retrieval-, Text-Matching-, Clustering- und Klassifikationsaufgaben. Geometric Orthogonal Regularization (GOR) stellt sicher, dass Embeddings unter binärer Quantisierung mit minimalem Leistungsverlust robust bleiben. Matryoshka Representation Learning ermöglicht das Kürzen der Dimensionen von 1024 auf 32 und bewahrt die starke Retrieval-Qualität bei über 256 Dimensionen. Das 32K-Kontextfenster wird über rotierte Positions-Embeddings mit justierten Basishäufigkeiten ermöglicht, und das Modell wurde zusätzlich auf Long-Context-Daten für robustes Long-Document-Retrieval trainiert.
Leistung
Auf MMTEB (mehrsprachig) erreicht das Modell 67,0 Durchschnitt (Task-Ebene) und 58,9 Durchschnitt (Typ-Ebene) — das höchste unter allen Modellen mit unter 1B Parametern. Task-Ebene-Punktzahlen: Klassifikation 71,3, Clustering 53,4, Pair-Klassifikation 82,9, Reranking 65,7, Retrieval 64,9, STS 78,9. Auf englischem MTEB erreicht es 71,7 Durchschnitt und übertrifft Qwen3-0,6B mit Instruktionen (70,5) und jina-embeddings-v3 (65,7). Retrieval-spezifisch: 64,88 auf MTEB-M, 66,84 auf RTEB, 56,67 auf BEIR, 66,39 auf LongEmbed. Bemerkenswert: Das Modell übertrifft seinen 4B-Lehrer Qwen3-Embedding-4B bei der Pair-Klassifikation (42,0 vs. 26,8 auf MMTEB), während es 6× kleiner ist — ein Nachweis, dass Destillation kombiniert mit aufgaben-spezifischem kontrastivem Training die Lehrer-Performance auf bestimmten Aufgaben übertreffen kann.
Anleitung
Wählen Sie den passenden LoRA-Adapter: 'retrieval' für asymmetrische Query-Dokument-Suche (Queries mit 'Query:', Passagen mit 'Document:' voranstellen), 'text-matching' für symmetrische Ähnlichkeit (beide Eingaben mit 'Document:'-Präfix), 'clustering' zur Gruppierung verwandter Dokumente, 'classification' für Kategorisierung und Sentiment-Analyse. Matryoshka-Verkürzung auf 256–512 Dimensionen eignet sich für speicherbeschränkte Indizes; nutzen Sie die vollen 1024 Dimensionen für Reranking. Binäre Quantisierung wird mit minimalem Leistungsverlust unterstützt. Das 32K-Kontextfenster verarbeitet lange Dokumente nativ ohne Chunking. Nutzen Sie Kosinus-Ähnlichkeit zum Vergleich von Embeddings. Verfügbar über die Jina AI API, Hugging Face (Sentence Transformers, vLLM) und quantisierte Varianten für llama.cpp. Für multimodale Workloads nutzen Sie stattdessen jina-embeddings-v5-omni-small.






