E/A-Diagramm

Text

jina-embeddings-v5-text-small

Aufgabe

Vektor

Pareto-Front
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v5-text…Parameter (log)nDCG@10
Dieses Modell
Auf der Front
Jina AI
Andere
MTEB English · retrieval
60.07
Parameter
596M
Rang nach Score
3 / 39
Pareto-Front
Dahinter
Werteverteilung
AUC 0.8269
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Aufgabe
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Verwandt10.9%
Hartes Negativ2.1%
Unverwandt0.9%
Empfohlene Schwellenwerte
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
ausgewogen · 0.697
AUC
0.8269
Rauschgrenze
0.855
Recall-Kante
0.566
Gemessene Paare
119 / 11k
Vektorkomponenten
-0.160.010.18
σ 0.0313 · 244k Werte
Einbettungsgeometrie
01024
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.300
Effektive Dim.
70 / 1024
Dimensionskürzung
32641282565121024
text-matching · Schwellenwert nach angeforderten Dimensionen
Sprachpaare
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.024
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)

Überblick

jina-embeddings-v5-text-small ist ein mehrsprachiges Text-Embedding-Modell mit 677M Parametern, aufgebaut auf dem Qwen3-0,6B-Base-Backbone. Es unterstützt einen 32K-Token-Kontext, erzeugt 1024-dimensionale Embeddings mit Matryoshka-Verkürzung bis hinab zu 32 Dimensionen und erreicht den höchsten MTEB-Durchschnitt aller Modelle mit unter 1B Parametern. Es ist das Standard-Embedding-Modell der Jina-API und die primäre Empfehlung für produktive RAG-Pipelines.

Methoden

Das Modell basiert auf Qwen3-0,6B-Base, einem mehrsprachigen Sprachmodell, das auf 119 Sprachen vortrainiert wurde. Es verwendet Last-Token-Pooling, um Embeddings zu erzeugen. Das Training folgt einem zweistufigen Regime: (1) Embedding-Destillation von Qwen3-Embedding-4B (einem 4B-Parameter-Lehrer) überträgt hochqualitative Embedding-Darstellungen auf den 677M-Schüler; (2) ein aufgaben-spezifischer kontrastiver Verlust feinabstimmt das Modell auf Retrieval-, Text-Matching-, Clustering- und Klassifikationsaufgaben. Geometric Orthogonal Regularization (GOR) stellt sicher, dass Embeddings unter binärer Quantisierung mit minimalem Leistungsverlust robust bleiben. Matryoshka Representation Learning ermöglicht das Kürzen der Dimensionen von 1024 auf 32 und bewahrt die starke Retrieval-Qualität bei über 256 Dimensionen. Das 32K-Kontextfenster wird über rotierte Positions-Embeddings mit justierten Basishäufigkeiten ermöglicht, und das Modell wurde zusätzlich auf Long-Context-Daten für robustes Long-Document-Retrieval trainiert.

Leistung

Auf MMTEB (mehrsprachig) erreicht das Modell 67,0 Durchschnitt (Task-Ebene) und 58,9 Durchschnitt (Typ-Ebene) — das höchste unter allen Modellen mit unter 1B Parametern. Task-Ebene-Punktzahlen: Klassifikation 71,3, Clustering 53,4, Pair-Klassifikation 82,9, Reranking 65,7, Retrieval 64,9, STS 78,9. Auf englischem MTEB erreicht es 71,7 Durchschnitt und übertrifft Qwen3-0,6B mit Instruktionen (70,5) und jina-embeddings-v3 (65,7). Retrieval-spezifisch: 64,88 auf MTEB-M, 66,84 auf RTEB, 56,67 auf BEIR, 66,39 auf LongEmbed. Bemerkenswert: Das Modell übertrifft seinen 4B-Lehrer Qwen3-Embedding-4B bei der Pair-Klassifikation (42,0 vs. 26,8 auf MMTEB), während es 6× kleiner ist — ein Nachweis, dass Destillation kombiniert mit aufgaben-spezifischem kontrastivem Training die Lehrer-Performance auf bestimmten Aufgaben übertreffen kann.

Anleitung

Wählen Sie den passenden LoRA-Adapter: 'retrieval' für asymmetrische Query-Dokument-Suche (Queries mit 'Query:', Passagen mit 'Document:' voranstellen), 'text-matching' für symmetrische Ähnlichkeit (beide Eingaben mit 'Document:'-Präfix), 'clustering' zur Gruppierung verwandter Dokumente, 'classification' für Kategorisierung und Sentiment-Analyse. Matryoshka-Verkürzung auf 256–512 Dimensionen eignet sich für speicherbeschränkte Indizes; nutzen Sie die vollen 1024 Dimensionen für Reranking. Binäre Quantisierung wird mit minimalem Leistungsverlust unterstützt. Das 32K-Kontextfenster verarbeitet lange Dokumente nativ ohne Chunking. Nutzen Sie Kosinus-Ähnlichkeit zum Vergleich von Embeddings. Verfügbar über die Jina AI API, Hugging Face (Sentence Transformers, vLLM) und quantisierte Varianten für llama.cpp. Für multimodale Workloads nutzen Sie stattdessen jina-embeddings-v5-omni-small.

Blogs, die dieses Modell erwähnen