E/A-Diagramm 1

Text

jina-embeddings-v4

Aufgabe

Vektor

E/A-Diagramm 2

Bild

jina-embeddings-v4

Aufgabe

Vektor

E/A-Diagramm 3

mehrere

Vektor

Text

jina-embeddings-v4

Aufgabe

E/A-Diagramm 4

mehrere

Vektor

Bild

jina-embeddings-v4

Aufgabe

Pareto-Front
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderjina-embeddings-v4Parameter (log)nDCG@10
Dieses Modell
Auf der Front
Jina AI
Andere
CoIR
71.59
Parameter
3.8B
Rang nach Score
2 / 31
Pareto-Front
Dahinter
Werteverteilung
AUC 0.8308
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Aufgabe
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
Verwandt6.7%
Hartes Negativ1.1%
Unverwandt0.8%
Empfohlene Schwellenwerte
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
ausgewogen · 0.618
AUC
0.8308
Rauschgrenze
0.877
Recall-Kante
0.516
Gemessene Paare
119 / 11k
Vektorkomponenten
-0.19-0.020.15
σ 0.0221 · 487k Werte
Einbettungsgeometrie
02048
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.496
Effektive Dim.
73 / 2048
Dimensionskürzung
12825651210242048
text-matching · Schwellenwert nach angeforderten Dimensionen
Sprachpaare
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.069
Wählen Sie Modelle zum Vergleichen aus
Publikationen (2)

Überblick

jina-embeddings-v4 ist ein multimodales Embedding-Modell mit 3,8B Parametern, das Text- und Bildrepräsentationen in einer einzigen Architektur vereint. Es unterstützt einzigartig sowohl Single-Vector- (dicht) als auch Multi-Vector- (Late-Interaction-/ColBERT-Stil) Ausgabe-Modi und ermöglicht Teams, Indexier-Effizienz gegen Abruf-Präzision abzuwägen, ohne das Modell zu wechseln. Das Modell erreicht State-of-the-Art-Performance bei visuell reichem Dokumentenretrieval und verarbeitet Tabellen, Diagramme, Grafiken und gemischte Medienformate nativ.

Methoden

Die Architektur kombiniert einen großen Transformer-Encoder-Backbone mit einem Qwen2.5-VL-basierten Vision-Encoder und verarbeitet Text (bis zu 32K Tokens) und Bilder (768×28×28 Patches) über geteilte Attention-Layer. Drei aufgabenspezifische LoRA-Adapter (je 60M Parameter) spezialisieren das Modell auf: asymmetrische Query-Dokumenten-Retrieval, semantische Textähnlichkeit und Code-Suche. Das Dual-Output-Design ist die Schlüsselinnovation: Das Modell kann einen einzelnen 2048-dimensionalen Dense-Vektor (für schnelles ANN-Indexing mit Matryoshka-Trunkierung auf 128 Dimensionen) oder eine Menge von 128-dimensionalen Token-Level-Vektoren für Late-Interaction-Scoring erzeugen. Das Training nutzte ein zweistufiges Curriculum: kontrastives Joint-Pretraining auf Text-Bild- und Text-Text-Paaren, gefolgt von aufgabenspezifischem LoRA-Adapter-Training. Late Chunking wird für Dokumente unterstützt, die das 32K-Token-Kontextfenster überschreiten. Die Qwen Research License gilt.

Leistung

Auf JinaVDR (Visual Document Retrieval) erzielt das Modell einen Durchschnitt von 72,19 gegenüber 64,50 für ColPali-v1.2. Auf ViDoRe erreicht es einen Durchschnitt von 84,11 (90,17 im Multi-Vector-Modus) gegenüber 83,90 für ColPali. Cross-Modal-Retrieval erreicht 84,11 auf dem CLIP-Benchmark und übertrifft jina-clip-v2 (81,12) und nllb-clip-large-siglip (83,19). Text-Retrieval-Scores: 55,97 auf MTEB-en, 66,49 auf MMTEB, 67,11 auf LongEmbed (gegenüber 55,66 für jina-embeddings-v3). Semantische Ähnlichkeit erreicht 85,89 auf English STS und 72,70 auf multilingualer STS. Code-Retrieval erreicht 71,59 auf CoIR. Die Cross-Modal-Ausrichtung erreicht 0,71 Kosinus-Ähnlichkeit (gegenüber 0,15 für OpenAI CLIP). Der Multi-Vector-Modus übertrifft den Single-Vector-Modus konsistent auf visuell reichen Aufgaben; der Single-Vector-Modus liefert effiziente Performance für standardmäßiges Text-Retrieval.

Anleitung

Wählen Sie den Ausgabe-Modus basierend auf Ihrer Pipeline: Single-Vector für großskaliges ANN-Indexing (Matryoshka-Trunkierung auf 128–512 Dimensionen verfügbar), Multi-Vector für das Re-Ranking von Top-k-Kandidaten auf visuell reichen Dokumenten. Wählen Sie den LoRA-Adapter über den API-Task-Parameter: 'retrieval' für Query-Dokumenten-Suche, 'text-matching' für semantische Ähnlichkeit, 'code' für Code-Retrieval. Für Dokumente über 32K Tokens nutzen Sie `late_chunking. Der 60M-Parameter-Overhead pro LoRA-Adapter ist vernachlässigbar (<2 % Speicherzuwachs) und alle drei Adapter können gleichzeitig geladen werden. Das Modell ist unter der Qwen Research License lizenziert (kommerzielle Nutzung ohne kommerzielle Lizenz nicht erlaubt). Für Produktions-Deployments nutzen Sie CUDA-fähige GPUs; das Modell ist über Jina API, AWS, Azure und GCP-Marktplätze verfügbar. Für rein textbasierte Workloads bietet jina-embeddings-v5-text-small` bessere Genauigkeit pro Parameter zu einem Bruchteil der Rechenkosten.

Blogs, die dieses Modell erwähnen