Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumentation
Einloggen
login
Einbettungen
Qwen-Forschungslizenz
open_in_new Release-Post

jina-embeddings-v4

Universelles Einbettungsmodell für multimodales und mehrsprachiges Retrieval
Lizenz
Qwen Research License
Veröffentlichungsdatum
calendar_month
2025-06-24
Eingabe
abc
Text
image
Bild
picture_as_pdf
PDF
arrow_forward
Ausgabe
more_horiz
Vektor
apps
Multi-Vektor
Matryoshka-Dimensionen help_outline
128
256
512
1024
2048
Spätes Chunking help_outline
check_circle
Yes
Modelldetails
Parameter: 3.8B
Länge des Eingabetokens: 32K
Eingabebildgröße: 768×28×28
Ausgabedimension: 2048
Basismodell help_outline
open_in_new
Qwen2.5-VL-3B-Instruct
Ausgebildete Sprachen help_outline
34 Sprachen
Unterstützte Sprachen help_outline
29 Sprachen
Quantisierungen help_outline
GGUF
Ähnliche Modelle
link
jina-embeddings-v3
link
jina-clip-v2
Unterstützte Aufgaben
search Retrieval
compare_arrows Text-Matching
code Code
Erhältlich über
Jina-API
Hugging Face
Air-Gapped
E/A-Diagramm 1

Text

jina-embeddings-v4

Aufgabe

Vektor

E/A-Diagramm 2

Bild

jina-embeddings-v4

Aufgabe

Vektor

E/A-Diagramm 3

mehrere

Vektor

Text

jina-embeddings-v4

Aufgabe

E/A-Diagramm 4

mehrere

Vektor

Bild

jina-embeddings-v4

Aufgabe

Pareto-Front help_outline
workspace_premium
RTEB public
LongEmbed
CoIR
ViDoRe v1
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderjina-embeddings-v4Parameter (log)nDCG@10
Dieses Modell
Auf der Front
Jina AI
Andere
CoIR
71.59
Parameter
3.8B
Rang nach Score
2 / 31
Pareto-Front
Dahinter
Werteverteilunghelp_outline
AUC 0.8308
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Aufgabe
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
Verwandt6.7%
Hartes Negativ1.1%
Unverwandt0.8%
Empfohlene Schwellenwerte
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
ausgewogen · 0.618
AUC
0.8308
Rauschgrenze
0.877
Recall-Kante
0.516
Gemessene Paare
119 / 11k
Vektorkomponentenhelp_outline
-0.19-0.020.15
σ 0.0221 · 487k Werte
Einbettungsgeometriehelp_outline
02048
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.496
Effektive Dim.
73 / 2048
Dimensionskürzunghelp_outline
12825651210242048
text-matching · Schwellenwert nach angeforderten Dimensionen
Sprachpaarehelp_outline
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.069
Wählen Sie Modelle zum Vergleichen aus
Publikationen (2)
ICLR 2026
Januar 22, 2026
Embedding Compression via Spherical Coordinates
EMNLP 2025
Juni 24, 2025
jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval

Überblick

jina-embeddings-v4 ist ein multimodales Embedding-Modell mit 3,8B Parametern, das Text- und Bildrepräsentationen in einer einzigen Architektur vereint. Es unterstützt einzigartig sowohl Single-Vector- (dicht) als auch Multi-Vector- (Late-Interaction-/ColBERT-Stil) Ausgabe-Modi und ermöglicht Teams, Indexier-Effizienz gegen Abruf-Präzision abzuwägen, ohne das Modell zu wechseln. Das Modell erreicht State-of-the-Art-Performance bei visuell reichem Dokumentenretrieval und verarbeitet Tabellen, Diagramme, Grafiken und gemischte Medienformate nativ.

Methoden

Die Architektur kombiniert einen großen Transformer-Encoder-Backbone mit einem Qwen2.5-VL-basierten Vision-Encoder und verarbeitet Text (bis zu 32K Tokens) und Bilder (768×28×28 Patches) über geteilte Attention-Layer. Drei aufgabenspezifische LoRA-Adapter (je 60M Parameter) spezialisieren das Modell auf: asymmetrische Query-Dokumenten-Retrieval, semantische Textähnlichkeit und Code-Suche. Das Dual-Output-Design ist die Schlüsselinnovation: Das Modell kann einen einzelnen 2048-dimensionalen Dense-Vektor (für schnelles ANN-Indexing mit Matryoshka-Trunkierung auf 128 Dimensionen) oder eine Menge von 128-dimensionalen Token-Level-Vektoren für Late-Interaction-Scoring erzeugen. Das Training nutzte ein zweistufiges Curriculum: kontrastives Joint-Pretraining auf Text-Bild- und Text-Text-Paaren, gefolgt von aufgabenspezifischem LoRA-Adapter-Training. Late Chunking wird für Dokumente unterstützt, die das 32K-Token-Kontextfenster überschreiten. Die Qwen Research License gilt.

Leistung

Auf JinaVDR (Visual Document Retrieval) erzielt das Modell einen Durchschnitt von 72,19 gegenüber 64,50 für ColPali-v1.2. Auf ViDoRe erreicht es einen Durchschnitt von 84,11 (90,17 im Multi-Vector-Modus) gegenüber 83,90 für ColPali. Cross-Modal-Retrieval erreicht 84,11 auf dem CLIP-Benchmark und übertrifft jina-clip-v2 (81,12) und nllb-clip-large-siglip (83,19). Text-Retrieval-Scores: 55,97 auf MTEB-en, 66,49 auf MMTEB, 67,11 auf LongEmbed (gegenüber 55,66 für jina-embeddings-v3). Semantische Ähnlichkeit erreicht 85,89 auf English STS und 72,70 auf multilingualer STS. Code-Retrieval erreicht 71,59 auf CoIR. Die Cross-Modal-Ausrichtung erreicht 0,71 Kosinus-Ähnlichkeit (gegenüber 0,15 für OpenAI CLIP). Der Multi-Vector-Modus übertrifft den Single-Vector-Modus konsistent auf visuell reichen Aufgaben; der Single-Vector-Modus liefert effiziente Performance für standardmäßiges Text-Retrieval.

Anleitung

Wählen Sie den Ausgabe-Modus basierend auf Ihrer Pipeline: Single-Vector für großskaliges ANN-Indexing (Matryoshka-Trunkierung auf 128–512 Dimensionen verfügbar), Multi-Vector für das Re-Ranking von Top-k-Kandidaten auf visuell reichen Dokumenten. Wählen Sie den LoRA-Adapter über den API-Task-Parameter: 'retrieval' für Query-Dokumenten-Suche, 'text-matching' für semantische Ähnlichkeit, 'code' für Code-Retrieval. Für Dokumente über 32K Tokens nutzen Sie `late_chunking. Der 60M-Parameter-Overhead pro LoRA-Adapter ist vernachlässigbar (<2 % Speicherzuwachs) und alle drei Adapter können gleichzeitig geladen werden. Das Modell ist unter der Qwen Research License lizenziert (kommerzielle Nutzung ohne kommerzielle Lizenz nicht erlaubt). Für Produktions-Deployments nutzen Sie CUDA-fähige GPUs; das Modell ist über Jina API, AWS, Azure und GCP-Marktplätze verfügbar. Für rein textbasierte Workloads bietet jina-embeddings-v5-text-small` bessere Genauigkeit pro Parameter zu einem Bruchteil der Rechenkosten.

Blogs, die dieses Modell erwähnen
März 11, 2026 • 7 Minuten gelesen
Bootstrapping von Audio-Embeddings aus multimodalen LLMs
Verwandeln Sie jedes multimodale LLM in ein kleines Audio-Embedding-Modell, das CLAP mit 25-mal weniger Daten übertrifft.
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
Februar 19, 2026 • 7 Minuten gelesen
jina-embeddings-v3-text: Neue SOTA kleine mehrsprachige Embeddings
Zwei mehrsprachige Embeddings mit weniger als 1 Milliarde Parametern und erstklassiger Leistung, verfügbar für Elastic Inference Service, Llama.cpp und MLX.
Jina AI
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
September 09, 2025 • 11 Minuten gelesen
Multimodale Vektormodelle in Llama.cpp und GGUF
Wir haben multimodale VektorModelle zu llama.cpp und GGUF gebracht und dabei einige überraschende Probleme aufgedeckt.
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
September 04, 2025 • 6 Minuten gelesen
Jina Code Embeddings: SOTA Code Retrieval bei 0.5B und 1.5B
Code generierende LLMs → Code-Vektor-Modelle: 0,5B/1,5B Modelle erzielen SOTA-Performance über 25 Code-Retrieval-Benchmarks hinweg.
Jina AI
Green "Code Embeddings" text displayed in a LED dot style on a black background, evoking a futuristic and technological atmos
August 13, 2025 • 15 Minuten gelesen
GGUFs für Decoder-Only 向量模型 optimieren
4000 Tokens/Sekunde für ein 3B-Parameter-Vektor-Modell auf einer L4-GPU ist wahrscheinlich das Schnellste, was man mit llama.cpp erreichen kann. Oder etwa nicht?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Neuigkeiten
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.