Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
Einbettungen
Qwen-Forschungslizenz
open_in_new Beitrag veröffentlichen

jina-embeddings-v4

Universelles Einbettungsmodell für multimodales und mehrsprachiges Retrieval
Lizenz
Qwen Research License
Veröffentlichungsdatum
calendar_month
2025-06-24
Eingang
abc
Text
image
Bild
picture_as_pdf
PDF
arrow_forward
Ausgabe
more_horiz
Vektor
apps
Multi-Vektor
Matryoshka-Dimensionen help_outline
128
256
512
1024
2048
Späte Chunking help_outline
check_circle
Yes
Modelldetails
Parameter: 3.8B
Länge des Eingabetokens: 32K
Eingabebildgröße: 768×28×28
Ausgabedimension: 2048
Basismodell help_outline
open_in_new
Qwen2.5-VL-3B-Instruct
Ausgebildete Sprachen help_outline
34 Sprachen
Unterstützte Sprachen help_outline
29 Sprachen
Quantisierungen help_outline
GGUF
Ähnliche Modelle
link
jina-embeddings-v3
link
jina-clip-v2
Unterstützte Aufgaben
search Abruf
compare_arrows Textabgleich
code Code
Erhältlich über
Jina-API
Hugging Face
Air-Gapped
E/A-Diagramm 1

Text

jina-embeddings-v4

Aufgabe

Vektor

E/A-Diagramm 2

Bild

jina-embeddings-v4

Aufgabe

Vektor

E/A-Diagramm 3

mehrere

Vektor

Text

jina-embeddings-v4

Aufgabe

E/A-Diagramm 4

mehrere

Vektor

Bild

jina-embeddings-v4

Aufgabe

Pareto fronthelp_outline
RTEB public
LongEmbed
CoIR
ViDoRe v1
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v4Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
LongEmbed
69.88
Parameters
3.8B
Rank by score
7 / 69
Pareto front
Behind it
Werteverteilunghelp_outline
AUC 0.8308
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Aufgabe
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
Verwandt6.7%
Hartes Negativ1.1%
Unverwandt0.8%
Empfohlene Schwellenwerte
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
ausgewogen · 0.618
AUC
0.8308
Rauschgrenze
0.877
Recall-Kante
0.516
Gemessene Paare
119 / 11k
Vektorkomponentenhelp_outline
-0.19-0.020.15
σ 0.0221 · 487k Werte
Einbettungsgeometriehelp_outline
02048
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.496
Effektive Dim.
73 / 2048
Dimensionskürzunghelp_outline
12825651210242048
text-matching · Schwellenwert nach angeforderten Dimensionen
Sprachpaarehelp_outline
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.069
Wählen Sie Modelle zum Vergleichen aus
Publikationen (2)
ICLR 2026
Januar 22, 2026
Embedding Compression via Spherical Coordinates
EMNLP 2025
Juni 24, 2025
jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval

Überblick

Jina Embeddings V4 ist ein multimodales Embedding-Modell mit 3,8 Milliarden Parametern, das eine einheitliche Text- und Bilddarstellung ermöglicht. Das Modell basiert auf dem Qwen2.5-VL-3B-Instruct-Backbone und bietet eine Architektur, die sowohl Einzelvektor- als auch Multivektor-Embeddings im Late-Interaction-Stil unterstützt und so die Einschränkungen herkömmlicher CLIP-basierter Dual-Encoder-Modelle behebt. Das Modell umfasst drei spezialisierte, aufgabenspezifische LoRA-Adapter (je 60 Millionen Parameter), die die Leistung in verschiedenen Retrieval-Szenarien optimieren, darunter asymmetrisches Query-Dokument-Retrieval, semantische Textähnlichkeit und Codesuche, ohne die eingefrorenen Backbone-Gewichte zu verändern. Das Modell zeigt eine starke Leistung bei der Verarbeitung visuell anspruchsvoller Inhalte wie Tabellen, Charts, Diagrammen, Screenshots und Mixed-Media-Formaten durch einen einheitlichen Verarbeitungspfad, der die in herkömmlichen Architekturen vorhandene Modalitätslücke reduziert. Das Modell unterstützt mehrsprachige Funktionen und kann Eingabetexte mit bis zu 32.768 Token und auf 20 Megapixel verkleinerten Bildern verarbeiten. Dadurch eignet es sich für verschiedene Anwendungen zur Dokumentsuche und modalübergreifenden Suche in verschiedenen Sprachen und Domänen.

Methoden

Jina Embeddings V4 implementiert eine einheitliche multimodale Sprachmodellarchitektur, die sich von CLIP-artigen Dual-Encoder-Ansätzen unterscheidet. Das Modell verarbeitet Eingaben über einen gemeinsamen Pfad, bei dem Bilder zunächst über einen Vision-Encoder in Token-Sequenzen umgewandelt werden. Anschließend werden Text- und Bildmodalitäten gemeinsam vom Sprachmodell-Decoder mit kontextuellen Aufmerksamkeitsebenen verarbeitet. Diese Architektur unterstützt zwei Ausgabemodi für unterschiedliche Anwendungsfälle: Einzelvektor-Embeddings, die 2048-dimensionale Vektoren erzeugen, die durch Matryoshka Representation Learning auf 128 Dimensionen kürzbar sind und durch Mean Pooling für eine effiziente Ähnlichkeitssuche generiert werden; und Multivektor-Embeddings, die über Projektionsebenen 128 Dimensionen pro Token für den Abruf im Stil der späten Interaktion ausgeben. Das Modell umfasst drei aufgabenspezifische LoRA-Adapter, die eine spezielle Optimierung ermöglichen: Der Retrieval-Adapter verwendet präfixbasierte asymmetrische Kodierung mit Hard-Negatives-Training für Abfrage-Dokument-Szenarien, der Text-Matching-Adapter nutzt CoSENT-Verlust für semantische Ähnlichkeitsaufgaben und der Code-Adapter konzentriert sich auf Anwendungen zur Umwandlung natürlicher Sprache in Code. Das Training erfolgt in zwei Phasen: anfängliches Paartraining mit kontrastivem InfoNCE-Verlust mit Text-Text- und Text-Bild-Paaren aus über 300 Quellen, gefolgt von einer aufgabenspezifischen Feinabstimmung der drei LoRA-Adapter mit Triplett-basierten Methoden und speziellen, auf die Anforderungen der jeweiligen Domäne zugeschnittenen Verlustfunktionen.

Leistung

Jina Embeddings V4 erzielt in mehreren Benchmark-Kategorien eine konkurrenzfähige Leistung. Beim visuellen Dokumentabruf erreicht es im JinaVDR-Benchmark durchschnittlich 72,19 Punkte gegenüber 64,50 Punkten für ColPali-v1.2 und im ViDoRe-Benchmark durchschnittlich 84,11 Punkte gegenüber 83,90 Punkten für ColPali. Der Multivektormodus erreicht im ViDoRe-Benchmark 90,17 Punkte. Beim kreuzmodalen Abruf erreicht das Modell im CLIP-Benchmark 84,11 Punkte gegenüber jina-clip-v2 (81,12) und nllb-clip-large-siglip (83,19). Bei Textabrufaufgaben erreicht es 55,97 Punkte für MTEB-en und 66,49 Punkte für MMTEB. Die bemerkenswerte Leistung bei der Verarbeitung langer Dokumente liegt bei 67,11 Punkten für LongEmbed gegenüber 55,66 Punkten für den Vorgänger. Das Modell zeigt eine solide Leistung hinsichtlich semantischer Textähnlichkeit mit 85,89 Punkten bei englischen STS-Aufgaben und 72,70 Punkten bei mehrsprachigen STS-Benchmarks. Die Code-Retrieval-Fähigkeiten erreichen 71,59 Punkte im CoIR-Benchmark, wobei spezialisierte Modelle wie voyage-code-3 (77,33) in diesem Bereich höhere Werte erzielen. Das Modell zeigt eine verbesserte modalübergreifende Ausrichtung mit einem Wert von 0,71 im Vergleich zu 0,15 bei OpenAI CLIP und behebt damit das Problem der Modalitätslücke in multimodalen Modellen. Der Multi-Vektor-Modus übertrifft den Single-Vektor-Modus bei visuell anspruchsvollen Aufgaben durchweg, während der Single-Vektor-Modus eine effiziente Leistung für Standard-Retrieval-Szenarien bietet.

Anleitung

Um Jina Embeddings V4 effektiv zu nutzen, wählen Sie den passenden LoRA-Adapter basierend auf Ihren spezifischen Anwendungsanforderungen. Verwenden Sie den „Retrieval“-Adapter für asymmetrische Abfrage-Dokument-Abrufszenarien, bei denen Abfragen und Dokumente unterschiedliche Strukturen aufweisen. Stellen Sie sicher, dass die richtigen Präfixe verwendet werden, um zwischen Abfrage- und Textinhalten zu unterscheiden. Der „Text-Matching“-Adapter eignet sich für semantische Ähnlichkeitsaufgaben und symmetrischen Abruf, bei dem es darum geht, ähnliche Inhalte statt Antworten auf Abfragen zu finden. Er eignet sich daher für Dokumentenclustering, Duplikaterkennung und Content-Empfehlungssysteme. Für programmierbezogene Anwendungen ist der „Code“-Adapter für den Abruf von natürlicher Sprache in Code, die Code-zu-Code-Ähnlichkeitssuche und die Beantwortung technischer Fragen optimiert. Wählen Sie Ausgabemodi basierend auf Ihren Leistungs- und Effizienzanforderungen: Einzelvektor-Einbettungen bieten eine effiziente Ähnlichkeitssuche und eignen sich für speicherbeschränkte Umgebungen. Dank kürzbarer Dimensionen ist eine Reduzierung von 2048 auf 128–512 Dimensionen mit akzeptablen Qualitätseinbußen möglich. Mehrvektor-Einbettungen bieten hingegen eine höhere Präzision für komplexe Abfrageaufgaben, insbesondere bei der Arbeit mit visuell anspruchsvollen Dokumenten, bei denen die Bewertung später Interaktionen detaillierte Beziehungen erfasst. Die einheitliche Architektur des Modells ermöglicht die Verarbeitung gemischter Text-Bild-Eingaben ohne separate Encoder oder OCR-Vorverarbeitung für visuelle Dokumente. Dank der modalübergreifenden Ausrichtung und der mehrsprachigen Unterstützung eignet sich das Modell für internationale Anwendungen. Berücksichtigen Sie bei der Planung des Speicherbedarfs für Produktionsbereitstellungen den 60-Mio.-Parameter-Overhead pro LoRA-Adapter. Beachten Sie, dass alle drei Adapter gleichzeitig mit weniger als 2 % zusätzlichem Speicherbedarf gewartet werden können, was einen flexiblen Taskwechsel während der Inferenz ermöglicht.
Blogs, die dieses Modell erwähnen
März 11, 2026 • 7 Minuten gelesen
Bootstrapping Audio Embeddings from Multimodal LLMs
Turn any multimodal LLM into a small audio embedding model that beats CLAP with 25x less data.
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
Februar 19, 2026 • 7 Minuten gelesen
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Two sub-1B multilingual embeddings with best-in-class performance, available on Elastic Inference Service, Llama.cpp and MLX.
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
September 09, 2025 • 11 Minuten gelesen
Multimodal Embeddings in Llama.cpp and GGUF
We brought multimodal embeddings to llama.cpp and GGUF, and uncovered a few surprising issues along the way.
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
September 04, 2025 • 6 Minuten gelesen
Jina Code Embeddings: SOTA Code Retrieval at 0.5B and 1.5B
Code generation LLMs → code embeddings: 0.5B/1.5B models achieve SOTA performance across 25 code retrieval benchmarks.
Jina AI
Green "Code Embeddings" text displayed in a LED dot style on a black background, evoking a futuristic and technological atmos
August 13, 2025 • 15 Minuten gelesen
Optimizing GGUFs for Decoder-Only Embedding Models
4000 tokens/sec for a 3B-parameter embedding model on L4 GPU is probably as fast as you'll get with llama.cpp. Or is it?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.