E/A-Diagramm 1

Text

jina-clip-v2

Vektor

E/A-Diagramm 2

Bild

jina-clip-v2

Vektor

Pareto-Front
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2Parameter (log)i2t-recall@5
Dieses Modell
Auf der Front
Jina AI
Andere
CLIP Benchmark
89.73
Parameter
865M
Rang nach Score
34 / 56
Pareto-Front
Dahinter
Werteverteilung
AUC 0.8383
Korpus
Übersetzungspaare
Dokumentensuche
Bild / Banner
Bild / Logo
Aufgabe
default
retrieval.query
0.6040.000.200.400.60
Verwandt20.2%
Hartes Negativ3.6%
Unverwandt0.8%
Empfohlene Schwellenwerte
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
ausgewogen · 0.403
AUC
0.8383
Rauschgrenze
0.666
Recall-Kante
0.224
Gemessene Paare
119 / 11k
Vektorkomponenten
-0.43-0.070.29
σ 0.0313 · 244k Werte
Einbettungsgeometrie
01024
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.420
Effektive Dim.
52 / 1024
Sprachpaare
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.064
Wählen Sie Modelle zum Vergleichen aus
Publikationen (2)

Überblick

jina-clip-v2 ist ein mehrsprachiges multimodales Embedding-Modell mit 865M Parametern, das 89 Sprachen und 512×512-Bildeingaben unterstützt. Es erweitert jina-clip-v1 um cross-linguale Bild-Text-Ausrichtung, Matryoshka-Repräsentationslernen zur Dimensionsreduzierung (1024→64) und verbesserte Performance bei visuell reichen Dokumenten. Es erreicht state-of-the-art cross-linguales Bild-Retrieval und hält dabei starke Performance im reinen Text-Retrieval und in der Single-Modalität.

Methoden

Das Modell nutzt eine Dual-Encoder-Architektur, die einen Jina-XLM-RoBERTa-Text-Encoder (561M Parameter, 89 Sprachen, 696.320-Token-Kontext) mit einem EVA02-L14-Bild-Encoder (304M Parameter, 512×512-Pixeleingabe) kombiniert. Das Training verwendet ein multi-task-, multi-stufiges Kontrast-Lern-Paradigma: Das Modell wird gleichzeitig auf Text-Paaren, Text-Tripletts und Bild-Text-Paaren trainiert, um reine Text- und Cross-Modal-Task zu unterstützen. Der Trainingsdatensatz wurde um mehrsprachige Texte aus 29 Nicht-Englisch-Sprachen (u. a. Hindi, Chinesisch, Deutsch, Französisch) und Bilder visuellreicher Dokumente erweitert. Matryoshka-Repräsentationslernen ermöglicht die Dimensionsreduzierung von 1024 auf 64 Dimensionen unter Beibehaltung von über 99 % der Performance. Das Modell verwendet Last-Token-Pooling für das finale Embedding.

Leistung

Das Modell erreicht 98,0 % Genauigkeit im Flickr30k-Bild-zu-Text-Retrieval und übertrifft sowohl jina-clip-v1 als auch NLLB-CLIP-SigLIP. In mehrsprachigen Szenarien zeigt es bis zu 4 % Verbesserung gegenüber NLLB-CLIP-SigLIP im cross-lingualen Bild-Retrieval. Embedding-Kompression ist bemerkenswert effektiv: Eine Reduktion der Dimensionen um 75 % (1024→256) erhält weiterhin über 99 % der Performance über Text-, Bild- und Cross-Modal-Task. Auf Multilingual MTEB erreicht es 69,86 % bei Retrieval und 67,77 % bei semantischer Ähnlichkeit — wettbewerbsfähig mit spezialisierten Text-Embedding-Modellen. Die 89-Sprachen-Unterstützung und die Verarbeitung visuellreicher Dokumente machen es besonders geeignet für globalen E-Commerce und Content-Management.

Anleitung

Bilder vor der Verarbeitung auf 512×512 Pixel verkleinern — größere Bilder werden automatisch in Kacheln aufgeteilt, was den Token-Verbrauch und die Verarbeitungszeit erhöht. Das Modell glänzt beim Abstimmen von Bildern mit beschreibendem Text über 89 Sprachen — ideal für globale E-Commerce-Produktsuche, Content-Empfehlungen und mehrsprachige visuelle Suche. Es kann bei abstrakten Konzepten oder hochspezialisierten Domäneninhalten an Grenzen stoßen. Bei Verwendung von Matryoshka-Dimensionsreduktion: 64-dimensionale Embeddings halten eine starke Performance für das Indexieren; für Re-Ranking in kritischen Anwendungen 512+ Dimensionen verwenden. Das Modell erfordert CUDA-fähige Hardware. Für reine Text-Workloads bietet jina-embeddings-v5-text-small bessere Genauigkeit pro Parameter. Für Code-Retrieval jina-code-embeddings-1.5b verwenden. Verfügbar über Jina API, AWS, Azure und GCP-Marketplaces.

Blogs, die dieses Modell erwähnen
Juli 31, 2025 • 12 Minuten gelesen
Wie sich die Bildauflösung auf den visuellen Dokumentenabruf auswirkt
Die Bildauflösung ist entscheidend für die Erstellung von Vektor Modellen visuell reichhaltiger Dokumente. Ist sie zu klein, verpassen die Modelle wichtige Details; ist sie zu groß, können sie die Teile nicht miteinander verbinden.
Juli 25, 2025 • 8 Minuten gelesen
JinaVDR: Neue visuelle Dokumentenabruf-Benchmark mit 95 Aufgaben in 20 Sprachen
JinaVDR ist ein neuer Benchmark, der 95 Aufgaben in 20 Sprachen für den visuellen Dokumentenabruf umfasst und bald auf MTEB verfügbar sein wird.
Juni 25, 2025 • 12 Minuten gelesen
Jina Embeddings v4: Universelle Vektor Modelle (Embeddings) für Multimodale, Mehrsprachige Suche
Jina Embeddings v4 ist ein universelles 向量模型 (Embeddings)-Modell mit 3,8 Milliarden Parametern für multimodale und mehrsprachige Suche, das sowohl Single-Vektor- als auch Multi-Vektor-Embedding-Ausgaben unterstützt.
Mai 28, 2025 • 4 Minuten gelesen
Korrelationen: Vibe-Test von 向量modellen (Embeddings) in GUI
So ernst wir es mit MTEB meinen, so sehr lieben wir auch Vibe-Tests. Correlations ist eine einfache GUI, die wir zur Validierung von Zitaten in DeepSearch, zur Fehlersuche bei spätem Chunking und für Vibe-Tests von Vektormodellen (Embeddings) verwenden. Jetzt ist sie Open-Source.
Mai 25, 2025 • 21 Minuten gelesen
Was wir auf der ICLR2025 gelernt haben
Wir haben einige der interessantesten Artikel auf der ICLR 2025 zusammengestellt, darunter TIPS, FlexPrefill, Zero-Shot Reranker (Zero-Shot 重排器), SVD-LLM, Hymba usw.