Überblick
jina-clip-v2 ist ein mehrsprachiges multimodales Embedding-Modell mit 865M Parametern, das 89 Sprachen und 512×512-Bildeingaben unterstützt. Es erweitert jina-clip-v1 um cross-linguale Bild-Text-Ausrichtung, Matryoshka-Repräsentationslernen zur Dimensionsreduzierung (1024→64) und verbesserte Performance bei visuell reichen Dokumenten. Es erreicht state-of-the-art cross-linguales Bild-Retrieval und hält dabei starke Performance im reinen Text-Retrieval und in der Single-Modalität.
Methoden
Das Modell nutzt eine Dual-Encoder-Architektur, die einen Jina-XLM-RoBERTa-Text-Encoder (561M Parameter, 89 Sprachen, 696.320-Token-Kontext) mit einem EVA02-L14-Bild-Encoder (304M Parameter, 512×512-Pixeleingabe) kombiniert. Das Training verwendet ein multi-task-, multi-stufiges Kontrast-Lern-Paradigma: Das Modell wird gleichzeitig auf Text-Paaren, Text-Tripletts und Bild-Text-Paaren trainiert, um reine Text- und Cross-Modal-Task zu unterstützen. Der Trainingsdatensatz wurde um mehrsprachige Texte aus 29 Nicht-Englisch-Sprachen (u. a. Hindi, Chinesisch, Deutsch, Französisch) und Bilder visuellreicher Dokumente erweitert. Matryoshka-Repräsentationslernen ermöglicht die Dimensionsreduzierung von 1024 auf 64 Dimensionen unter Beibehaltung von über 99 % der Performance. Das Modell verwendet Last-Token-Pooling für das finale Embedding.
Leistung
Das Modell erreicht 98,0 % Genauigkeit im Flickr30k-Bild-zu-Text-Retrieval und übertrifft sowohl jina-clip-v1 als auch NLLB-CLIP-SigLIP. In mehrsprachigen Szenarien zeigt es bis zu 4 % Verbesserung gegenüber NLLB-CLIP-SigLIP im cross-lingualen Bild-Retrieval. Embedding-Kompression ist bemerkenswert effektiv: Eine Reduktion der Dimensionen um 75 % (1024→256) erhält weiterhin über 99 % der Performance über Text-, Bild- und Cross-Modal-Task. Auf Multilingual MTEB erreicht es 69,86 % bei Retrieval und 67,77 % bei semantischer Ähnlichkeit — wettbewerbsfähig mit spezialisierten Text-Embedding-Modellen. Die 89-Sprachen-Unterstützung und die Verarbeitung visuellreicher Dokumente machen es besonders geeignet für globalen E-Commerce und Content-Management.
Anleitung
Bilder vor der Verarbeitung auf 512×512 Pixel verkleinern — größere Bilder werden automatisch in Kacheln aufgeteilt, was den Token-Verbrauch und die Verarbeitungszeit erhöht. Das Modell glänzt beim Abstimmen von Bildern mit beschreibendem Text über 89 Sprachen — ideal für globale E-Commerce-Produktsuche, Content-Empfehlungen und mehrsprachige visuelle Suche. Es kann bei abstrakten Konzepten oder hochspezialisierten Domäneninhalten an Grenzen stoßen. Bei Verwendung von Matryoshka-Dimensionsreduktion: 64-dimensionale Embeddings halten eine starke Performance für das Indexieren; für Re-Ranking in kritischen Anwendungen 512+ Dimensionen verwenden. Das Modell erfordert CUDA-fähige Hardware. Für reine Text-Workloads bietet jina-embeddings-v5-text-small bessere Genauigkeit pro Parameter. Für Code-Retrieval jina-code-embeddings-1.5b verwenden. Verfügbar über Jina API, AWS, Azure und GCP-Marketplaces.











