Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumentation
Einloggen
login
Einbettungen
copyright CC BY-NC 4.0
open_in_new Release-Post

jina-clip-v2

Mehrsprachige multimodale Einbettungen für Texte und Bilder
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2024-11-05
Eingabe
image
Bild
abc
Text
arrow_forward
Ausgabe
more_horiz
Vektor
Matryoshka-Dimensionen help_outline
64
128
256
512
768
1024
Modelldetails
Parameter: 865M
Länge des Eingabetokens: 8K
Eingabebildgröße: 512×512
Ausgabedimension: 1024
Basismodell help_outline
open_in_new
EVA02-L-14
link
jina-embeddings-v3
Ausgebildete Sprachen help_outline
32 Sprachen
Unterstützte Sprachen help_outline
108 Sprachen
Ähnliche Modelle
link
jina-clip-v1
Erhältlich über
Elastic Inference Service
Jina-API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-Gapped
E/A-Diagramm 1

Text

jina-clip-v2

Vektor

E/A-Diagramm 2

Bild

jina-clip-v2

Vektor

Pareto-Fronthelp_outline
ViDoRe v1
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2Parameter (log)i2t-recall@5
Dieses Modell
Auf der Front
Jina AI
Andere
CLIP Benchmark
89.73
Parameter
865M
Rang nach Score
34 / 56
Pareto-Front
Dahinter
Werteverteilunghelp_outline
AUC 0.8383
Korpus
Übersetzungspaare
Dokumentensuche
Bild / Banner
Bild / Logo
Aufgabe
default
retrieval.query
0.6040.000.200.400.60
Verwandt20.2%
Hartes Negativ3.6%
Unverwandt0.8%
Empfohlene Schwellenwerte
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
ausgewogen · 0.403
AUC
0.8383
Rauschgrenze
0.666
Recall-Kante
0.224
Gemessene Paare
119 / 11k
Vektorkomponentenhelp_outline
-0.43-0.070.29
σ 0.0313 · 244k Werte
Einbettungsgeometriehelp_outline
01024
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.420
Effektive Dim.
52 / 1024
Sprachpaarehelp_outline
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.064
Wählen Sie Modelle zum Vergleichen aus
Publikationen (2)
ICLR 2026
Januar 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
Dezember 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

Überblick

jina-clip-v2 ist ein mehrsprachiges multimodales Embedding-Modell mit 865M Parametern, das 89 Sprachen und 512×512-Bildeingaben unterstützt. Es erweitert jina-clip-v1 um cross-linguale Bild-Text-Ausrichtung, Matryoshka-Repräsentationslernen zur Dimensionsreduzierung (1024→64) und verbesserte Performance bei visuell reichen Dokumenten. Es erreicht state-of-the-art cross-linguales Bild-Retrieval und hält dabei starke Performance im reinen Text-Retrieval und in der Single-Modalität.

Methoden

Das Modell nutzt eine Dual-Encoder-Architektur, die einen Jina-XLM-RoBERTa-Text-Encoder (561M Parameter, 89 Sprachen, 696.320-Token-Kontext) mit einem EVA02-L14-Bild-Encoder (304M Parameter, 512×512-Pixeleingabe) kombiniert. Das Training verwendet ein multi-task-, multi-stufiges Kontrast-Lern-Paradigma: Das Modell wird gleichzeitig auf Text-Paaren, Text-Tripletts und Bild-Text-Paaren trainiert, um reine Text- und Cross-Modal-Task zu unterstützen. Der Trainingsdatensatz wurde um mehrsprachige Texte aus 29 Nicht-Englisch-Sprachen (u. a. Hindi, Chinesisch, Deutsch, Französisch) und Bilder visuellreicher Dokumente erweitert. Matryoshka-Repräsentationslernen ermöglicht die Dimensionsreduzierung von 1024 auf 64 Dimensionen unter Beibehaltung von über 99 % der Performance. Das Modell verwendet Last-Token-Pooling für das finale Embedding.

Leistung

Das Modell erreicht 98,0 % Genauigkeit im Flickr30k-Bild-zu-Text-Retrieval und übertrifft sowohl jina-clip-v1 als auch NLLB-CLIP-SigLIP. In mehrsprachigen Szenarien zeigt es bis zu 4 % Verbesserung gegenüber NLLB-CLIP-SigLIP im cross-lingualen Bild-Retrieval. Embedding-Kompression ist bemerkenswert effektiv: Eine Reduktion der Dimensionen um 75 % (1024→256) erhält weiterhin über 99 % der Performance über Text-, Bild- und Cross-Modal-Task. Auf Multilingual MTEB erreicht es 69,86 % bei Retrieval und 67,77 % bei semantischer Ähnlichkeit — wettbewerbsfähig mit spezialisierten Text-Embedding-Modellen. Die 89-Sprachen-Unterstützung und die Verarbeitung visuellreicher Dokumente machen es besonders geeignet für globalen E-Commerce und Content-Management.

Anleitung

Bilder vor der Verarbeitung auf 512×512 Pixel verkleinern — größere Bilder werden automatisch in Kacheln aufgeteilt, was den Token-Verbrauch und die Verarbeitungszeit erhöht. Das Modell glänzt beim Abstimmen von Bildern mit beschreibendem Text über 89 Sprachen — ideal für globale E-Commerce-Produktsuche, Content-Empfehlungen und mehrsprachige visuelle Suche. Es kann bei abstrakten Konzepten oder hochspezialisierten Domäneninhalten an Grenzen stoßen. Bei Verwendung von Matryoshka-Dimensionsreduktion: 64-dimensionale Embeddings halten eine starke Performance für das Indexieren; für Re-Ranking in kritischen Anwendungen 512+ Dimensionen verwenden. Das Modell erfordert CUDA-fähige Hardware. Für reine Text-Workloads bietet jina-embeddings-v5-text-small bessere Genauigkeit pro Parameter. Für Code-Retrieval jina-code-embeddings-1.5b verwenden. Verfügbar über Jina API, AWS, Azure und GCP-Marketplaces.

Blogs, die dieses Modell erwähnen
Juli 31, 2025 • 12 Minuten gelesen
How Image Resolution Impacts Visual Document Retrieval
Image resolution is crucial for embedding visually rich documents. Too small and models miss key details; too large and they can't connect the parts.
Maximilian Werk
Michael Günther
Scott Martens
Abstract composition with a dark background featuring a flower-like design, radiant eye-like feature, rainbow-colored curved
Juli 25, 2025 • 8 Minuten gelesen
JinaVDR: New Visual Document Retrieval Benchmark with 95 Tasks in 20 Languages
JinaVDR is a new benchmark spanning 95 tasks across 20 languages for visual document retrieval, soon on MTEB.
Maximilian Werk
Alex C-G
Black-and-white design for "Jinavor Benchmark" with bold text. Below, "Visual Docs: 95 Tasks: 20 Languages" appears; an abstr
Juni 25, 2025 • 12 Minuten gelesen
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
Mai 28, 2025 • 4 Minuten gelesen
Correlations: Vibe-Testing Embeddings in GUI
As serious as we are about MTEB, we also love vibe-testing. Correlations is a simple GUI we use for validating citations in DeepSearch, debugging late chunking, and vibe-testing embeddings. Now it's open-source.
Jina AI
Technical screen showing green and yellow visual data, including charts in the lower half and a heat-map-like visualization a
Mai 25, 2025 • 21 Minuten gelesen
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Neuigkeiten
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.