Grafico I/O 1

Testo

jina-clip-v2

Vettore

Grafico I/O 2

Immagine

jina-clip-v2

Vettore

Frontiera di Pareto
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2Parametri (log)i2t-recall@5
Questo modello
Sulla frontiera
Jina AI
Altri
CLIP Benchmark
89.73
Parametri
865M
Classifica per punteggio
34 / 56
Frontiera di Pareto
Dietro
Distribuzione dei valori
AUC 0.8383
Corpus
Coppie di traduzione
Ricerca documentale
Immagine / banner
Immagine / logo
Attività
default
retrieval.query
0.6040.000.200.400.60
Correlate20.2%
Negativo difficile3.6%
Non correlate0.8%
Soglie consigliate
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
bilanciata · 0.403
AUC
0.8383
Soglia del rumore
0.666
Crollo del richiamo
0.224
Coppie misurate
119 / 11k
Componenti del vettore
-0.43-0.070.29
σ 0.0313 · 244k valori
Geometria dell'embedding
01024
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.420
Dim. effettive
52 / 1024
Coppie linguistiche
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.064
Scegli i modelli da confrontare
Pubblicazioni (2)

Panoramica

jina-clip-v2 è un modello di embedding multimodale multilingue da 865M parametri che supporta 89 lingue e input di immagini 512×512. Estende jina-clip-v1 con l'allineamento immagine-testo cross-linguistico, l'apprendimento delle rappresentazioni Matryoshka per la riduzione delle dimensioni (1024→64) e prestazioni migliorate su documenti visivamente ricchi. Raggiunge una retrieval cross-linguistica di immagini state-of-the-art mantenendo prestazioni forti nella retrieval solo testo e nella single-modality.

Metodi

Il modello utilizza un'architettura dual-encoder che combina un encoder testuale Jina XLM-RoBERTa (561M parametri, 89 lingue, contesto di 696.320 token) con un encoder visivo EVA02-L14 (304M parametri, input 512×512 pixel). L'addestramento usa un paradigma di apprendimento contrastivo multi-task e multi-fase: il modello viene addestrato simultaneamente su coppie di testo, tripletti di testo e coppie immagine-testo per supportare sia i task solo testo che cross-modali. Il dataset di addestramento è stato esteso per includere testi multilingue da 29 lingue non inglesi (tra cui hindi, cinese, tedesco, francese) e immagini di documenti visivamente ricchi. L'apprendimento delle rappresentazioni Matryoshka consente la riduzione della dimensione degli embedding da 1024 a 64 dimensioni preservando oltre il 99% delle prestazioni. Il modello usa Last-Token-Pooling per l'embedding finale.

Prestazione

Il modello raggiunge il 98,0% di accuratezza nella retrieval immagine-testo di Flickr30k, superando sia jina-clip-v1 sia NLLB-CLIP-SigLIP. Nei scenari multilingue, dimostra un miglioramento fino al 4% rispetto a NLLB-CLIP-SigLIP nel retrieval cross-linguistico di immagini. La compressione degli embedding è notevolmente efficace: riducendo le dimensioni del 75% (1024→256) si conserva ancora oltre il 99% delle prestazioni nei task testuali, di immagine e cross-modali. Su Multilingual MTEB raggiunge il 69,86% nella retrieval e il 67,77% nella similarità semantica, con prestazioni competitive rispetto ai modelli di embedding testuale specializzati. Il supporto a 89 lingue e la gestione di documenti visivamente ricchi lo rendono particolarmente adatto al e-commerce globale e al content management.

Orientamento

Ridimensiona le immagini a 512×512 pixel prima dell'elaborazione — le immagini più grandi vengono suddivise automaticamente in piastrelle, aumentando l'uso di token e il tempo di elaborazione. Il modello eccelle nell'abbinare immagini e testo descrittivo in 89 lingue, ideale per la ricerca di prodotti e-commerce globali, la raccomandazione di contenuti e la ricerca visiva multilingue. Può avere difficoltà con concetti astratti o contenuti di dominio altamente specializzati. Quando si usa la riduzione delle dimensioni Matryoshka, gli embedding a 64 dimensioni mantengono prestazioni forti per l'indicizzazione; usa 512+ dimensioni per il re-ranking di applicazioni critiche. Il modello richiede hardware con supporto CUDA. Per carichi di lavoro solo testo, jina-embeddings-v5-text-small offre una migliore accuratezza per parametro. Per la retrieval di codice, usa jina-code-embeddings-1.5b. Disponibile via Jina API, AWS, Azure e marketplace GCP.

Blog che menzionano questo modello
luglio 31, 2025 • 12 minuti letti
Come la risoluzione delle immagini influisce sul recupero di documenti visivi
La risoluzione delle immagini è fondamentale per l' incorporazione di documenti visivamente ricchi. Se troppo piccola, i modelli perdono dettagli chiave; se troppo grande, non riescono a collegare le parti.
luglio 25, 2025 • 8 minuti letti
JinaVDR: nuovo benchmark di ricerca visiva di documenti con 95 attività in 20 lingue
JinaVDR è un nuovo benchmark che comprende 95 attività in 20 lingue per il recupero visivo di documenti, presto disponibile su MTEB.
giugno 25, 2025 • 12 minuti letti
Jina Embeddings v4: 向量模型 (Embeddings) universali per il recupero multimodale multilingue
Jina Embeddings v4 è un modello di 向量模型 (Embeddings) universale da 3,8 miliardi di parametri per il recupero multimodale e multilingue che supporta sia output di 向量模型 (Embeddings) a vettore singolo che a vettore multiplo.
maggio 28, 2025 • 4 minuti letti
Correlazioni: test di risonanza dei vettori modello (Embeddings) in GUI
Pur essendo molto seri riguardo a MTEB, amiamo anche testare le sensazioni. Correlations è una semplice GUI che utilizziamo per convalidare le citazioni in DeepSearch, per il debug del late chunking e per testare le sensazioni dei vettori modello (Embeddings). Ora è open source.
maggio 25, 2025 • 21 minuti letti
Cosa abbiamo imparato all'ICLR2025
Abbiamo raccolto alcuni dei documenti più interessanti di ICLR 2025, tra cui TIPS, FlexPrefill, Reranker Zero-Shot (Reranker Zero-Shot), SVD-LLM, Hymba ecc.