Panoramica
jina-clip-v2 è un modello di embedding multimodale multilingue da 865M parametri che supporta 89 lingue e input di immagini 512×512. Estende jina-clip-v1 con l'allineamento immagine-testo cross-linguistico, l'apprendimento delle rappresentazioni Matryoshka per la riduzione delle dimensioni (1024→64) e prestazioni migliorate su documenti visivamente ricchi. Raggiunge una retrieval cross-linguistica di immagini state-of-the-art mantenendo prestazioni forti nella retrieval solo testo e nella single-modality.
Metodi
Il modello utilizza un'architettura dual-encoder che combina un encoder testuale Jina XLM-RoBERTa (561M parametri, 89 lingue, contesto di 696.320 token) con un encoder visivo EVA02-L14 (304M parametri, input 512×512 pixel). L'addestramento usa un paradigma di apprendimento contrastivo multi-task e multi-fase: il modello viene addestrato simultaneamente su coppie di testo, tripletti di testo e coppie immagine-testo per supportare sia i task solo testo che cross-modali. Il dataset di addestramento è stato esteso per includere testi multilingue da 29 lingue non inglesi (tra cui hindi, cinese, tedesco, francese) e immagini di documenti visivamente ricchi. L'apprendimento delle rappresentazioni Matryoshka consente la riduzione della dimensione degli embedding da 1024 a 64 dimensioni preservando oltre il 99% delle prestazioni. Il modello usa Last-Token-Pooling per l'embedding finale.
Prestazione
Il modello raggiunge il 98,0% di accuratezza nella retrieval immagine-testo di Flickr30k, superando sia jina-clip-v1 sia NLLB-CLIP-SigLIP. Nei scenari multilingue, dimostra un miglioramento fino al 4% rispetto a NLLB-CLIP-SigLIP nel retrieval cross-linguistico di immagini. La compressione degli embedding è notevolmente efficace: riducendo le dimensioni del 75% (1024→256) si conserva ancora oltre il 99% delle prestazioni nei task testuali, di immagine e cross-modali. Su Multilingual MTEB raggiunge il 69,86% nella retrieval e il 67,77% nella similarità semantica, con prestazioni competitive rispetto ai modelli di embedding testuale specializzati. Il supporto a 89 lingue e la gestione di documenti visivamente ricchi lo rendono particolarmente adatto al e-commerce globale e al content management.
Orientamento
Ridimensiona le immagini a 512×512 pixel prima dell'elaborazione — le immagini più grandi vengono suddivise automaticamente in piastrelle, aumentando l'uso di token e il tempo di elaborazione. Il modello eccelle nell'abbinare immagini e testo descrittivo in 89 lingue, ideale per la ricerca di prodotti e-commerce globali, la raccomandazione di contenuti e la ricerca visiva multilingue. Può avere difficoltà con concetti astratti o contenuti di dominio altamente specializzati. Quando si usa la riduzione delle dimensioni Matryoshka, gli embedding a 64 dimensioni mantengono prestazioni forti per l'indicizzazione; usa 512+ dimensioni per il re-ranking di applicazioni critiche. Il modello richiede hardware con supporto CUDA. Per carichi di lavoro solo testo, jina-embeddings-v5-text-small offre una migliore accuratezza per parametro. Per la retrieval di codice, usa jina-code-embeddings-1.5b. Disponibile via Jina API, AWS, Azure e marketplace GCP.











