Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Embeddings
copyright CC BY-NC 4.0
open_in_new Post di rilascio

jina-clip-v2

Embeddings multimodali multilingue per testi e immagini
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2024-11-05
Ingresso
image
Immagine
abc
Testo
arrow_forward
Produzione
more_horiz
Vettore
Dimensioni Matryoshka help_outline
64
128
256
512
768
1024
Dettagli del modello
Parametri: 865M
Lunghezza del token di input: 8K
Dimensione immagine di input: 512×512
Dimensione di uscita: 1024
Modello base help_outline
open_in_new
EVA02-L-14
link
jina-embeddings-v3
Lingue addestrate help_outline
32 lingue
Lingue supportate help_outline
108 lingue
Modelli correlati
link
jina-clip-v1
Disponibile tramite
Elastic Inference Service
API di Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Grafico I/O 1

Testo

jina-clip-v2

Vettore

Grafico I/O 2

Immagine

jina-clip-v2

Vettore

Frontiera di Paretohelp_outline
ViDoRe v1
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2Parametri (log)i2t-recall@5
Questo modello
Sulla frontiera
Jina AI
Altri
CLIP Benchmark
89.73
Parametri
865M
Classifica per punteggio
34 / 56
Frontiera di Pareto
Dietro
Distribuzione dei valorihelp_outline
AUC 0.8383
Corpus
Coppie di traduzione
Ricerca documentale
Immagine / banner
Immagine / logo
Attività
default
retrieval.query
0.6040.000.200.400.60
Correlate20.2%
Negativo difficile3.6%
Non correlate0.8%
Soglie consigliate
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
bilanciata · 0.403
AUC
0.8383
Soglia del rumore
0.666
Crollo del richiamo
0.224
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
-0.43-0.070.29
σ 0.0313 · 244k valori
Geometria dell'embeddinghelp_outline
01024
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.420
Dim. effettive
52 / 1024
Coppie linguistichehelp_outline
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.064
Scegli i modelli da confrontare
Pubblicazioni (2)
ICLR 2026
gennaio 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
dicembre 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

Panoramica

jina-clip-v2 è un modello di embedding multimodale multilingue da 865M parametri che supporta 89 lingue e input di immagini 512×512. Estende jina-clip-v1 con l'allineamento immagine-testo cross-linguistico, l'apprendimento delle rappresentazioni Matryoshka per la riduzione delle dimensioni (1024→64) e prestazioni migliorate su documenti visivamente ricchi. Raggiunge una retrieval cross-linguistica di immagini state-of-the-art mantenendo prestazioni forti nella retrieval solo testo e nella single-modality.

Metodi

Il modello utilizza un'architettura dual-encoder che combina un encoder testuale Jina XLM-RoBERTa (561M parametri, 89 lingue, contesto di 696.320 token) con un encoder visivo EVA02-L14 (304M parametri, input 512×512 pixel). L'addestramento usa un paradigma di apprendimento contrastivo multi-task e multi-fase: il modello viene addestrato simultaneamente su coppie di testo, tripletti di testo e coppie immagine-testo per supportare sia i task solo testo che cross-modali. Il dataset di addestramento è stato esteso per includere testi multilingue da 29 lingue non inglesi (tra cui hindi, cinese, tedesco, francese) e immagini di documenti visivamente ricchi. L'apprendimento delle rappresentazioni Matryoshka consente la riduzione della dimensione degli embedding da 1024 a 64 dimensioni preservando oltre il 99% delle prestazioni. Il modello usa Last-Token-Pooling per l'embedding finale.

Prestazione

Il modello raggiunge il 98,0% di accuratezza nella retrieval immagine-testo di Flickr30k, superando sia jina-clip-v1 sia NLLB-CLIP-SigLIP. Nei scenari multilingue, dimostra un miglioramento fino al 4% rispetto a NLLB-CLIP-SigLIP nel retrieval cross-linguistico di immagini. La compressione degli embedding è notevolmente efficace: riducendo le dimensioni del 75% (1024→256) si conserva ancora oltre il 99% delle prestazioni nei task testuali, di immagine e cross-modali. Su Multilingual MTEB raggiunge il 69,86% nella retrieval e il 67,77% nella similarità semantica, con prestazioni competitive rispetto ai modelli di embedding testuale specializzati. Il supporto a 89 lingue e la gestione di documenti visivamente ricchi lo rendono particolarmente adatto al e-commerce globale e al content management.

Orientamento

Ridimensiona le immagini a 512×512 pixel prima dell'elaborazione — le immagini più grandi vengono suddivise automaticamente in piastrelle, aumentando l'uso di token e il tempo di elaborazione. Il modello eccelle nell'abbinare immagini e testo descrittivo in 89 lingue, ideale per la ricerca di prodotti e-commerce globali, la raccomandazione di contenuti e la ricerca visiva multilingue. Può avere difficoltà con concetti astratti o contenuti di dominio altamente specializzati. Quando si usa la riduzione delle dimensioni Matryoshka, gli embedding a 64 dimensioni mantengono prestazioni forti per l'indicizzazione; usa 512+ dimensioni per il re-ranking di applicazioni critiche. Il modello richiede hardware con supporto CUDA. Per carichi di lavoro solo testo, jina-embeddings-v5-text-small offre una migliore accuratezza per parametro. Per la retrieval di codice, usa jina-code-embeddings-1.5b. Disponibile via Jina API, AWS, Azure e marketplace GCP.

Blog che menzionano questo modello
luglio 31, 2025 • 12 minuti letti
How Image Resolution Impacts Visual Document Retrieval
Image resolution is crucial for embedding visually rich documents. Too small and models miss key details; too large and they can't connect the parts.
Maximilian Werk
Michael Günther
Scott Martens
Abstract composition with a dark background featuring a flower-like design, radiant eye-like feature, rainbow-colored curved
luglio 25, 2025 • 8 minuti letti
JinaVDR: New Visual Document Retrieval Benchmark with 95 Tasks in 20 Languages
JinaVDR is a new benchmark spanning 95 tasks across 20 languages for visual document retrieval, soon on MTEB.
Maximilian Werk
Alex C-G
Black-and-white design for "Jinavor Benchmark" with bold text. Below, "Visual Docs: 95 Tasks: 20 Languages" appears; an abstr
giugno 25, 2025 • 12 minuti letti
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
maggio 28, 2025 • 4 minuti letti
Correlations: Vibe-Testing Embeddings in GUI
As serious as we are about MTEB, we also love vibe-testing. Correlations is a simple GUI we use for validating citations in DeepSearch, debugging late chunking, and vibe-testing embeddings. Now it's open-source.
Jina AI
Technical screen showing green and yellow visual data, including charts in the lower half and a heat-map-like visualization a
maggio 25, 2025 • 21 minuti letti
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizie
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.