Grafico I/O 1

Testo

jina-clip-v1

Vettore

Grafico I/O 2

Immagine

jina-clip-v1

Vettore

Frontiera di Pareto
300M1B3.0B10B20406080100bge-visualized-m3BiModernVBERTDSE-Phi3dse-qwen2-2b-mrl-v1e5-vjina-clip-v2jina-embeddings-v3jina-embeddings-v4llama-nemoretriever-col…MoCa-3Bnemotron-colembed-vl-8b…nllb-siglip-largeONE-PEACESauerkrautLM-ColLFM2-45…SauerkrautLM-ColMinistr…siglip-so400m-patch14-3…SigLIP2-L-512/16VLM2VecVultronRetrieverFlash-Q…jina-clip-v1Parametri (log)nDCG@5
Questo modello
Sulla frontiera
Jina AI
Altri
ViDoRe v1
17.72
Parametri
223M
Classifica per punteggio
32 / 33
Frontiera di Pareto
Sulla
Distribuzione dei valori
AUC 0.8440
Corpus
Coppie di traduzione
Ricerca documentale
Immagine / banner
0.6750.000.200.400.600.80
Correlate20.2%
Negativo difficile3.2%
Non correlate1.2%
Soglie consigliate
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
bilanciata · 0.376
AUC
0.8440
Soglia del rumore
0.779
Crollo del richiamo
0.123
Coppie misurate
119 / 11k
Componenti del vettore
-0.18-0.010.15
σ 0.0361 · 183k valori
Geometria dell'embedding
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.283
Dim. effettive
55 / 768
Scegli i modelli da confrontare
Pubblicazioni (1)

Panoramica

jina-clip-v1 è un modello di embedding multimodale da 223M parametri che raggiunge prestazioni state-of-the-art sia nella retrieval testo-testo che testo-immagine — un primato nella famiglia CLIP. A differenza dei modelli CLIP standard, che sacrificano la retrieval solo testo per l'allineamento cross-modale, jina-clip-v1 usa l'addestramento contrastivo multi-task per mantenere prestazioni forti su tutte le combinazioni di retrieval. Supporta un contesto testuale di 12.288 token, 100× il limite di 77 token del CLIP originale.

Metodi

L'architettura combina un encoder testuale Jina BERT v2 adattato (12.288 token grazie ad ALiBi) con l'encoder di immagine EVA-02 della Beijing Academy for AI. L'innovazione chiave è il metodo di addestramento contrastivo multi-task: il modello viene addestrato simultaneamente su (1) coppie immagine-descrizione per l'allineamento cross-modale, (2) coppie testo-testo per preservare la qualità della retrieval solo testo e (3) descrizioni testuali più lunghe generate da IA delle immagini per migliorare la robustezza a diverse lunghezze di testo. Una fase finale usa tripletti di testo con negativi difficili per affinare la distinzione semantica. Questo approccio multi-task previene l'oblio catastrofico della retrieval solo testo che affligge l'addestramento CLIP standard. L'encoder di immagine processa piastrelle di 224×224 pixel, con ogni piastrella che consuma 1.000 token di capacità di elaborazione.

Prestazione

Nella retrieval solo testo, il modello raggiunge un aumento di prestazioni del 165% rispetto ad OpenAI CLIP (0,429 contro 0,162 su MTEB). Per i task di immagine: 2% meglio nella retrieval testo-immagine (0,899), 6% nella immagine-testo (0,803) e 12% nella immagine-immagine (0,916). Nella classificazione visiva zero-shot (CIFAR-100) supera il CLIP standard. Le prestazioni cross-modali su Flickr8k/30k e MSCOCO Captions sono competitive con modelli single-modality specializzati. Il contesto testuale di 12.288 token è un grande vantaggio per la retrieval di documenti testuali lunghi affiancati a immagini. Nel 2026, jina-clip-v2 supera questo modello con supporto a 89 lingue e elaborazione di immagini 512×512.

Orientamento

Il modello processa le immagini in piastrelle di 224×224 pixel; ogni piastrella consuma 1.000 token. Un'immagine di 750×500 pixel richiede 12 piastrelle (12.000 token). Il testo richiede circa 1,1 token per parola. Pianifica i budget di token di conseguenza per query multi-modali. Il modello supporta attualmente solo l'inglese — per applicazioni multilingue usa jina-clip-v2. È disponibile tramite la Jina Embeddings API e come release open source su Hugging Face con licenza Apache 2.0. Per ambienti di produzione, le opzioni di deploy su AWS Marketplace e Azure offrono infrastruttura ottimizzata. Usa la similarità coseno per il confronto cross-modale. Per nuovi progetti multimodali, preferisci jina-clip-v2 (89 lingue, immagini 512×512, supporto MRL) o jina-embeddings-v4 (contesto 32K, modalità multi-vettore, supporto codice).

Blog che menzionano questo modello
giugno 25, 2025 • 12 minuti letti
Jina Embeddings v4: 向量模型 (Embeddings) universali per il recupero multimodale multilingue
Jina Embeddings v4 è un modello di 向量模型 (Embeddings) universale da 3,8 miliardi di parametri per il recupero multimodale e multilingue che supporta sia output di 向量模型 (Embeddings) a vettore singolo che a vettore multiplo.
aprile 08, 2025 • 21 minuti letti
jina-reranker-m0: Reranker multilingue e multimodale per documenti
Presentiamo jina-reranker-m0, il nostro nuovo reranker multimodale multilingue per il recupero di documenti visivi, con prestazioni allo stato dell'arte su documenti lunghi multilingue e attività di ricerca codice.
dicembre 12, 2024 • 12 minuti letti
Scalare il Calcolo di Test-Time per i Modelli di Embedding
I risultati migliori si ottengono con più potenza di calcolo—più per l'apprendimento, più per la ricerca. Un buon modello pre-addestrato ti porta lontano, ma la potenza di calcolo in fase di test ti porta ancora più lontano. È importante riconoscere questo nuovo paradigma di scaling della potenza di calcolo in fase di test, anche per i modelli di embedding.
dicembre 04, 2024 • 13 minuti letti
C'è Ancora Bisogno del Chunking Quando i Modelli Long-Context Possono Fare Tutto?
Confronto delle prestazioni dei modelli di embedding a contesto lungo con diverse strategie di suddivisione per trovare l'approccio ottimale per le tue esigenze.
novembre 21, 2024 • 9 minuti letti
Jina CLIP v2: Embedding multilingue e multimodale per testo e immagini
Jina-CLIP v2, un modello di embedding multimodale da 0,9B con supporto multilingue per 89 lingue, alta risoluzione delle immagini a 512x512 e rappresentazioni Matryoshka.