Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
warning
Questo modello è obsoleto nei modelli più recenti.
Embeddings
Licenza Apache 2.0
open_in_new Post di rilascio

jina-clip-v1

Modelli di embedding multimodale per immagini e testo inglese
Licenza
Apache-2.0
Data di rilascio
calendar_month
2024-06-05
Ingresso
image
Immagine
abc
Testo
arrow_forward
Produzione
more_horiz
Vettore
Dettagli del modello
Parametri: 223M
Lunghezza del token di input: 8K
Dimensione immagine di input: 224×224
Dimensione di uscita: 768
Modello base help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
Lingue addestrate help_outline
1 lingue
Modelli correlati
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
Disponibile tramite
API di Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Grafico I/O 1

Testo

jina-clip-v1

Vettore

Grafico I/O 2

Immagine

jina-clip-v1

Vettore

Frontiera di Pareto help_outline
workspace_premium
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
300M1B3.0B10B20406080100bge-visualized-m3BiModernVBERTDSE-Phi3dse-qwen2-2b-mrl-v1e5-vjina-clip-v2jina-embeddings-v3jina-embeddings-v4llama-nemoretriever-col…MoCa-3Bnemotron-colembed-vl-8b…nllb-siglip-largeONE-PEACESauerkrautLM-ColLFM2-45…SauerkrautLM-ColMinistr…siglip-so400m-patch14-3…SigLIP2-L-512/16VLM2VecVultronRetrieverFlash-Q…jina-clip-v1Parametri (log)nDCG@5
Questo modello
Sulla frontiera
Jina AI
Altri
ViDoRe v1
17.72
Parametri
223M
Classifica per punteggio
32 / 33
Frontiera di Pareto
Sulla
Distribuzione dei valorihelp_outline
AUC 0.8440
Corpus
Coppie di traduzione
Ricerca documentale
Immagine / banner
0.6750.000.200.400.600.80
Correlate20.2%
Negativo difficile3.2%
Non correlate1.2%
Soglie consigliate
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
bilanciata · 0.376
AUC
0.8440
Soglia del rumore
0.779
Crollo del richiamo
0.123
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
-0.18-0.010.15
σ 0.0361 · 183k valori
Geometria dell'embeddinghelp_outline
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.283
Dim. effettive
55 / 768
Scegli i modelli da confrontare
Pubblicazioni (1)
ICML 2024
maggio 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

Panoramica

jina-clip-v1 è un modello di embedding multimodale da 223M parametri che raggiunge prestazioni state-of-the-art sia nella retrieval testo-testo che testo-immagine — un primato nella famiglia CLIP. A differenza dei modelli CLIP standard, che sacrificano la retrieval solo testo per l'allineamento cross-modale, jina-clip-v1 usa l'addestramento contrastivo multi-task per mantenere prestazioni forti su tutte le combinazioni di retrieval. Supporta un contesto testuale di 12.288 token, 100× il limite di 77 token del CLIP originale.

Metodi

L'architettura combina un encoder testuale Jina BERT v2 adattato (12.288 token grazie ad ALiBi) con l'encoder di immagine EVA-02 della Beijing Academy for AI. L'innovazione chiave è il metodo di addestramento contrastivo multi-task: il modello viene addestrato simultaneamente su (1) coppie immagine-descrizione per l'allineamento cross-modale, (2) coppie testo-testo per preservare la qualità della retrieval solo testo e (3) descrizioni testuali più lunghe generate da IA delle immagini per migliorare la robustezza a diverse lunghezze di testo. Una fase finale usa tripletti di testo con negativi difficili per affinare la distinzione semantica. Questo approccio multi-task previene l'oblio catastrofico della retrieval solo testo che affligge l'addestramento CLIP standard. L'encoder di immagine processa piastrelle di 224×224 pixel, con ogni piastrella che consuma 1.000 token di capacità di elaborazione.

Prestazione

Nella retrieval solo testo, il modello raggiunge un aumento di prestazioni del 165% rispetto ad OpenAI CLIP (0,429 contro 0,162 su MTEB). Per i task di immagine: 2% meglio nella retrieval testo-immagine (0,899), 6% nella immagine-testo (0,803) e 12% nella immagine-immagine (0,916). Nella classificazione visiva zero-shot (CIFAR-100) supera il CLIP standard. Le prestazioni cross-modali su Flickr8k/30k e MSCOCO Captions sono competitive con modelli single-modality specializzati. Il contesto testuale di 12.288 token è un grande vantaggio per la retrieval di documenti testuali lunghi affiancati a immagini. Nel 2026, jina-clip-v2 supera questo modello con supporto a 89 lingue e elaborazione di immagini 512×512.

Orientamento

Il modello processa le immagini in piastrelle di 224×224 pixel; ogni piastrella consuma 1.000 token. Un'immagine di 750×500 pixel richiede 12 piastrelle (12.000 token). Il testo richiede circa 1,1 token per parola. Pianifica i budget di token di conseguenza per query multi-modali. Il modello supporta attualmente solo l'inglese — per applicazioni multilingue usa jina-clip-v2. È disponibile tramite la Jina Embeddings API e come release open source su Hugging Face con licenza Apache 2.0. Per ambienti di produzione, le opzioni di deploy su AWS Marketplace e Azure offrono infrastruttura ottimizzata. Usa la similarità coseno per il confronto cross-modale. Per nuovi progetti multimodali, preferisci jina-clip-v2 (89 lingue, immagini 512×512, supporto MRL) o jina-embeddings-v4 (contesto 32K, modalità multi-vettore, supporto codice).

Blog che menzionano questo modello
giugno 25, 2025 • 12 minuti letti
Jina Embeddings v4: 向量模型 (Embeddings) universali per il recupero multimodale multilingue
Jina Embeddings v4 è un modello di 向量模型 (Embeddings) universale da 3,8 miliardi di parametri per il recupero multimodale e multilingue che supporta sia output di 向量模型 (Embeddings) a vettore singolo che a vettore multiplo.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
aprile 08, 2025 • 21 minuti letti
jina-reranker-m0: Reranker multilingue e multimodale per documenti
Presentiamo jina-reranker-m0, il nostro nuovo reranker multimodale multilingue per il recupero di documenti visivi, con prestazioni allo stato dell'arte su documenti lunghi multilingue e attività di ricerca codice.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
dicembre 12, 2024 • 12 minuti letti
Scalare il Calcolo di Test-Time per i Modelli di Embedding
I risultati migliori si ottengono con più potenza di calcolo—più per l'apprendimento, più per la ricerca. Un buon modello pre-addestrato ti porta lontano, ma la potenza di calcolo in fase di test ti porta ancora più lontano. È importante riconoscere questo nuovo paradigma di scaling della potenza di calcolo in fase di test, anche per i modelli di embedding.
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
dicembre 04, 2024 • 13 minuti letti
C'è Ancora Bisogno del Chunking Quando i Modelli Long-Context Possono Fare Tutto?
Confronto delle prestazioni dei modelli di embedding a contesto lungo con diverse strategie di suddivisione per trovare l'approccio ottimale per le tue esigenze.
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
novembre 21, 2024 • 9 minuti letti
Jina CLIP v2: Embedding multilingue e multimodale per testo e immagini
Jina-CLIP v2, un modello di embedding multimodale da 0,9B con supporto multilingue per 89 lingue, alta risoluzione delle immagini a 512x512 e rappresentazioni Matryoshka.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizie
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.