Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
warning
Questo modello è obsoleto nei modelli più recenti.
Embeddings
Licenza Apache 2.0
open_in_new Pubblicazione post

jina-clip-v1

Modelli di embedding multimodale per immagini e testo inglese
Licenza
Apache-2.0
Data di rilascio
calendar_month
2024-06-05
Ingresso
image
Immagine
abc
Testo
arrow_forward
Produzione
more_horiz
Vettore
Dettagli del modello
Parametri: 223M
Lunghezza del token di input: 8K
Dimensione immagine di input: 224×224
Dimensione di uscita: 768
Modello base help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
Lingue addestrate help_outline
1 lingue
Modelli correlati
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
Disponibile tramite
API di Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Grafico I/O 1

Testo

jina-clip-v1

Vettore

Grafico I/O 2

Immagine

jina-clip-v1

Vettore

Frontiera di Paretohelp_outline
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14jina-clip-v2MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v1Parametri (log)i2t-recall@5
Questo modello
Sulla frontiera
Jina AI
Altri
CLIP Benchmark
87.65
Parametri
223M
Classifica per punteggio
44 / 56
Frontiera di Pareto
Dietro
Distribuzione dei valorihelp_outline
AUC 0.8440
Corpus
Coppie di traduzione
Ricerca documentale
Immagine / banner
0.6750.000.200.400.600.80
Correlate20.2%
Negativo difficile3.2%
Non correlate1.2%
Soglie consigliate
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
bilanciata · 0.376
AUC
0.8440
Soglia del rumore
0.779
Crollo del richiamo
0.123
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
-0.18-0.010.15
σ 0.0361 · 183k valori
Geometria dell'embeddinghelp_outline
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.283
Dim. effettive
55 / 768
Scegli i modelli da confrontare
Pubblicazioni (1)
ICML 2024
maggio 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

Panoramica

Jina CLIP v1 rivoluziona l'intelligenza artificiale multimodale, essendo il primo modello a eccellere in egual misura sia nelle attività di recupero testo-testo che testo-immagine. A differenza dei tradizionali modelli CLIP che hanno difficoltà con scenari solo testo, questo modello raggiunge prestazioni all'avanguardia in tutte le combinazioni di recupero, mantenendo al contempo una dimensione dei parametri notevolmente compatta di 223 M. Il modello affronta una sfida critica del settore eliminando la necessità di modelli separati per l'elaborazione di testo e immagini, riducendo la complessità del sistema e il sovraccarico computazionale. Per i team che creano sistemi di ricerca, motori di raccomandazione o strumenti di analisi dei contenuti, Jina CLIP v1 offre un'unica soluzione efficiente che gestisce sia il testo che i contenuti visivi con eccezionale accuratezza.

Metodi

L'architettura del modello rappresenta un'innovazione significativa nella progettazione di AI multimodale, combinando un codificatore di testo Jina BERT v2 adattato con il codificatore di immagini EVA-02 all'avanguardia della Beijing Academy for Artificial Intelligence. Il codificatore di testo supporta sequenze fino a 12.288 token, oltre 100 volte più lunghe del limite di 77 token del CLIP originale, mentre il codificatore di immagini elabora in modo efficiente 16 token patch. Il processo di addestramento segue un nuovo approccio in tre fasi: in primo luogo, allineare le coppie immagine-didascalia mantenendo la comprensione del testo tramite l'addestramento di coppie di testo interlacciate; in secondo luogo, incorporare descrizioni di testo più lunghe generate dall'AI delle immagini; e infine, utilizzare triplette di testo negative rigide per migliorare le capacità di distinzione semantica. Questa metodologia di addestramento unica consente al modello di mantenere prestazioni elevate sia nelle didascalie brevi che nelle descrizioni testuali dettagliate, preservando al contempo una solida comprensione visiva.

Prestazione

Jina CLIP v1 dimostra notevoli miglioramenti rispetto al CLIP originale di OpenAI in tutti i benchmark. Nel recupero solo testo, ottiene un aumento delle prestazioni del 165% con un punteggio di 0,429 rispetto a 0,162 di CLIP. Per le attività correlate alle immagini, mostra miglioramenti costanti: 2% in più nel recupero testo-immagine (0,899), 6% nel recupero immagine-testo (0,803) e 12% nel recupero immagine-immagine (0,916). Il modello brilla in particolare nelle attività di classificazione visiva zero-shot, categorizzando con successo le immagini senza formazione precedente su domini specifici. Quando valutato su benchmark standard come MTEB per il recupero testo, CIFAR-100 per le attività immagine e Flickr8k/30k e MSCOCO Captions per le prestazioni cross-modali, supera costantemente i modelli specializzati a modalità singola mantenendo prestazioni competitive nelle attività cross-modali.

Orientamento

Per distribuire efficacemente Jina CLIP v1, i team devono considerare sia le sue capacità che i requisiti di risorse. Il modello elabora le immagini in tile da 224x224 pixel, con ogni tile che consuma 1.000 token di capacità di elaborazione. Per prestazioni ottimali, implementa un'efficiente pre-elaborazione delle immagini per adattarla a queste dimensioni. Sebbene il modello eccella sia nell'elaborazione di testo breve che lungo, al momento supporta solo l'input in lingua inglese. I team devono considerare attentamente l'utilizzo dei token: il testo richiede circa 1,1 token per parola, mentre le immagini vengono elaborate in tile (ad esempio, un'immagine da 750x500 pixel richiede 12 tile, consumando 12.000 token). Il modello è disponibile sia tramite l'API Jina Embeddings sia come release open source su Hugging Face con licenza Apache 2.0, offrendo flessibilità nelle opzioni di distribuzione. Per gli ambienti di produzione, prendi in considerazione l'utilizzo delle opzioni di distribuzione AWS Marketplace o Azure, che forniscono configurazioni di infrastruttura ottimizzate.
Blog che menzionano questo modello
giugno 25, 2025 • 12 minuti letti
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
aprile 08, 2025 • 21 minuti letti
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
dicembre 12, 2024 • 12 minuti letti
Scaling Test-Time Compute For Embedding Models
Better results scale with compute—more on learning, more on search. A good pretrained model takes you far, but test-time compute takes you further. It's time to recognize this paradigm of test-time compute, even for embedding models.
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
dicembre 04, 2024 • 13 minuti letti
Still Need Chunking When Long-Context Models Can Do It All?
Comparing how long-context embedding models perform with different chunking strategies to find the optimal approach for your needs.
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
novembre 21, 2024 • 9 minuti letti
Jina CLIP v2: Multilingual Multimodal Embeddings for Text and Images
Jina-CLIP v2, a 0.9B multimodal embedding model with multilingual support of 89 languages, high image resolution at 512x512, and Matryoshka representations.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.