Elastic
Jina AI
Notizia
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP terminalCLIarticlellms.txtsmart_toyAgentidata_objectSchemamenu_bookDocumenti



Login
login
Incorporamenti
copyright CC BY-NC 4.0
open_in_new Pubblicazione post

jina-clip-v2

Incorporamenti multimodali multilingue per testi e immagini
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2024-11-05
Ingresso
image
Immagine
abc
Testo
arrow_forward
Produzione
more_horiz
Vettore
Dimensioni Matryoshka help_outline
64
128
256
512
768
1024
Dettagli del modello
Parametri: 865M
Lunghezza del token di input: 8K
Dimensione immagine di input: 512×512
Dimensione di uscita: 1024
Modello base help_outline
open_in_new
XLM-RoBERTa Large
Lingue addestrate help_outline
32 lingue
Lingue supportate help_outline
108 lingue
Modelli correlati
link
jina-clip-v1
Disponibile tramite
Elastic Inference Service
API di Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Grafico I/O 1

Testo

jina-clip-v2

Vettore

Grafico I/O 2

Immagine

jina-clip-v2

Vettore

Distribuzione dei valorihelp_outline
AUC 0.8383
Corpus
Coppie di traduzione
Ricerca documentale
Immagine / banner
Immagine / logo
Attività
default
retrieval.query
0.6040.000.200.400.60
Correlate20.2%
Negativo difficile3.6%
Non correlate0.8%
Passa il cursore o fai clic sul grafico per spostare la soglia
Soglie consigliate
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
bilanciata · 0.403
AUC
0.8383
Soglia del rumore
0.666
Crollo del richiamo
0.224
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
-0.43-0.070.29
σ 0.0313 · 244k valori
Geometria dell'embeddinghelp_outline
01024
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.420
Dim. effettive
52 / 1024
Coppie linguistichehelp_outline
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.064
Scegli i modelli da confrontare
Pubblicazioni (2)
ICLR 2026
gennaio 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
dicembre 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

Panoramica

Jina CLIP v2 rivoluziona l'intelligenza artificiale multimodale colmando il divario tra comprensione visiva e testuale in 89 lingue. Questo modello risolve sfide critiche nell'e-commerce globale, nella gestione dei contenuti e nella comunicazione interculturale consentendo un'accurata corrispondenza immagine-testo indipendentemente dalle barriere linguistiche. Per le aziende che si espandono a livello internazionale o gestiscono contenuti multilingue, elimina la necessità di modelli separati per lingua o complesse pipeline di traduzione. Il modello brilla in particolare in scenari che richiedono una ricerca visiva precisa oltre i confini linguistici, come la scoperta di prodotti sul mercato globale o la gestione multilingue delle risorse digitali.

Metodi

Al suo interno, Jina CLIP v2 impiega una sofisticata architettura a doppio codificatore che combina un codificatore di testo Jina XLM-RoBERTa (561M parametri) con un codificatore di visione EVA02-L14 (304M parametri). Il codificatore di testo elabora contenuti in 89 lingue con una finestra di contesto massiccia di 696.320 token, mentre il codificatore di visione gestisce immagini ad alta risoluzione fino a 512x512 pixel. Il modello introduce un innovativo apprendimento della rappresentazione Matryoshka, che consente la regolazione dinamica delle dimensioni di incorporamento da 1024 a 64 dimensioni, preservando al contempo le prestazioni. Questa architettura elabora sia il testo che le immagini attraverso i rispettivi codificatori, proiettandoli in uno spazio semantico condiviso in cui concetti simili si allineano indipendentemente dalla loro modalità o lingua originale.

Prestazione

Il modello raggiunge prestazioni all'avanguardia con una precisione del 98,0% nelle attività di recupero immagine-testo di Flickr30k, superando sia il suo predecessore che NLLB-CLIP-SigLIP. In scenari multilingue, dimostra un miglioramento fino al 4% rispetto a NLLB-CLIP-SigLIP nelle attività di recupero immagini multi-lingue, nonostante abbia meno parametri rispetto al suo principale concorrente. Il modello mantiene prestazioni elevate anche quando gli incorporamenti sono compressi: la riduzione delle dimensioni del 75% preserva comunque oltre il 99% delle prestazioni nelle attività di testo, immagine e multi-modali. Nei benchmark completi Multilingual MTEB, raggiunge il 69,86% nel recupero e il 67,77% nelle attività di similarità semantica, con prestazioni competitive rispetto ai modelli di incorporamento di testo specializzati.

Orientamento

Per un'implementazione ottimale, gli utenti devono considerare diversi fattori chiave. Il modello richiede hardware compatibile con CUDA per un'elaborazione efficiente, con requisiti di memoria in base alle dimensioni del batch e alla risoluzione dell'immagine. Per ottimizzare i costi e le prestazioni dell'API, ridimensionare le immagini a 512x512 pixel prima dell'elaborazione: le immagini più grandi vengono automaticamente affiancate, aumentando l'utilizzo del token e il tempo di elaborazione. Il modello eccelle nell'abbinamento di immagini con testo descrittivo in tutte le lingue, ma può avere difficoltà con concetti astratti o contenuti specifici di dominio altamente specializzati. È particolarmente efficace per la ricerca di prodotti di e-commerce, sistemi di raccomandazione di contenuti e applicazioni di ricerca visiva, ma potrebbe non essere adatto per attività che richiedono un'analisi dettagliata dei dettagli visivi o competenze di dominio altamente specializzate. Quando si utilizza la funzionalità di rappresentazione Matryoshka, considerare il compromesso tra riduzione delle dimensioni e prestazioni: mentre gli incorporamenti a 64 dimensioni mantengono prestazioni elevate, le applicazioni critiche possono trarre vantaggio da dimensioni più elevate.
Blog che menzionano questo modello
novembre 21, 2024 • 9 minuti letti
Jina CLIP v2: Embedding multilingue e multimodale per testo e immagini
Jina-CLIP v2, un modello di embedding multimodale da 0,9B con supporto multilingue per 89 lingue, alta risoluzione delle immagini a 512x512 e rappresentazioni Matryoshka.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
ottobre 29, 2024 • 11 minuti letti
Oltre CLIP: Come Jina-CLIP fa progredire la ricerca multimodale
Scopri come Jina-CLIP migliora CLIP di OpenAI con una maggiore accuratezza nel recupero e risultati più diversificati attraverso embedding unificati di testo e immagini.
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
giugno 05, 2024 • 9 minuti letti
Jina CLIP v1: Un vero modello di embedding multimodale per testo e immagini
Il nuovo modello di embedding multimodale di Jina AI non solo supera OpenAI CLIP nel recupero di testo-immagine, ma è anche un solido modello di embedding per immagini e allo stesso tempo un modello di embedding testuale all'avanguardia. Non hai più bisogno di modelli diversi per diverse modalità.
Sofia Vasileva
Scott Martens
Susana Guzmán
Abstract 3D render of a neon blue and green grid pattern on a black background, creating a sense of depth.
settembre 27, 2024 • 15 minuti letti
Migrazione da Jina Embeddings v2 a v3
Abbiamo raccolto alcuni suggerimenti per aiutarti a migrare da Jina Embeddings v2 a v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
agosto 30, 2024 • 10 minuti letti
ColBERT v2 di Jina: Retriever di interazione tardiva multilingue per embedding e reranking
Jina ColBERT v2 supporta 89 lingue con prestazioni di recupero superiori, dimensioni di output controllate dall'utente e una lunghezza di token di 8192.
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Elastic Inference Service
open_in_new
Ottieni la chiave API Jina
Limite di velocità
Stato dell'API
Termini
Sicurezza
Termini & Condizioni
Privacy
Gestisci i cookie
Non vendere né condividere le mie informazioni personali
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Elastic © 2020-2026.
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.