Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Embeddings
Licenza di ricerca Qwen
open_in_new Post di rilascio

jina-embeddings-v4

Modello di embedding universale per il recupero multimodale e multilingue
Licenza
Qwen Research License
Data di rilascio
calendar_month
2025-06-24
Ingresso
abc
Testo
image
Immagine
picture_as_pdf
PDF
arrow_forward
Produzione
more_horiz
Vettore
apps
Multivettore
Dimensioni Matryoshka help_outline
128
256
512
1024
2048
Chunking tardivo help_outline
check_circle
Yes
Dettagli del modello
Parametri: 3.8B
Lunghezza del token di input: 32K
Dimensione immagine di input: 768×28×28
Dimensione di uscita: 2048
Modello base help_outline
open_in_new
Qwen2.5-VL-3B-Instruct
Lingue addestrate help_outline
34 lingue
Lingue supportate help_outline
29 lingue
Quantizzazioni help_outline
GGUF
Modelli correlati
link
jina-embeddings-v3
link
jina-clip-v2
Attività supportate
search Recupero
compare_arrows Corrispondenza del testo
code Codice
Disponibile tramite
API di Jina
Hugging Face
Air-gapped
Grafico I/O 1

Testo

jina-embeddings-v4

Compito

Vettore

Grafico I/O 2

Immagine

jina-embeddings-v4

Compito

Vettore

Grafico I/O 3

multiplo

Vettore

Testo

jina-embeddings-v4

Compito

Grafico I/O 4

multiplo

Vettore

Immagine

jina-embeddings-v4

Compito

Frontiera di Pareto help_outline
workspace_premium
RTEB public
LongEmbed
CoIR
ViDoRe v1
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderjina-embeddings-v4Parametri (log)nDCG@10
Questo modello
Sulla frontiera
Jina AI
Altri
CoIR
71.59
Parametri
3.8B
Classifica per punteggio
2 / 31
Frontiera di Pareto
Dietro
Distribuzione dei valorihelp_outline
AUC 0.8308
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
Attività
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
Correlate6.7%
Negativo difficile1.1%
Non correlate0.8%
Soglie consigliate
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
bilanciata · 0.618
AUC
0.8308
Soglia del rumore
0.877
Crollo del richiamo
0.516
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
-0.19-0.020.15
σ 0.0221 · 487k valori
Geometria dell'embeddinghelp_outline
02048
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.496
Dim. effettive
73 / 2048
Troncamento delle dimensionihelp_outline
12825651210242048
text-matching · Soglia per dimensioni richieste
Coppie linguistichehelp_outline
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.069
Scegli i modelli da confrontare
Pubblicazioni (2)
ICLR 2026
gennaio 22, 2026
Embedding Compression via Spherical Coordinates
EMNLP 2025
giugno 24, 2025
jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval

Panoramica

jina-embeddings-v4 è un modello di embedding multimodale da 3,8B parametri che unisce le rappresentazioni di testo e immagine in un'unica architettura. Supporta in modo unico sia il modo di output single-vector (denso) sia il multi-vector (interazione tardiva/stile ColBERT), permettendo ai team di bilanciare efficienza di indicizzazione e precisione di retrieval senza cambiare modello. Il modello raggiunge performance state-of-the-art sul retrieval di documenti visivamente ricchi, elaborando nativamente tabelle, grafici, diagrammi e formati multimediali misti.

Metodi

L'architettura combina un grande backbone di encoder transformer con un vision encoder basato su Qwen2.5-VL, elaborando testo (fino a 32K token) e immagini (768×28×28 patch) attraverso layer di attenzione condivisi. Tre adattatori LoRA specifici per task (60M parametri ciascuno) specializzano il modello per: retrieval asimmetrico query-documento, similarità semantica del testo e ricerca di codice. La progettazione a doppio output è l'innovazione chiave: il modello può produrre un singolo vettore denso di 2048 dimensioni (per indicizzazione ANN rapida con troncamento Matryoshka a 128 dimensioni) o un insieme di vettori a livello di token di 128 dimensioni per lo scoring di interazione tardiva. Il training ha usato un curriculum in due stadi: pre-training contrastivo congiunto su coppie testo-immagine e testo-testo, seguito dal training degli adattatori LoRA specifici per task. È supportato il late chunking per i documenti che superano la finestra di contesto di 32K token. Si applica la Qwen Research License.

Prestazione

Su JinaVDR (Visual Document Retrieval), il modello segna 72,19 di media, contro 64,50 per ColPali-v1.2. Su ViDoRe, raggiunge 84,11 di media (90,17 in modalità multi-vector) contro 83,90 per ColPali. Il cross-modal retrieval raggiunge 84,11 sul benchmark CLIP, superando jina-clip-v2 (81,12) e nllb-clip-large-siglip (83,19). Punteggi di text retrieval: 55,97 su MTEB-en, 66,49 su MMTEB, 67,11 su LongEmbed (contro 55,66 per jina-embeddings-v3). La similarità semantica raggiunge 85,89 su English STS e 72,70 su STS multilingua. Il retrieval di codice segna 71,59 su CoIR. Il cross-modal alignment raggiunge 0,71 di similarità coseno (contro 0,15 per OpenAI CLIP). La modalità multi-vector supera costantemente la modalità single-vector sui task visivamente ricchi; la modalità single-vector offre performance efficienti per il text retrieval standard.

Orientamento

Scegli la modalità di output in base alla tua pipeline: single-vector per indicizzazione ANN su larga scala (troncamento Matryoshka a 128–512 dimensioni disponibile), multi-vector per il re-ranking dei candidati top-k su documenti visivamente ricchi. Seleziona l'adattatore LoRA tramite il parametro task dell'API: 'retrieval' per query-documento, 'text-matching' per similarità semantica, 'code' per code retrieval. Per documenti che superano 32K token, usa `late_chunking. L'overhead di 60M parametri per adattatore LoRA è trascurabile (<2 % di aumento memoria) e tutti e tre gli adattatori possono essere caricati simultaneamente. Il modello è concesso in licenza sotto Qwen Research License (uso non commerciale senza licenza commerciale). Per i deploy di produzione, usa GPU con supporto CUDA; il modello è disponibile via Jina API, AWS, Azure e marketplaces GCP. Per i workload solo testo, jina-embeddings-v5-text-small` offre una migliore accuratezza per parametro a una frazione del costo computazionale.

Blog che menzionano questo modello
marzo 11, 2026 • 7 minuti letti
Bootstrapping di embedding audio da LLM multimodali
Trasforma qualsiasi LLM multimodale in un piccolo modello di embedding audio che supera CLAP con 25 volte meno dati.
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
febbraio 19, 2026 • 7 minuti letti
jina-embeddings-v5-text: Nuovi SOTA Small Multilingual Embeddings
Due 向量模型 multilingue sotto 1B con prestazioni migliori della categoria, disponibili su Elastic Inference Service, Llama.cpp e MLX.
Jina AI
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
settembre 09, 2025 • 11 minuti letti
Modelli di Embedding Multimodali in Llama.cpp e GGUF
Abbiamo introdotto i vettori modello multimodali in llama.cpp e GGUF, e abbiamo scoperto alcune problematiche sorprendenti lungo il percorso.
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
settembre 04, 2025 • 6 minuti letti
Jina Code Embeddings: Recupero di codice SOTA a 0,5B e 1,5B
LLM per la generazione di codice → Embeddings di codice: i modelli da 0,5B/1,5B raggiungono prestazioni SOTA su 25 benchmark di recupero del codice.
Jina AI
Green "Code Embeddings" text displayed in a LED dot style on a black background, evoking a futuristic and technological atmos
agosto 13, 2025 • 15 minuti letti
Ottimizzazione dei GGUF per i modelli di Embeddings solo decoder
Ottenere 4000 token/sec per un modello di 向量模型 da 3 miliardi di parametri su GPU L4 è probabilmente il massimo che si possa ottenere con llama.cpp. O forse no?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizie
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.