Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Incorporamenti
Licenza di ricerca Qwen
open_in_new Pubblicazione post

jina-embeddings-v4

Modello di incorporamento universale per il recupero multimodale e multilingue
Licenza
Qwen Research License
Data di rilascio
calendar_month
2025-06-24
Ingresso
abc
Testo
image
Immagine
picture_as_pdf
PDF
arrow_forward
Produzione
more_horiz
Vettore
apps
Multi-vettore
Dimensioni Matryoshka help_outline
128
256
512
1024
2048
Chunking tardivo help_outline
check_circle
Yes
Dettagli del modello
Parametri: 3.8B
Lunghezza del token di input: 32K
Dimensione immagine di input: 768×28×28
Dimensione di uscita: 2048
Modello base help_outline
open_in_new
Qwen2.5-VL-3B-Instruct
Lingue addestrate help_outline
34 lingue
Lingue supportate help_outline
29 lingue
Quantizzazioni help_outline
GGUF
Modelli correlati
link
jina-embeddings-v3
link
jina-clip-v2
Attività supportate
search Recupero
compare_arrows Corrispondenza del testo
code Codice
Disponibile tramite
API di Jina
Hugging Face
Air-gapped
Grafico I/O 1

Testo

jina-embeddings-v4

Compito

Vettore

Grafico I/O 2

Immagine

jina-embeddings-v4

Compito

Vettore

Grafico I/O 3

multiplo

Vettore

Testo

jina-embeddings-v4

Compito

Grafico I/O 4

multiplo

Vettore

Immagine

jina-embeddings-v4

Compito

Pareto fronthelp_outline
RTEB public
LongEmbed
CoIR
ViDoRe v1
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v4Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
LongEmbed
69.88
Parameters
3.8B
Rank by score
7 / 69
Pareto front
Behind it
Distribuzione dei valorihelp_outline
AUC 0.8308
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
Attività
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
Correlate6.7%
Negativo difficile1.1%
Non correlate0.8%
Soglie consigliate
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
bilanciata · 0.618
AUC
0.8308
Soglia del rumore
0.877
Crollo del richiamo
0.516
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
-0.19-0.020.15
σ 0.0221 · 487k valori
Geometria dell'embeddinghelp_outline
02048
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.496
Dim. effettive
73 / 2048
Troncamento delle dimensionihelp_outline
12825651210242048
text-matching · Soglia per dimensioni richieste
Coppie linguistichehelp_outline
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.069
Scegli i modelli da confrontare
Pubblicazioni (2)
ICLR 2026
gennaio 22, 2026
Embedding Compression via Spherical Coordinates
EMNLP 2025
giugno 24, 2025
jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval

Panoramica

Jina Embeddings V4 è un modello di embedding multimodale da 3,8 miliardi di parametri che offre funzionalità di rappresentazione unificata di testo e immagini. Basato sul backbone Qwen2.5-VL-3B-Instruct, il modello presenta un'architettura che supporta embedding sia mono-vettore che multi-vettore nello stile di interazione tardiva, superando le limitazioni riscontrate nei tradizionali modelli a doppio encoder in stile CLIP. Il modello incorpora tre adattatori LoRA specializzati per attività specifiche (60 milioni di parametri ciascuno) che ottimizzano le prestazioni in diversi scenari di recupero, tra cui il recupero asimmetrico di query-documenti, la similarità semantica del testo e la ricerca di codice, senza modificare i pesi del backbone congelato. Il modello dimostra ottime prestazioni nell'elaborazione di contenuti visivamente ricchi come tabelle, grafici, diagrammi, screenshot e formati multimediali misti, attraverso un percorso di elaborazione unificato che riduce il divario di modalità presente nelle architetture convenzionali. Grazie al supporto di funzionalità multilingue, il modello può gestire testi di input fino a 32.768 token con immagini ridimensionate a 20 megapixel, il che lo rende adatto a varie applicazioni di recupero di documenti e di ricerca multimodale in diverse lingue e domini.

Metodi

Jina Embeddings V4 implementa un'architettura di modello linguistico multimodale unificata che si differenzia dagli approcci a doppio codificatore in stile CLIP. Il modello elabora gli input attraverso un percorso condiviso in cui le immagini vengono prima convertite in sequenze di token tramite un codificatore visivo, quindi entrambe le modalità testo e immagine vengono elaborate insieme dal decodificatore del modello linguistico con livelli di attenzione contestuale. Questa architettura supporta due modalità di output per adattarsi a diversi casi d'uso: incorporamenti a singolo vettore che producono vettori a 2048 dimensioni troncabili a 128 dimensioni tramite Matryoshka Representation Learning, generati tramite mean pooling per un'efficiente ricerca di similarità; ed incorporamenti multi-vettore che generano 128 dimensioni per token tramite livelli di proiezione per il recupero tardivo dello stile di interazione. Il modello include tre adattatori LoRA specifici per ogni attività che forniscono un'ottimizzazione specializzata: l'adattatore per il recupero utilizza una codifica asimmetrica basata su prefissi con addestramento basato su negativi rigidi per scenari di query-documento, l'adattatore per la corrispondenza del testo utilizza la perdita CoSENT per attività di similarità semantica e l'adattatore per il codice si concentra su applicazioni di recupero da linguaggio naturale a codice. L'addestramento avviene in due fasi: addestramento iniziale in coppia utilizzando la perdita contrastiva InfoNCE con coppie testo-testo e testo-immagine provenienti da oltre 300 fonti, seguito da un fine tuning specifico per l'attività dei tre adattatori LoRA utilizzando metodi basati su triplette e funzioni di perdita specializzate, adattate ai requisiti di ciascun dominio.

Prestazione

Jina Embeddings V4 raggiunge prestazioni competitive in diverse categorie di benchmark. Nel recupero di documenti visivi, ottiene un punteggio medio di 72,19 sul benchmark JinaVDR, rispetto a 64,50 per ColPali-v1.2, e 84,11 su ViDoRe, rispetto a 83,90 per ColPali, con la modalità multi-vettore che raggiunge 90,17 su ViDoRe. Per il recupero cross-modale, il modello ottiene un punteggio di 84,11 su CLIP Benchmark, rispetto a jina-clip-v2 (81,12) e nllb-clip-large-siglip (83,19). Nelle attività di recupero di testo, ottiene 55,97 su MTEB-en e 66,49 su MMTEB, con prestazioni notevoli nell'elaborazione di documenti lunghi, 67,11 su LongEmbed, rispetto a 55,66 per il suo predecessore. Il modello dimostra solide prestazioni di similarità semantica del testo con 85,89 nei compiti STS in inglese e 72,70 nei benchmark STS multilingue. Le capacità di recupero del codice raggiungono 71,59 nel benchmark CoIR, sebbene modelli specializzati come voyage-code-3 (77,33) ottengano punteggi più elevati in questo dominio. Il modello mostra un migliore allineamento cross-modale con un punteggio di 0,71 rispetto a 0,15 per OpenAI CLIP, risolvendo il problema del divario di modalità nei modelli multimodali. La modalità multi-vettore supera costantemente la modalità a vettore singolo nei compiti visivamente ricchi, mentre la modalità a vettore singolo offre prestazioni efficienti per scenari di recupero standard.

Orientamento

Per utilizzare efficacemente Jina Embeddings V4, seleziona l'adattatore LoRA appropriato in base ai requisiti specifici della tua applicazione. Utilizza l'adattatore "retrieval" per scenari di recupero asimmetrico di query e documenti in cui query e documenti hanno strutture diverse, assicurando che vengano applicati prefissi appropriati per distinguere tra il contenuto della query e quello del brano. L'adattatore "text-matching" è adatto per attività di similarità semantica e recupero simmetrico in cui l'obiettivo è trovare contenuti simili piuttosto che risposte alle query, rendendolo appropriato per il clustering di documenti, il rilevamento di duplicati e i sistemi di raccomandazione di contenuti. Per applicazioni di programmazione, l'adattatore "code" è ottimizzato per il recupero da linguaggio naturale a codice, la ricerca di similarità da codice a codice e scenari di risposta a domande tecniche. Scegli le modalità di output in base ai requisiti di prestazioni ed efficienza: gli embedding a singolo vettore offrono una ricerca di similarità efficiente e sono adatti ad ambienti con vincoli di archiviazione, con dimensioni troncabili che consentono una riduzione da 2048 a 128-512 dimensioni con compromessi di qualità accettabili, mentre gli embedding multi-vettore offrono una maggiore precisione per attività di recupero complesse, in particolare quando si lavora con documenti visivamente ricchi in cui il punteggio di interazione tardiva cattura relazioni dettagliate. L'architettura unificata del modello consente l'elaborazione di input misti testo-immagine senza richiedere codificatori separati o pre-elaborazione OCR per i documenti visivi. Le capacità di allineamento multimodale e il supporto multilingue del modello lo rendono adatto ad applicazioni internazionali. Per le distribuzioni di produzione, considera l'overhead di 60 M di parametri per adattatore LoRA quando pianifichi i requisiti di memoria, tenendo presente che tutti e tre gli adattatori possono essere gestiti simultaneamente con meno del 2% di spazio di memoria aggiuntivo, consentendo un cambio di attività flessibile durante l'inferenza.
Blog che menzionano questo modello
marzo 11, 2026 • 7 minuti letti
Bootstrapping Audio Embeddings from Multimodal LLMs
Turn any multimodal LLM into a small audio embedding model that beats CLAP with 25x less data.
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
febbraio 19, 2026 • 7 minuti letti
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Two sub-1B multilingual embeddings with best-in-class performance, available on Elastic Inference Service, Llama.cpp and MLX.
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
settembre 09, 2025 • 11 minuti letti
Multimodal Embeddings in Llama.cpp and GGUF
We brought multimodal embeddings to llama.cpp and GGUF, and uncovered a few surprising issues along the way.
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
settembre 04, 2025 • 6 minuti letti
Jina Code Embeddings: SOTA Code Retrieval at 0.5B and 1.5B
Code generation LLMs → code embeddings: 0.5B/1.5B models achieve SOTA performance across 25 code retrieval benchmarks.
Jina AI
Green "Code Embeddings" text displayed in a LED dot style on a black background, evoking a futuristic and technological atmos
agosto 13, 2025 • 15 minuti letti
Optimizing GGUFs for Decoder-Only Embedding Models
4000 tokens/sec for a 3B-parameter embedding model on L4 GPU is probably as fast as you'll get with llama.cpp. Or is it?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.