Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Incorporamenti
copyright CC BY-NC 4.0
open_in_new Pubblicazione post

jina-embeddings-v5-omni-small

Incorporamento multimodale per testo, immagini, audio, video e PDF
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2026-05-07
Ingresso
abc
Testo
image
Immagine
audiotrack
Audio
videocam
Video
picture_as_pdf
PDF
arrow_forward
Produzione
more_horiz
Vettore
Dimensioni Matryoshka help_outline
32
64
128
256
512
768
1024
Dettagli del modello
Parametri: 1.7B
Lunghezza del token di input: 32K
Dimensione di uscita: 1024
Modello base help_outline
open_in_new
jina-embeddings-v5-text-small
Lingue addestrate help_outline
32 lingue
Lingue supportate help_outline
93 lingue
Quantizzazioni help_outline
GGUF
Supporto Apple Silicon help_outline
MLX
Modelli correlati
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
Attività supportate
search Recupero
compare_arrows Corrispondenza del testo
bubble_chart Raggruppamento
label Classificazione
Disponibile tramite
Elastic Inference Service
API di Jina
AWS SageMaker
Hugging Face
Air-gapped
Grafico I/O 1

Testo

jina-embeddings-v5-omni-small

Immagine

Compito

Vettore

Grafico I/O 2

Testo

jina-embeddings-v5-omni-small

Audio

Compito

Vettore

Grafico I/O 3

Testo

jina-embeddings-v5-omni-small

Video

Compito

Vettore

Grafico I/O 4

multiplo

Vettore

Testo

jina-embeddings-v5-omni-small

PDF

Compito

Pareto fronthelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
30M100M300M1B3.0B10B20406080bekko-embedding-v1-a25mbge-large-enbge-large-en-v1.5bge-m3bge-small-en-v1.5BOOM-4B-v1e5-base-v2e5-mistral-7b-instructF2LLM-v2-14BF2LLM-v2-330MF2LLM-v2-4BF2LLM-v2-80Mgranite-embedding-small…GritLM-7Bjina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-omni…jina-embeddings-v5-text…jina-embeddings-v5-text…LaBSEMoD-EmbeddingNemotron-3-Embed-8BNV-Embed-v2Octen-Embedding-0.6BOcten-Embedding-4BOcten-Embedding-8Bparaphrase-multilingual…paraphrase-multilingual…PIXIE-Rune-v1.0potion-multilingual-128Msnowflake-arctic-embed-…UAE-Large-V1voyage-4-nanoParameters (log)nDCG@10
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
Distribuzione dei valorihelp_outline
AUC 0.8269
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
Attività
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Correlate10.9%
Negativo difficile2.1%
Non correlate0.9%
Soglie consigliate
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
bilanciata · 0.697
AUC
0.8269
Soglia del rumore
0.855
Crollo del richiamo
0.566
Coppie misurate
119 / 11k
Questo modello condivide la torre testuale con jina-embeddings-v5-text-small. Le distribuzioni qui riportate sono quelle di quel modello, con cui coincide alla precisione fp16 del trasporto.
Componenti del vettorehelp_outline
-0.160.010.18
σ 0.0313 · 244k valori
Geometria dell'embeddinghelp_outline
01024
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.300
Dim. effettive
70 / 1024
Troncamento delle dimensionihelp_outline
32641282565121024
text-matching · Soglia per dimensioni richieste
Coppie linguistichehelp_outline
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.024
Scegli i modelli da confrontare
Pubblicazioni (1)
SIGIR 2026
maggio 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

Panoramica

jina-embeddings-v5-omni-small (~1,74 miliardi di parametri) è un modello di embedding multimodale che accetta testo, immagini, video e audio e produce embedding in uno spazio vettoriale condiviso allineato con jina-embeddings-v5-text-small. È possibile indicizzare con il testo ed eseguire query con qualsiasi modalità, o viceversa, senza reindicizzazione. La struttura di base del testo e tutti e quattro gli adattatori LoRA specifici per l'attività (recupero, corrispondenza del testo, clustering, classificazione) vengono bloccati durante l'addestramento multimodale, quindi gli output di solo testo sono bit-identici a jina-embeddings-v5-text-small. Il modello produce embedding a 1024 dimensioni con troncamento Matryoshka fino a 32 dimensioni e supporta una lunghezza del contesto del token di 32K.

Metodi

Addestrato in una terza fase che estende jina-embeddings-v5-text-small. La struttura di base del testo e tutti e quattro gli adattatori LoRA specifici per il compito sono congelati; solo i proiettori cross-modali sono stati addestrati ex novo. Un codificatore visivo SigLIP2 So400m gestisce immagini e video (32 frame campionati uniformemente). Un codificatore audio Whisper-large-v3 gestisce l'input audio. Le pagine PDF vengono renderizzate come immagini ed elaborate attraverso il percorso visivo. L'addestramento utilizza la perdita contrastiva con hard negative cross-modali per allineare le rappresentazioni visive e audio con lo spazio di embedding del testo esistente.

Prestazione

Le prestazioni del solo testo sono identiche a quelle di jina-embeddings-v5-text-small: l'infrastruttura testuale e gli adattatori LoRA rimangono invariati durante l'addestramento multimodale. Nel recupero cross-modale, il modello dimostra un forte allineamento tra attività testo-immagine, testo-audio e testo-video. Il recupero delle pagine PDF viene gestito tramite il percorso visivo. Il modello omni-small offre il miglior compromesso tra accuratezza ed efficienza tra i modelli di embedding multimodale Jina per l'implementazione su server.

Orientamento

Stessi quattro adattatori LoRA di v5-text-small: recupero, corrispondenza del testo, clustering e classificazione. Per gli input multimodali tramite API, è possibile passare direttamente URL di immagini, file audio, file video o file PDF: il modello instrada ciascuna modalità attraverso il codificatore appropriato. I formati audio supportati includono WAV, MP3, FLAC, OGG, M4A e Opus. Gli input video vengono elaborati come 32 frame campionati uniformemente. È possibile combinare liberamente le modalità all'interno di un singolo batch: lo spazio di embedding è condiviso tra tutte le modalità. Utilizzare la similarità del coseno per il confronto. È supportata la troncazione Matryoshka da 1024 a 32 dimensioni. Gli embedding di solo testo sono compatibili direttamente con jina-embeddings-v5-text-small: non è necessaria alcuna reindicizzazione durante l'aggiornamento.
Blog che menzionano questo modello
maggio 12, 2026 • 7 minuti letti
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.