Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Embeddings
copyright CC BY-NC 4.0
open_in_new Post di rilascio

jina-embeddings-v5-omni-nano

Integrazioni multimodali compatte per la distribuzione edge
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2026-05-07
Ingresso
abc
Testo
image
Immagine
audiotrack
Audio
videocam
Video
picture_as_pdf
PDF
arrow_forward
Produzione
more_horiz
Vettore
Dimensioni Matryoshka help_outline
32
64
128
256
512
768
Dettagli del modello
Parametri: 1.0B
Lunghezza del token di input: 8K
Dimensione di uscita: 768
Modello base help_outline
link
jina-embeddings-v5-text-nano
open_in_new
SigLIP2 Base
open_in_new
Whisper-large-v3
Lingue addestrate help_outline
32 lingue
Lingue supportate help_outline
108 lingue
Quantizzazioni help_outline
GGUF
Supporto Apple Silicon help_outline
MLX
Modelli correlati
link
jina-embeddings-v5-omni-small
link
jina-embeddings-v5-text-nano
link
jina-embeddings-v3
link
jina-clip-v2
Attività supportate
search Recupero
compare_arrows Corrispondenza del testo
bubble_chart Raggruppamento
label Classificazione
Disponibile tramite
Elastic Inference Service
API di Jina
AWS SageMaker
Hugging Face
Air-gapped
Grafico I/O 1

Testo

jina-embeddings-v5-omni-nano

Immagine

Compito

Vettore

Grafico I/O 2

Testo

jina-embeddings-v5-omni-nano

Audio

Compito

Vettore

Grafico I/O 3

Testo

jina-embeddings-v5-omni-nano

Video

Compito

Vettore

Grafico I/O 4

multiplo

Vettore

Testo

jina-embeddings-v5-omni-nano

PDF

Compito

Frontiera di Paretohelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…Parametri (log)score
Questo modello
Sulla frontiera
Jina AI
Altri
MAEB
49.69
Parametri
986M
Classifica per punteggio
6 / 21
Frontiera di Pareto
Sulla
Distribuzione dei valorihelp_outline
AUC 0.8242
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
Attività
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
Correlate20.2%
Negativo difficile1.7%
Non correlate1.1%
Soglie consigliate
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
bilanciata · 0.678
AUC
0.8242
Soglia del rumore
0.840
Crollo del richiamo
0.557
Coppie misurate
119 / 11k
Questo modello condivide la torre testuale con jina-embeddings-v5-text-nano. Le distribuzioni qui riportate sono quelle di quel modello, con cui coincide alla precisione fp16 del trasporto.
Componenti del vettorehelp_outline
-0.180.000.19
σ 0.0361 · 183k valori
Geometria dell'embeddinghelp_outline
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.288
Dim. effettive
69 / 768
Troncamento delle dimensionihelp_outline
3264128256512768
text-matching · Soglia per dimensioni richieste
Coppie linguistichehelp_outline
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.027
Scegli i modelli da confrontare
Pubblicazioni (1)
SIGIR 2026
maggio 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

Panoramica

jina-embeddings-v5-omni-nano è un modello di embedding multimodale di circa 1,04B parametri che accetta testo, immagini, video e audio, producendo embedding in uno spazio vettoriale condiviso. È la variante compatta della famiglia v5-omni, progettata per hardware edge e consumer dove non è disponibile una GPU. Le uscite solo testo sono bit-identiche a jina-embeddings-v5-text-nano, rendendolo un upgrade drop-in da testo solo a multimodale senza reindicizzazione.

Metodi

Il modello estende jina-embeddings-v5-text-nano con capacità multimodali tramite una terza fase di addestramento. Il backbone testuale EuroBERT-210M e i quattro adattatori LoRA specifici per il task vengono congelati; vengono addestrati solo i proiettori cross-modale. Un vision encoder SigLIP2 Base gestisce immagini e video (32 frame campionati uniformemente per video). Un audio encoder Whisper-large-v3 gestisce l'input audio. Le pagine PDF vengono rese come immagini ed elaborate tramite il percorso visivo. L'addestramento usa una perdita contrastiva con negative cross-modali dure per allineare le rappresentazioni visive e audio con lo spazio di embedding testuale esistente. Lo spazio di output di 768 dimensioni supporta il troncamento Matryoshka fino a 32 dimensioni. La finestra di contesto di 8K token copre l'input testuale; gli input di immagine e audio vengono elaborati tramite i rispettivi encoder.

Prestazione

Le performance solo testo sono bit-identiche a jina-embeddings-v5-text-nano (65,5 di media MMTEB a livello task, 71,0 MTEB in inglese). Le performance multimodali sono leggermente inferiori a jina-embeddings-v5-omni-small a causa dello spazio di embedding di 768 dimensioni (contro 1024) e del backbone testuale più piccolo, ma mantengono un forte allineamento cross-modale sul retrieval text-image, text-audio e text-video. Il modello è ottimizzato per CPU e hardware edge, dove il modello omni-small più grande non può girare in modo efficiente. La qualità del retrieval cross-modale è competitiva per la sua classe di dimensioni.

Orientamento

Stesso schema di utilizzo di jina-embeddings-v5-omni-small: seleziona l'adattatore LoRA appropriato (retrieval, text-matching, clustering, classification) e passa direttamente URL di immagini, URL di file audio, URL di file video o URL di PDF via l'API — il modello instrada ciascuna modalità tramite l'encoder appropriato. Formati audio supportati: WAV, MP3, FLAC, OGG, M4A, Opus. Gli input video vengono elaborati come 32 frame campionati uniformemente. Mescola le modalità liberamente all'interno di un singolo batch; lo spazio di embedding è condiviso tra tutte le modalità. Usa la similarità coseno per il confronto. Il troncamento Matryoshka da 768 a 32 dimensioni è supportato. Gli embedding solo testo sono compatibili drop-in con jina-embeddings-v5-text-nano — nessuna reindicizzazione è necessaria al passaggio alla versione superiore. Per deployment su server che richiedono maggiore accuratezza, usa jina-embeddings-v5-omni-small (1024 dimensioni, backbone più grande).

Blog che menzionano questo modello
maggio 12, 2026 • 7 minuti letti
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizie
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.