Grafico I/O 1
Grafico I/O 2
Grafico I/O 3
Grafico I/O 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
RTEB public
64.08
Parameters
986M
Rank by score
21 / 62
Pareto front
Behind it
Distribuzione dei valorihelp_outlineAUC 0.8242
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
Attività
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
Correlate20.2%
Negativo difficile1.7%
Non correlate1.1%
Soglie consigliate
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
bilanciata · 0.678
AUC
0.8242
Soglia del rumore
0.840
Crollo del richiamo
0.557
Coppie misurate
119 / 11k
Questo modello condivide la torre testuale con jina-embeddings-v5-text-nano. Le distribuzioni qui riportate sono quelle di quel modello, con cui coincide alla precisione fp16 del trasporto.
Componenti del vettorehelp_outline
σ 0.0361 · 183k valori
Geometria dell'embeddinghelp_outline
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.288
Dim. effettive
69 / 768
Troncamento delle dimensionihelp_outline
text-matching · Soglia per dimensioni richieste
Coppie linguistichehelp_outline
Dispersione della soglia tra le coppie: 0.027
Scegli i modelli da confrontare
Pubblicazioni (1)
Panoramica
jina-embeddings-v5-omni-nano (~1,04 miliardi di parametri) è la variante compatta della famiglia v5-omni, progettata per hardware edge e standard. Estende jina-embeddings-v5-text-nano con le stesse capacità multimodali: input di testo, immagini, video e audio in uno spazio vettoriale condiviso. Gli output di solo testo sono identici bit per bit a quelli di jina-embeddings-v5-text-nano. Il modello produce embedding a 768 dimensioni con troncamento Matryoshka fino a 32 dimensioni e supporta una lunghezza di contesto di 8K token.
Metodi
Segue lo stesso addestramento di terzo stadio di omni-small, estendendo jina-embeddings-v5-text-nano. La rete testuale EuroBERT-210M e gli adattatori LoRA sono congelati. I proiettori cross-modali collegano un codificatore visivo SigLIP2 Base e un codificatore audio Whisper-large-v3 alla rete testuale. I dati di addestramento e gli obiettivi rispecchiano quelli di omni-small.
Prestazione
Le prestazioni del solo testo sono identiche a quelle di jina-embeddings-v5-text-nano. Le prestazioni multimodali sono leggermente inferiori a quelle di omni-small a causa dello spazio di embedding più ristretto (768 dimensioni contro 1024) e della struttura di base del testo più piccola, ma mantengono un forte allineamento cross-modale. Ottimizzato per CPU e hardware edge dove il modello omni-small, di dimensioni maggiori, non può essere eseguito.
Orientamento
Stesso schema di utilizzo di omni-small con identica selezione dell'adattatore LoRA e gestione dell'input multimodale. Differenze principali: spazio di output a 768 dimensioni (troncamento Matryoshka fino a 32) e finestra di contesto da 8K. La variante nano funziona su hardware standard senza accelerazione GPU. Gli embedding di solo testo sono compatibili direttamente con jina-embeddings-v5-text-nano.
Blog che menzionano questo modello



