Grafico I/O 1
Grafico I/O 2
Grafico I/O 3
Grafico I/O 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
Distribuzione dei valorihelp_outlineAUC 0.8269
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
Attività
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
Correlate10.9%
Negativo difficile2.1%
Non correlate0.9%
Soglie consigliate
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
bilanciata · 0.697
AUC
0.8269
Soglia del rumore
0.855
Crollo del richiamo
0.566
Coppie misurate
119 / 11k
Questo modello condivide la torre testuale con jina-embeddings-v5-text-small. Le distribuzioni qui riportate sono quelle di quel modello, con cui coincide alla precisione fp16 del trasporto.
Componenti del vettorehelp_outline
σ 0.0313 · 244k valori
Geometria dell'embeddinghelp_outline
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.300
Dim. effettive
70 / 1024
Troncamento delle dimensionihelp_outline
text-matching · Soglia per dimensioni richieste
Coppie linguistichehelp_outline
Dispersione della soglia tra le coppie: 0.024
Scegli i modelli da confrontare
Pubblicazioni (1)
Panoramica
jina-embeddings-v5-omni-small (~1,74 miliardi di parametri) è un modello di embedding multimodale che accetta testo, immagini, video e audio e produce embedding in uno spazio vettoriale condiviso allineato con jina-embeddings-v5-text-small. È possibile indicizzare con il testo ed eseguire query con qualsiasi modalità, o viceversa, senza reindicizzazione. La struttura di base del testo e tutti e quattro gli adattatori LoRA specifici per l'attività (recupero, corrispondenza del testo, clustering, classificazione) vengono bloccati durante l'addestramento multimodale, quindi gli output di solo testo sono bit-identici a jina-embeddings-v5-text-small. Il modello produce embedding a 1024 dimensioni con troncamento Matryoshka fino a 32 dimensioni e supporta una lunghezza del contesto del token di 32K.
Metodi
Addestrato in una terza fase che estende jina-embeddings-v5-text-small. La struttura di base del testo e tutti e quattro gli adattatori LoRA specifici per il compito sono congelati; solo i proiettori cross-modali sono stati addestrati ex novo. Un codificatore visivo SigLIP2 So400m gestisce immagini e video (32 frame campionati uniformemente). Un codificatore audio Whisper-large-v3 gestisce l'input audio. Le pagine PDF vengono renderizzate come immagini ed elaborate attraverso il percorso visivo. L'addestramento utilizza la perdita contrastiva con hard negative cross-modali per allineare le rappresentazioni visive e audio con lo spazio di embedding del testo esistente.
Prestazione
Le prestazioni del solo testo sono identiche a quelle di jina-embeddings-v5-text-small: l'infrastruttura testuale e gli adattatori LoRA rimangono invariati durante l'addestramento multimodale. Nel recupero cross-modale, il modello dimostra un forte allineamento tra attività testo-immagine, testo-audio e testo-video. Il recupero delle pagine PDF viene gestito tramite il percorso visivo. Il modello omni-small offre il miglior compromesso tra accuratezza ed efficienza tra i modelli di embedding multimodale Jina per l'implementazione su server.
Orientamento
Stessi quattro adattatori LoRA di v5-text-small: recupero, corrispondenza del testo, clustering e classificazione. Per gli input multimodali tramite API, è possibile passare direttamente URL di immagini, file audio, file video o file PDF: il modello instrada ciascuna modalità attraverso il codificatore appropriato. I formati audio supportati includono WAV, MP3, FLAC, OGG, M4A e Opus. Gli input video vengono elaborati come 32 frame campionati uniformemente. È possibile combinare liberamente le modalità all'interno di un singolo batch: lo spazio di embedding è condiviso tra tutte le modalità. Utilizzare la similarità del coseno per il confronto. È supportata la troncazione Matryoshka da 1024 a 32 dimensioni. Gli embedding di solo testo sono compatibili direttamente con jina-embeddings-v5-text-small: non è necessaria alcuna reindicizzazione durante l'aggiornamento.
Blog che menzionano questo modello



