Panoramica
jina-embeddings-v5-omni-nano è un modello di embedding multimodale di circa 1,04B parametri che accetta testo, immagini, video e audio, producendo embedding in uno spazio vettoriale condiviso. È la variante compatta della famiglia v5-omni, progettata per hardware edge e consumer dove non è disponibile una GPU. Le uscite solo testo sono bit-identiche a jina-embeddings-v5-text-nano, rendendolo un upgrade drop-in da testo solo a multimodale senza reindicizzazione.
Metodi
Il modello estende jina-embeddings-v5-text-nano con capacità multimodali tramite una terza fase di addestramento. Il backbone testuale EuroBERT-210M e i quattro adattatori LoRA specifici per il task vengono congelati; vengono addestrati solo i proiettori cross-modale. Un vision encoder SigLIP2 Base gestisce immagini e video (32 frame campionati uniformemente per video). Un audio encoder Whisper-large-v3 gestisce l'input audio. Le pagine PDF vengono rese come immagini ed elaborate tramite il percorso visivo. L'addestramento usa una perdita contrastiva con negative cross-modali dure per allineare le rappresentazioni visive e audio con lo spazio di embedding testuale esistente. Lo spazio di output di 768 dimensioni supporta il troncamento Matryoshka fino a 32 dimensioni. La finestra di contesto di 8K token copre l'input testuale; gli input di immagine e audio vengono elaborati tramite i rispettivi encoder.
Prestazione
Le performance solo testo sono bit-identiche a jina-embeddings-v5-text-nano (65,5 di media MMTEB a livello task, 71,0 MTEB in inglese). Le performance multimodali sono leggermente inferiori a jina-embeddings-v5-omni-small a causa dello spazio di embedding di 768 dimensioni (contro 1024) e del backbone testuale più piccolo, ma mantengono un forte allineamento cross-modale sul retrieval text-image, text-audio e text-video. Il modello è ottimizzato per CPU e hardware edge, dove il modello omni-small più grande non può girare in modo efficiente. La qualità del retrieval cross-modale è competitiva per la sua classe di dimensioni.
Orientamento
Stesso schema di utilizzo di jina-embeddings-v5-omni-small: seleziona l'adattatore LoRA appropriato (retrieval, text-matching, clustering, classification) e passa direttamente URL di immagini, URL di file audio, URL di file video o URL di PDF via l'API — il modello instrada ciascuna modalità tramite l'encoder appropriato. Formati audio supportati: WAV, MP3, FLAC, OGG, M4A, Opus. Gli input video vengono elaborati come 32 frame campionati uniformemente. Mescola le modalità liberamente all'interno di un singolo batch; lo spazio di embedding è condiviso tra tutte le modalità. Usa la similarità coseno per il confronto. Il troncamento Matryoshka da 768 a 32 dimensioni è supportato. Gli embedding solo testo sono compatibili drop-in con jina-embeddings-v5-text-nano — nessuna reindicizzazione è necessaria al passaggio alla versione superiore. Per deployment su server che richiedono maggiore accuratezza, usa jina-embeddings-v5-omni-small (1024 dimensioni, backbone più grande).



