Panoramica
jina-embeddings-v5-text-nano è un modello di embedding testuale multilingue da 239M parametri costruito sul backbone EuroBERT-210M. Supporta un contesto di 8K token, produce embedding di 768 dimensioni con troncamento Matryoshka fino a 32 dimensioni e offre la più alta accuratezza per parametro nella famiglia di embedding sub-500M di Jina. Progettato per deployment edge, applicazioni sensibili alla latenza e ambienti a risorse limitate dove una GPU completa non è disponibile.
Metodi
Il modello è costruito su EuroBERT-210M, un encoder bidirezionale compatto preaddestrato su dati multilingue che coprono 15 lingue principali. Impiega il Last-Token-Pooling per generare embedding dalla rappresentazione del token finale. L'addestramento segue una ricetta di distillazione in due fasi: prima, la distillazione della conoscenza da un modello teacher più grande trasferisce la qualità dell'embedding; poi, una perdita contrastiva specifica per il task affina il modello su retrieval, text-matching, clustering e classificazione. Matryoshka Representation Learning consente di troncare le dimensioni degli embedding a qualsiasi dimensione supportata (32, 64, 128, 256, 512, 768) mantenendo prestazioni solide. Geometric Orthogonal Regularization (GOR) limita il degrado delle prestazioni sotto quantizzazione binaria a meno di 2 punti sul MTEB retrieval. La finestra di contesto di 8K abilita l'elaborazione di documenti lunghi senza chunking.
Prestazione
Su MMTEB (multilingue), il modello raggiunge 65,5 di media (livello task) e 57,7 di media (livello tipo) con appena 239M parametri, superando tutti i modelli sotto 500M, inclusi KaLM-mini-v2.5 (60,1, 494M), voyage-4-nano (58,9, 480M) e Gemma-300M (61,1, 308M). Punteggi a livello task: classificazione 69,2, clustering 52,7, classificazione di coppie 81,9, reranking 64,6, retrieval 63,3, STS 78,2. Su MTEB in inglese, raggiunge 71,0 di media, quasi all'altezza del molto più grande jina-embeddings-v5-text-small (71,7). Specifico per la retrieval: 63,26 su MTEB-M, 64,08 su RTEB, 56,06 su BEIR, 63,65 su LongEmbed. Gli embedding restano robusti sotto quantizzazione binaria grazie alla regolarizzazione GOR.
Orientamento
Seleziona il prefisso di task appropriato: 'retrieval' per la ricerca asimmetrica query-documento, 'text-matching' per similarità simmetrica, 'clustering' per il raggruppamento, 'classification' per la categorizzazione. Il troncamento Matryoshka a 256 dimensioni preserva oltre il 95% della qualità del retrieval riducendo lo storage del 67%. La quantizzazione binaria è supportata per una ulteriore riduzione dello storage. Il backbone EuroBERT offre forte copertura per 15 lingue principali, tra cui inglese, francese, tedesco, spagnolo, cinese, giapponese, arabo e hindi. Usa la similarità coseno per confrontare gli embedding. Disponibile via l'API Jina AI, Hugging Face (Sentence Transformers, vLLM) e varianti quantizzate per llama.cpp. Per carichi che richiedono contesto di 32K o maggiore accuratezza, usa invece jina-embeddings-v5-text-small.






