Grafico I/O
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
LongEmbed
66.39
Parameters
596M
Rank by score
8 / 69
Pareto front
Behind it
Distribuzione dei valorihelp_outlineAUC 0.8269
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
Attività
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
Correlate10.9%
Negativo difficile2.1%
Non correlate0.9%
Soglie consigliate
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
bilanciata · 0.697
AUC
0.8269
Soglia del rumore
0.855
Crollo del richiamo
0.566
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
σ 0.0313 · 244k valori
Geometria dell'embeddinghelp_outline
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.300
Dim. effettive
70 / 1024
Troncamento delle dimensionihelp_outline
text-matching · Soglia per dimensioni richieste
Coppie linguistichehelp_outline
Dispersione della soglia tra le coppie: 0.024
Scegli i modelli da confrontare
Pubblicazioni (1)
Panoramica
jina-embeddings-v5-text-small è un modello di embedding di testo multilingue con 0,6 miliardi di parametri basato sul backbone Qwen3-0.6B-Base. Produce embedding a 1024 dimensioni tramite il pooling dell'ultimo token e supporta lunghezze di contesto fino a 32.000 token tramite embedding posizionali rotanti (RoPE) con frequenze di base modificate. Il modello include quattro adattatori LoRA specifici per attività per il recupero, la similarità semantica, il clustering e la classificazione, addestrati in modo indipendente sui pesi del backbone congelati. Il Matryoshka Representation Learning consente il troncamento dell'embedding a dimensioni ridotte fino a 32. Il modello viene addestrato utilizzando un processo in due fasi: in primo luogo, la distillazione dell'embedding da Qwen3-Embedding-4B per trasferire la conoscenza dal modello teacher più ampio, seguito dall'addestramento dell'adattatore specifico per attività con funzioni di perdita specializzate per ciascuna categoria di attività. Supporta il recupero asimmetrico con prefissi "Query:" e "Document:".
Metodi
L'addestramento avviene in due fasi. Nella prima fase, la distillazione dell'embedding trasferisce la conoscenza da Qwen3-Embedding-4B (un modello insegnante a 4B parametri) al modello studente Qwen3-0.6B-Base utilizzando una perdita di distanza del coseno tra gli embedding studente proiettati e gli embedding insegnante. Un livello di proiezione lineare mappa lo spazio a 1024 dimensioni dello studente nello spazio a più dimensioni dell'insegnante. La distillazione generica utilizza oltre 300 set di dati in oltre 30 lingue per 50.000 passaggi, seguita da un addestramento a contesto lungo su documenti lunghi sintetici e naturali (1.000-4.096 token) con parametri RoPE modificati. Nella seconda fase, quattro adattatori LoRA vengono addestrati su pesi backbone congelati: l'adattatore di recupero combina la perdita contrastiva di InfoNCE con negativi rigidi, la perdita di distillazione continua e un regolarizzatore ortogonale globale (GOR) per la robustezza della quantizzazione; L'adattatore di corrispondenza testuale utilizza la perdita di ranking CoSENT per la similarità graduata con distillazione su coppie non valutate; l'adattatore di clustering utilizza la ridistillazione con un'istruzione specifica per l'insegnante relativa al clustering; e l'adattatore di classificazione utilizza la perdita bidirezionale InfoNCE con regolarizzazione della distillazione della conoscenza relazionale. I pesi finali dell'adattatore di recupero vengono calcolati in media tra i checkpoint.
Prestazione
Su MMTEB (multilingue), jina-embeddings-v5-text-small ottiene una media di 67,0 (a livello di task) e 58,9 (a livello di tipo), il punteggio più alto tra tutti i modelli con meno di 1B parametri. Ottiene un punteggio di 71,3 nella classificazione, 53,4 nel clustering, 82,9 nella classificazione di coppie, 65,7 nel reranking, 64,9 nel recupero e 78,9 in STS. Su MTEB in inglese, ottiene una media di 71,7, superando Qwen3-0.6B con istruzioni (70,5) e jina-embeddings-v3 (65,7). Nei benchmark specifici per il recupero, ottiene un punteggio di 64,88 nel recupero MTEB-M, 66,84 in RTEB, 56,67 in BEIR e 66,39 in LongEmbed. Il modello supera il suo insegnante Qwen3-4B nella classificazione di coppie (42,0 contro 26,8 su MMTEB) mantenendo punteggi competitivi in tutte le altre categorie, nonostante sia 6 volte più piccolo.
Orientamento
Seleziona l'adattatore LoRA appropriato per la tua attività: "retrieval" per la ricerca asimmetrica di query-documenti (anteponi "Query:" alle query e "Document:" ai passaggi), "text-matching" per attività di similarità simmetrica come il rilevamento di duplicati e l'identificazione di parafrasi (utilizza il prefisso "Document:" per entrambi gli input), "clustering" per raggruppare documenti correlati e "classification" per la categorizzazione e l'analisi del sentiment. Per le attività di retrieval, utilizza sempre il prefisso corretto poiché il modello viene addestrato con codifica asimmetrica. Il troncamento Matryoshka consente di ridurre gli embedding da 1024 a un massimo di 32 dimensioni; le prestazioni rimangono elevate sopra le 256 dimensioni, ma peggiorano notevolmente al di sotto di tale soglia, in linea con i limiti di Johnson-Lindenstrauss. La quantizzazione binaria è supportata con una perdita minima di prestazioni grazie alla regolarizzazione GOR. La finestra di contesto da 32K gestisce nativamente i documenti lunghi, ma il modello è stato addestrato anche su dati di contesto lunghi per un recupero affidabile di documenti lunghi. Utilizza la similarità del coseno per il confronto tramite incorporamento. Il modello è disponibile tramite l'API Jina AI, Hugging Face (con integrazione di Sentence Transformers e vLLM) e varianti quantizzate per llama.cpp.
Blog che menzionano questo modello






