Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Incorporamenti
copyright CC BY-NC 4.0
open_in_new Pubblicazione post

jina-embeddings-v5-text-small

Incorporamenti multilingue SOTA con adattatori specifici per attività
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2026-02-18
Ingresso
abc
Testo
arrow_forward
Produzione
more_horiz
Vettore
Dimensioni Matryoshka help_outline
32
64
128
256
512
1024
Dettagli del modello
Parametri: 677M
Lunghezza del token di input: 32K
Dimensione di uscita: 1024
Modello base help_outline
open_in_new
Qwen3-0.6B-Base
Lingue addestrate help_outline
32 lingue
Lingue supportate help_outline
93 lingue
Quantizzazioni help_outline
GGUF
Supporto Apple Silicon help_outline
MLX
Modelli correlati
link
jina-embeddings-v3
link
jina-embeddings-v5-text-nano
Attività supportate
search Recupero
compare_arrows Corrispondenza del testo
bubble_chart Raggruppamento
label Classificazione
Disponibile tramite
Elastic Inference Service
API di Jina
AWS SageMaker
Hugging Face
Air-gapped
Grafico I/O

Testo

jina-embeddings-v5-text-small

Compito

Vettore

Pareto fronthelp_outline
MMTEB
MIRACL
RTEB public
LongEmbed
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v5-text…Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
LongEmbed
66.39
Parameters
596M
Rank by score
8 / 69
Pareto front
Behind it
Distribuzione dei valorihelp_outline
AUC 0.8269
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
Attività
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Correlate10.9%
Negativo difficile2.1%
Non correlate0.9%
Soglie consigliate
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
bilanciata · 0.697
AUC
0.8269
Soglia del rumore
0.855
Crollo del richiamo
0.566
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
-0.160.010.18
σ 0.0313 · 244k valori
Geometria dell'embeddinghelp_outline
01024
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.300
Dim. effettive
70 / 1024
Troncamento delle dimensionihelp_outline
32641282565121024
text-matching · Soglia per dimensioni richieste
Coppie linguistichehelp_outline
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.024
Scegli i modelli da confrontare
Pubblicazioni (1)
SIGIR 2026
febbraio 17, 2026
jina-embeddings-v5-text: Task-Targeted Embedding Distillation

Panoramica

jina-embeddings-v5-text-small è un modello di embedding di testo multilingue con 0,6 miliardi di parametri basato sul backbone Qwen3-0.6B-Base. Produce embedding a 1024 dimensioni tramite il pooling dell'ultimo token e supporta lunghezze di contesto fino a 32.000 token tramite embedding posizionali rotanti (RoPE) con frequenze di base modificate. Il modello include quattro adattatori LoRA specifici per attività per il recupero, la similarità semantica, il clustering e la classificazione, addestrati in modo indipendente sui pesi del backbone congelati. Il Matryoshka Representation Learning consente il troncamento dell'embedding a dimensioni ridotte fino a 32. Il modello viene addestrato utilizzando un processo in due fasi: in primo luogo, la distillazione dell'embedding da Qwen3-Embedding-4B per trasferire la conoscenza dal modello teacher più ampio, seguito dall'addestramento dell'adattatore specifico per attività con funzioni di perdita specializzate per ciascuna categoria di attività. Supporta il recupero asimmetrico con prefissi "Query:" e "Document:".

Metodi

L'addestramento avviene in due fasi. Nella prima fase, la distillazione dell'embedding trasferisce la conoscenza da Qwen3-Embedding-4B (un modello insegnante a 4B parametri) al modello studente Qwen3-0.6B-Base utilizzando una perdita di distanza del coseno tra gli embedding studente proiettati e gli embedding insegnante. Un livello di proiezione lineare mappa lo spazio a 1024 dimensioni dello studente nello spazio a più dimensioni dell'insegnante. La distillazione generica utilizza oltre 300 set di dati in oltre 30 lingue per 50.000 passaggi, seguita da un addestramento a contesto lungo su documenti lunghi sintetici e naturali (1.000-4.096 token) con parametri RoPE modificati. Nella seconda fase, quattro adattatori LoRA vengono addestrati su pesi backbone congelati: l'adattatore di recupero combina la perdita contrastiva di InfoNCE con negativi rigidi, la perdita di distillazione continua e un regolarizzatore ortogonale globale (GOR) per la robustezza della quantizzazione; L'adattatore di corrispondenza testuale utilizza la perdita di ranking CoSENT per la similarità graduata con distillazione su coppie non valutate; l'adattatore di clustering utilizza la ridistillazione con un'istruzione specifica per l'insegnante relativa al clustering; e l'adattatore di classificazione utilizza la perdita bidirezionale InfoNCE con regolarizzazione della distillazione della conoscenza relazionale. I pesi finali dell'adattatore di recupero vengono calcolati in media tra i checkpoint.

Prestazione

Su MMTEB (multilingue), jina-embeddings-v5-text-small ottiene una media di 67,0 (a livello di task) e 58,9 (a livello di tipo), il punteggio più alto tra tutti i modelli con meno di 1B parametri. Ottiene un punteggio di 71,3 nella classificazione, 53,4 nel clustering, 82,9 nella classificazione di coppie, 65,7 nel reranking, 64,9 nel recupero e 78,9 in STS. Su MTEB in inglese, ottiene una media di 71,7, superando Qwen3-0.6B con istruzioni (70,5) e jina-embeddings-v3 (65,7). Nei benchmark specifici per il recupero, ottiene un punteggio di 64,88 nel recupero MTEB-M, 66,84 in RTEB, 56,67 in BEIR e 66,39 in LongEmbed. Il modello supera il suo insegnante Qwen3-4B nella classificazione di coppie (42,0 contro 26,8 su MMTEB) mantenendo punteggi competitivi in tutte le altre categorie, nonostante sia 6 volte più piccolo.

Orientamento

Seleziona l'adattatore LoRA appropriato per la tua attività: "retrieval" per la ricerca asimmetrica di query-documenti (anteponi "Query:" alle query e "Document:" ai passaggi), "text-matching" per attività di similarità simmetrica come il rilevamento di duplicati e l'identificazione di parafrasi (utilizza il prefisso "Document:" per entrambi gli input), "clustering" per raggruppare documenti correlati e "classification" per la categorizzazione e l'analisi del sentiment. Per le attività di retrieval, utilizza sempre il prefisso corretto poiché il modello viene addestrato con codifica asimmetrica. Il troncamento Matryoshka consente di ridurre gli embedding da 1024 a un massimo di 32 dimensioni; le prestazioni rimangono elevate sopra le 256 dimensioni, ma peggiorano notevolmente al di sotto di tale soglia, in linea con i limiti di Johnson-Lindenstrauss. La quantizzazione binaria è supportata con una perdita minima di prestazioni grazie alla regolarizzazione GOR. La finestra di contesto da 32K gestisce nativamente i documenti lunghi, ma il modello è stato addestrato anche su dati di contesto lunghi per un recupero affidabile di documenti lunghi. Utilizza la similarità del coseno per il confronto tramite incorporamento. Il modello è disponibile tramite l'API Jina AI, Hugging Face (con integrazione di Sentence Transformers e vLLM) e varianti quantizzate per llama.cpp.
Blog che menzionano questo modello
agosto 03, 2026 • 11 minuti letti
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
A 0.6B listwise reranker that beats Qwen3-Reranker-4B on BEIR, reranks up to 1.56x faster than v3, and gains 9.6 nDCG@10 on semi-structured retrieval.
Jina AI
marzo 06, 2026 • 6 minuti letti
Identifying Embedding Models from Raw Numerical Values
A tiny transformer that fingerprints embedding models by reading raw numerical digits. No feature engineering.
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
febbraio 19, 2026 • 7 minuti letti
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Two sub-1B multilingual embeddings with best-in-class performance, available on Elastic Inference Service, Llama.cpp and MLX.
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.