Panoramica
jina-embeddings-v2-base-en è un modello di embedding del testo inglese da 137M parametri con una finestra di contesto di 8.192 token: 16 volte il limite standard di 512 token della sua epoca. Costruito su un backbone BERT-small con ALiBi bidirezionale simmetrica (Attention with Linear Biases), è stato il primo embedding Jina open source in grado di gestire nativamente documenti lunghi senza troncatura né chunking. Produce vettori a 768 dimensioni e resta una scelta solida per la retrieval solo in inglese quando non sono necessarie le funzionalità multilingua o di lungo contesto di v3/v5.
Metodi
L'architettura abbina un transformer BERT-small (12 layer, 12 teste di attenzione, 768 dimensioni nascoste) a codifiche posizionali ALiBi bidirezionali simmetriche. ALiBi sostituisce gli embedding posizionali appresi con un bias di attenzione a decadimento lineare, permettendo al modello di estrapolare ben oltre la sua lunghezza di addestramento di 512 token fino a 8.192 token senza degradazione delle prestazioni. L'addestramento ha seguito una pipeline a due stadi: pre-addestramento su C4, poi fine-tuning sulla collezione curata da Jina di 40+ dataset di coppie di frasi specializzate con mining di negativi difficili. L'attenzione bidirezionale simmetrica assicura che ogni token presti attenzione sia al contesto precedente che a quello successivo, producendo rappresentazioni che catturano il significato globale della frase. Il mean pooling su tutte le rappresentazioni di token produce l'embedding finale a 768 dimensioni.
Prestazione
Al rilascio, il modello ha superato text-embedding-ada-002 di OpenAI su diversi sotto-task MTEB in inglese: classificazione (73,45 % vs 70,93 %), reranking (85,38 % vs 84,89 %), retrieval (56,98 % vs 56,32 %) e riassunto (31,6 % vs 30,8 %). Il suo contesto di 8.192 token è stato un vantaggio significativo rispetto ai modelli concorrenti limitati a 512–2.048 token, abilitando la retrieval a livello di documento senza chunking. Il compatto footprint di 307MB lo rese deployabile su GPU di fascia consumer. Nel 2026, jina-embeddings-v5-text-small (677M parametri, contesto di 32K, adattatori LoRA specifici per il task) lo supera per la maggior parte dei carichi di lavoro di produzione, ma resta rilevante per pipeline leggere solo in inglese.
Orientamento
Usa questo modello per la retrieval solo in inglese quando la finestra di contesto di 8K è sufficiente e non sono necessari adattatori multilingua o specifici per il task. Per documenti che superano 8.192 token, applica il chunking semantico prima dell'embedding. Il modello si integra con i principali database vettoriali (Qdrant, Weaviate, MongoDB Atlas, Milvus) e framework RAG (LangChain, LlamaIndex, Haystack). Per nuovi progetti che richiedono supporto multilingua, contesto di 32K o ottimizzazione specifica per il task, preferisci jina-embeddings-v5-text-small. GPU con supporto CUDA consigliata per il throughput di produzione; l'inferenza su CPU è possibile ma nettamente più lenta.










