Panoramica
jina-embedding-b-en-v1 fu il primo modello di embedding del testo pubblicato da Jina AI: un encoder bidirezionale da 110M parametri che mappa il testo inglese in vettori a 768 dimensioni. Progettato per la ricerca semantica, il confronto di similarità e la raccomandazione di contenuti in un'epoca in cui il contesto di 512 token era lo standard del settore, stabilì l'ingresso di Jina nello spazio degli embedding open source. Il modello è oggi legacy ed è stato superato dalle famiglie v2 e v3, che supportano contesti di 8K+ token e input multilingue.
Metodi
Il modello usa un'architettura T5-encoder con mean pooling per produrre rappresentazioni di lunghezza fissa a 768 dimensioni. L'addestramento seguì una ricetta contrastiva in due fasi sul dataset Linnaeus-Clean (385M coppie di frasi filtrate da 1,6B candidati): prima, una perdita InfoNCE sulle coppie di testo positive per imparare l'allineamento semantico; seconda, una perdita a tripli per affinare la discriminazione tra testi simili ma semanticamente distinti. Una decisione di progettazione chiave fu la strategia di mean pooling, che media le rappresentazioni a livello di token per produrre un singolo vettore che cattura il significato globale della frase. La finestra di contesto di 512 token era standard per l'epoca ma limita l'utilità del modello per le applicazioni a documento lungo.
Prestazione
Su STS12, il modello raggiunse un punteggio di correlazione di 0,751, superando all-mpnet-base-v2 e all-minilm-l6-v2 al momento del rilascio. Dimostrò un forte rendimento sui task standard di embedding di frasi in inglese mantenendo tempi di inferenza rapidi adatti alla produzione. La sua finestra di contesto di 512 token e il focus solo in inglese lo rese inadatto ai carichi di lavoro a documento lungo e multilingue che diventarono standard entro il 2025. Il modello è stato superato da jina-embeddings-v2-base-en (contesto di 8K, ALiBi bidirezionale) e jina-embeddings-v3 (570M parametri, 89 lingue, adattatori LoRA specifici per il task).
Orientamento
Questo modello è legacy e non dovrebbe essere usato per nuovi progetti. Se si migra da jina-embedding-b-en-v1, aggiornare a jina-embeddings-v5-text-small per i carichi di lavoro attuali — supporta contesto di 32K token, 89 lingue e adattatori LoRA specifici per il task. Per esigenze di embedding specifiche del codice, usare jina-code-embeddings-1.5b. Il modello richiede hardware con supporto CUDA per le prestazioni ottimali e accetta input fino a 512 token. Non è adatto a contenuto multilingue, documenti lunghi o applicazioni incentrate sul codice.
