Panoramica
jina-colbert-v2 è un modello di retrieval a interazione tardiva multilingue da 560M parametri che supporta 89 lingue. È il primo modello ColBERT-like multilingue a generare embedding compatti a livello di token (64–128 dimensioni per token), abilitando una retrieval multilingue scalabile ed economica. L'apprendimento delle rappresentazioni Matryoshka consente la riduzione delle dimensioni da 128 a 64 con solo un calo dell'1,5% delle prestazioni, dimezzando i requisiti di archiviazione.
Metodi
Il modello si basa sull'architettura a interazione tardiva di ColBERT con un backbone XLM-RoBERTa modificato (560M parametri), migliorato con embedding posizionali rotazionali e ottimizzato con Flash Attention. L'addestramento prevede due fasi chiave: (1) pre-addestramento iniziale con dati debolmente supervisionati e variegati di diverse lingue, (2) fine-tuning su dati tripli etichettati e distillazione supervisionata da un modello teacher più grande. L'innovazione chiave è l'implementazione dell'apprendimento delle rappresentazioni Matryoshka per gli embedding multi-vettore: il modello produce vettori a livello di token in 128, 96 o 64 dimensioni da un unico processo di addestramento, abilitando l'ottimizzazione dinamica dello storage senza ri-addestramento. Il contesto di documento di 8.192 token (estendibile a 12.288) e il limite di query di 32 token sono gestiti tramite codifiche posizionali ALiBi.
Prestazione
Il modello raggiunge un miglioramento del 6,5% rispetto all'originale ColBERT-v2 sui task in inglese, con un punteggio medio di 0,521 su 14 benchmark BEIR. Supera i tradizionali metodi di retrieval basati su BM25 in tutte le lingue testate sui benchmark MIRACL, mostrando una forza particolare nei scenari cross-linguistici. Il passaggio da 128 a 64 dimensioni comporta solo un calo dell'1,5% delle prestazioni mentre dimezza i requisiti di archiviazione — ad esempio, archiviare 100 milioni di documenti con vettori a 64 dimensioni costa 659,62 $/mese su AWS, contro 1.319,24 $ per 128 dimensioni. La copertura multilingue del modello (89 lingue) e gli embedding di token compatti lo rendono unico per le applicazioni di retrieval globale.
Orientamento
Il modello richiede hardware con supporto CUDA per le prestazioni ottimali. Supporta lunghezze di documento fino a 8.192 token (estendibili a 12.288) limitando le query a 32 token. Per il deployment in produzione è disponibile tramite Jina Search Foundation API, AWS marketplace e Azure, con una versione non commerciale su Hugging Face. Durante l'implementazione, specifica se stai facendo embedding di query o di documenti — il modello usa codifica asimmetrica. Il modello non è progettato per l'elaborazione in tempo reale di collezioni di documenti estremamente grandi senza indicizzazione adeguata; usa FAISS, Qdrant o Weaviate per la ricerca ANN. Per task specifici di dominio, considera il fine-tuning sul tuo corpus. Per la retrieval a vettore singolo con output di dimensionalità superiore, considera jina-embeddings-v4 (modalità multi-vettore) o jina-embeddings-v5-text-small.









