Grafico I/O 1

multiplo

Vettore

Domanda

jina-colbert-v2

Grafico I/O 2

multiplo

Vettore

Documento

jina-colbert-v2

Frontiera di Pareto
300M1B3.0B10B4050607080bge-m3 (multi-vector)bge-reranker-v2-gemmabge-reranker-v2-m3bge-reranker-v2.5-gemma…ColBERT-ZeroGTE-ModernColBERT-v1jina-reranker-m0jina-reranker-v2-base-m…jina-reranker-v3jina-reranker-v3.5LFM2.5-ColBERT-350Mmxbai-rerank-base-v2mxbai-rerank-large-v2PLAID-XQwen3-Reranker-0.6BQwen3-Reranker-4Bjina-colbert-v2Parametri (log)nDCG@10
Questo modello
Sulla frontiera
Jina AI
Altri
MIRACL
62.30
Parametri
559M
Classifica per punteggio
13 / 17
Frontiera di Pareto
Dietro
Distribuzione dei valori
AUC 0.9726
Corpus
Coppie di traduzione
Codice
19.141518202325
Correlate81.0%
Negativo difficile10.3%
Non correlate0.8%
Soglie consigliate
FPR 0.1 · 17.83
FPR 0.01 · 19.14
FPR 0.001 · 21.08
FPR 0.0001 · 23.67
bilanciata · 18.66
AUC
0.9726
Soglia del rumore
21.05
Crollo del richiamo
16.22
Coppie misurate
100 / 9.200
Punteggio per posizione
12345678910
Punteggio medio a ogni posizione
Scegli i modelli da confrontare
Pubblicazioni (1)

Panoramica

jina-colbert-v2 è un modello di retrieval a interazione tardiva multilingue da 560M parametri che supporta 89 lingue. È il primo modello ColBERT-like multilingue a generare embedding compatti a livello di token (64–128 dimensioni per token), abilitando una retrieval multilingue scalabile ed economica. L'apprendimento delle rappresentazioni Matryoshka consente la riduzione delle dimensioni da 128 a 64 con solo un calo dell'1,5% delle prestazioni, dimezzando i requisiti di archiviazione.

Metodi

Il modello si basa sull'architettura a interazione tardiva di ColBERT con un backbone XLM-RoBERTa modificato (560M parametri), migliorato con embedding posizionali rotazionali e ottimizzato con Flash Attention. L'addestramento prevede due fasi chiave: (1) pre-addestramento iniziale con dati debolmente supervisionati e variegati di diverse lingue, (2) fine-tuning su dati tripli etichettati e distillazione supervisionata da un modello teacher più grande. L'innovazione chiave è l'implementazione dell'apprendimento delle rappresentazioni Matryoshka per gli embedding multi-vettore: il modello produce vettori a livello di token in 128, 96 o 64 dimensioni da un unico processo di addestramento, abilitando l'ottimizzazione dinamica dello storage senza ri-addestramento. Il contesto di documento di 8.192 token (estendibile a 12.288) e il limite di query di 32 token sono gestiti tramite codifiche posizionali ALiBi.

Prestazione

Il modello raggiunge un miglioramento del 6,5% rispetto all'originale ColBERT-v2 sui task in inglese, con un punteggio medio di 0,521 su 14 benchmark BEIR. Supera i tradizionali metodi di retrieval basati su BM25 in tutte le lingue testate sui benchmark MIRACL, mostrando una forza particolare nei scenari cross-linguistici. Il passaggio da 128 a 64 dimensioni comporta solo un calo dell'1,5% delle prestazioni mentre dimezza i requisiti di archiviazione — ad esempio, archiviare 100 milioni di documenti con vettori a 64 dimensioni costa 659,62 $/mese su AWS, contro 1.319,24 $ per 128 dimensioni. La copertura multilingue del modello (89 lingue) e gli embedding di token compatti lo rendono unico per le applicazioni di retrieval globale.

Orientamento

Il modello richiede hardware con supporto CUDA per le prestazioni ottimali. Supporta lunghezze di documento fino a 8.192 token (estendibili a 12.288) limitando le query a 32 token. Per il deployment in produzione è disponibile tramite Jina Search Foundation API, AWS marketplace e Azure, con una versione non commerciale su Hugging Face. Durante l'implementazione, specifica se stai facendo embedding di query o di documenti — il modello usa codifica asimmetrica. Il modello non è progettato per l'elaborazione in tempo reale di collezioni di documenti estremamente grandi senza indicizzazione adeguata; usa FAISS, Qdrant o Weaviate per la ricerca ANN. Per task specifici di dominio, considera il fine-tuning sul tuo corpus. Per la retrieval a vettore singolo con output di dimensionalità superiore, considera jina-embeddings-v4 (modalità multi-vettore) o jina-embeddings-v5-text-small.

Blog che menzionano questo modello
ottobre 03, 2025 • 7 minuti letti
Jina Reranker v3: Reranker Listwise da 0.6B per il recupero multilingue SOTA
Nuovo *reranker* *listwise* da 0.6 miliardi di parametri che considera la query e tutti i documenti candidati in una singola finestra di contesto.
dicembre 16, 2024 • 2 minuti letti
Re·Search: Order 2024 Annuario dei Progressi della Fondazione per la Ricerca
Scopri Re·Search, il nostro esclusivo annuario che presenta i nostri migliori articoli di ricerca e modelli di ricerca fondamentali del 2024. Con copertina rigida rifinita in UV spot, 160 pagine a colori e design meticoloso in ogni dettaglio. Disponibile in tutto il mondo a $35, spedizione inclusa.
ottobre 29, 2024 • 11 minuti letti
Oltre CLIP: Come Jina-CLIP fa progredire la ricerca multimodale
Scopri come Jina-CLIP migliora CLIP di OpenAI con una maggiore accuratezza nel recupero e risultati più diversificati attraverso embedding unificati di testo e immagini.
agosto 30, 2024 • 10 minuti letti
ColBERT v2 di Jina: Retriever di interazione tardiva multilingue per embedding e reranking
Jina ColBERT v2 supporta 89 lingue con prestazioni di recupero superiori, dimensioni di output controllate dall'utente e una lunghezza di token di 8192.
febbraio 20, 2024 • 16 minuti letti
Cosa sono ColBERT e Late Interaction e perché sono importanti nella ricerca?
ColBERT di Jina AI su Hugging Face sta facendo parlare molto su Twitter, portando una nuova prospettiva alla ricerca con la sua capacità di gestire 8192 token. Questo articolo analizza le sfumature di ColBERT e ColBERTv2, mostrando i loro design innovativi e spiegando perché la loro funzionalità di interazione tardiva rappresenta una svolta rivoluzionaria per la ricerca.