Aperçu
jina-colbert-v2 est un modèle de recherche late-interaction multilingue de 560M paramètres prenant en charge 89 langues. C'est le premier modèle de type ColBERT multilingue à générer des embeddings de niveau des tokens compacts (64–128 dimensions par token), permettant une recherche multilingue évolutive et économique. L'apprentissage de représentation Matryoshka autorise la réduction de dimension de 128 à 64 avec seulement 1,5 % de baisse de performance, réduisant de moitié les besoins de stockage.
Méthodes
Le modèle s'appuie sur l'architecture late-interaction de ColBERT avec un backbone XLM-RoBERTa modifié (560M paramètres), enrichi d'embeddings de position rotatifs et optimisé avec Flash Attention. L'entraînement implique deux étapes clés : (1) pré-entraînement initial sur des données diversement faiblement supervisées de plusieurs langues, (2) ajustement fin sur des données de triplets étiquetées avec distillation supervisée depuis un modèle enseignant plus grand. L'innovation clé est la mise en œuvre de l'apprentissage de représentation Matryoshka pour les embeddings multi-vecteurs : le modèle produit des vecteurs au niveau des tokens en 128, 96 ou 64 dimensions à partir d'un seul processus d'entraînement, permettant l'optimisation dynamique du stockage sans ré-entraînement. Le contexte de documents de 8 192 tokens (extensible à 12 288) et la limite de requêtes de 32 tokens sont gérés par des encodings positionnels ALiBi.
Performance
Le modèle atteint une amélioration de 6,5 % par rapport au ColBERT-v2 original sur les tâches anglaises, avec un score moyen de 0,521 sur 14 benchmarks BEIR. Il surpasse les méthodes de recherche traditionnelles basées sur BM25 dans toutes les langues testées sur les benchmarks MIRACL, montrant une force particulière dans les scénarios interlinguistiques. Passer de 128 à 64 dimensions ne provoque qu'une baisse de 1,5 % de performance tout en réduisant de moitié les besoins de stockage — par exemple, stocker 100 millions de documents avec des vecteurs de 64 dimensions coûte 659,62 $/mois sur AWS, contre 1 319,24 $ pour 128 dimensions. La couverture multilingue du modèle (89 langues) et ses embeddings de tokens compacts le rendent unique pour les applications de recherche mondiale.
Conseils
Le modèle nécessite du matériel compatible CUDA pour une performance optimale. Il prend en charge des longueurs de documents jusqu'à 8 192 tokens (extensibles à 12 288), tout en limitant les requêtes à 32 tokens. Pour le déploiement en production, il est disponible via la Jina Search Foundation API, le marketplace AWS et Azure, avec une version non commerciale sur Hugging Face. Lors de la mise en œuvre, précisez si vous encodez des requêtes ou des documents — le modèle utilise un encodage asymétrique. Le modèle n'est pas conçu pour le traitement en temps réel de collections de documents extrêmement grandes sans indexation appropriée ; utilisez FAISS, Qdrant ou Weaviate pour la recherche ANN. Pour les tâches spécifiques à un domaine, envisagez l'ajustement fin sur votre corpus. Pour la recherche à vecteur unique avec une sortie plus dimensionnelle, envisagez jina-embeddings-v4 (mode multi-vecteur) ou jina-embeddings-v5-text-small.









