Graphique d'E/S 1

multiple

Vecteur

Requête

jina-colbert-v2

Graphique d'E/S 2

multiple

Vecteur

Document

jina-colbert-v2

Frontière de Pareto
300M1B3.0B10B4050607080bge-m3 (multi-vector)bge-reranker-v2-gemmabge-reranker-v2-m3bge-reranker-v2.5-gemma…ColBERT-ZeroGTE-ModernColBERT-v1jina-reranker-m0jina-reranker-v2-base-m…jina-reranker-v3jina-reranker-v3.5LFM2.5-ColBERT-350Mmxbai-rerank-base-v2mxbai-rerank-large-v2PLAID-XQwen3-Reranker-0.6BQwen3-Reranker-4Bjina-colbert-v2Paramètres (log)nDCG@10
Ce modèle
Sur la frontière
Jina AI
Autres
MIRACL
62.30
Paramètres
559M
Rang par score
13 / 17
Frontière de Pareto
Derrière
Distribution des valeurs
AUC 0.9726
Corpus
Paires de traduction
Code
19.141518202325
Liées81.0%
Négatif difficile10.3%
Non liées0.8%
Seuils recommandés
FPR 0.1 · 17.83
FPR 0.01 · 19.14
FPR 0.001 · 21.08
FPR 0.0001 · 23.67
équilibré · 18.66
AUC
0.9726
Plafond de bruit
21.05
Décrochage du rappel
16.22
Paires mesurées
100 / 9 200
Score par rang
12345678910
Score moyen à chaque position de rang
Choisissez les modèles à comparer
Publications (1)

Aperçu

jina-colbert-v2 est un modèle de recherche late-interaction multilingue de 560M paramètres prenant en charge 89 langues. C'est le premier modèle de type ColBERT multilingue à générer des embeddings de niveau des tokens compacts (64–128 dimensions par token), permettant une recherche multilingue évolutive et économique. L'apprentissage de représentation Matryoshka autorise la réduction de dimension de 128 à 64 avec seulement 1,5 % de baisse de performance, réduisant de moitié les besoins de stockage.

Méthodes

Le modèle s'appuie sur l'architecture late-interaction de ColBERT avec un backbone XLM-RoBERTa modifié (560M paramètres), enrichi d'embeddings de position rotatifs et optimisé avec Flash Attention. L'entraînement implique deux étapes clés : (1) pré-entraînement initial sur des données diversement faiblement supervisées de plusieurs langues, (2) ajustement fin sur des données de triplets étiquetées avec distillation supervisée depuis un modèle enseignant plus grand. L'innovation clé est la mise en œuvre de l'apprentissage de représentation Matryoshka pour les embeddings multi-vecteurs : le modèle produit des vecteurs au niveau des tokens en 128, 96 ou 64 dimensions à partir d'un seul processus d'entraînement, permettant l'optimisation dynamique du stockage sans ré-entraînement. Le contexte de documents de 8 192 tokens (extensible à 12 288) et la limite de requêtes de 32 tokens sont gérés par des encodings positionnels ALiBi.

Performance

Le modèle atteint une amélioration de 6,5 % par rapport au ColBERT-v2 original sur les tâches anglaises, avec un score moyen de 0,521 sur 14 benchmarks BEIR. Il surpasse les méthodes de recherche traditionnelles basées sur BM25 dans toutes les langues testées sur les benchmarks MIRACL, montrant une force particulière dans les scénarios interlinguistiques. Passer de 128 à 64 dimensions ne provoque qu'une baisse de 1,5 % de performance tout en réduisant de moitié les besoins de stockage — par exemple, stocker 100 millions de documents avec des vecteurs de 64 dimensions coûte 659,62 $/mois sur AWS, contre 1 319,24 $ pour 128 dimensions. La couverture multilingue du modèle (89 langues) et ses embeddings de tokens compacts le rendent unique pour les applications de recherche mondiale.

Conseils

Le modèle nécessite du matériel compatible CUDA pour une performance optimale. Il prend en charge des longueurs de documents jusqu'à 8 192 tokens (extensibles à 12 288), tout en limitant les requêtes à 32 tokens. Pour le déploiement en production, il est disponible via la Jina Search Foundation API, le marketplace AWS et Azure, avec une version non commerciale sur Hugging Face. Lors de la mise en œuvre, précisez si vous encodez des requêtes ou des documents — le modèle utilise un encodage asymétrique. Le modèle n'est pas conçu pour le traitement en temps réel de collections de documents extrêmement grandes sans indexation appropriée ; utilisez FAISS, Qdrant ou Weaviate pour la recherche ANN. Pour les tâches spécifiques à un domaine, envisagez l'ajustement fin sur votre corpus. Pour la recherche à vecteur unique avec une sortie plus dimensionnelle, envisagez jina-embeddings-v4 (mode multi-vecteur) ou jina-embeddings-v5-text-small.

Blogs qui mentionnent ce modèle
octobre 03, 2025 • 7 minutes lues
Jina Reranker v3 : 重排器 Listwise de 0,6B pour une récupération multilingue SOTA
Nouveau réorganisateur listwise de 0,6 milliard de paramètres qui prend en compte la requête et tous les documents candidats dans une seule fenêtre contextuelle.
décembre 16, 2024 • 2 minutes lues
Re·Search : Almanach 2024 des Avancées de la Fondation Search
Découvrez Re·Search, notre livre annuel premium qui présente nos meilleurs articles de recherche et modèles de base de recherche en 2024. Avec une couverture rigide au vernis sélectif UV, 160 pages en couleur et une conception méticuleuse de bout en bout. Disponible dans le monde entier à 35 $, frais de port inclus.
octobre 29, 2024 • 11 minutes lues
Au-delà de CLIP : Comment Jina-CLIP fait progresser la recherche multimodale
Découvrez comment Jina-CLIP améliore le modèle CLIP d'OpenAI avec une meilleure précision de recherche et des résultats plus diversifiés grâce à des embeddings texte-image unifiés.
août 30, 2024 • 10 minutes lues
Jina ColBERT v2 : Système de recherche par interaction tardive multilingue pour l'embedding et le reranking
Jina ColBERT v2 prend en charge 89 langues avec des performances de recherche supérieures, des dimensions de sortie contrôlées par l'utilisateur et une longueur de token de 8192.
février 20, 2024 • 16 minutes lues
Qu'est-ce que ColBERT et l'interaction tardive (Late Interaction) et pourquoi sont-ils importants pour la recherche ?
Le ColBERT de Jina AI sur Hugging Face fait sensation sur Twitter, apportant une nouvelle perspective à la recherche avec sa capacité de traitement de 8192 tokens. Cet article explore les nuances de ColBERT et ColBERTv2, mettant en lumière leurs conceptions innovantes et expliquant pourquoi leur fonctionnalité d'interaction tardive révolutionne la recherche.