Graphique d'E/S 1

multiple

Vecteur

Requête

jina-colbert-v1-en

Graphique d'E/S 2

multiple

Vecteur

Document

jina-colbert-v1-en

Frontière de Pareto
30M100M7075808590ColBERTv2gte-reranker-modernbert…jina-reranker-v1-base-enjina-reranker-v1-tiny-enjina-reranker-v1-turbo-…jina-colbert-v1-enParamètres (log)nDCG@10
Ce modèle
Sur la frontière
Jina AI
Autres
LoCo
83.70
Paramètres
137M
Rang par score
3 / 6
Frontière de Pareto
Derrière
Distribution des valeurs
AUC 0.5963
Corpus
Paires de traduction
15.7801020
Liées17.0%
Négatif difficile9.3%
Non liées1.0%
Seuils recommandés
FPR 0.1 · 9.27
FPR 0.01 · 15.78
FPR 0.001 · 21.53
FPR 0.0001 · 25.48
équilibré · 7.98
AUC
0.5963
Plafond de bruit
21.44
Décrochage du rappel
-0.71
Paires mesurées
100 / 9 200
Score par rang
12345678910
Score moyen à chaque position de rang
Choisissez les modèles à comparer

Aperçu

jina-colbert-v1-en est un modèle de recherche late-interaction anglais de 137M paramètres qui produit des embeddings au niveau des tokens (128 dimensions par token) au lieu d'un unique vecteur de document. Cela permet une qualité de cross-encodeur avec l'efficacité d'un bi-encodeur : les documents sont indexés une fois et la note de pertinence se fait au moment de la requête par max-pooling et sommation sur les paires de tokens. Il prend en charge des documents de 8 192 tokens et fut le premier modèle Jina à apporter la recherche de type ColBERT en production.

Méthodes

Le modèle emploie une architecture late-interaction basée sur une approche ColBERT adaptée. Au lieu de comparer des documents entiers d'un coup, il traite requêtes et documents indépendamment jusqu'à l'étape finale d'appariement. Le encodeur de documents traite du texte jusqu'à 8 192 tokens ; le encodeur de requêtes crée des représentations précises au niveau des tokens. Chaque token de la requête et du document reçoit son propre vecteur d'embedding de 128 dimensions, préservant l'information sémantique fine perdue dans les modèles à vecteur unique. Le mécanisme late-interaction calcule les scores de pertinence par max-pooling sur les tokens de la requête et sommation sur les tokens du document, évitant l'attention all-to-all coûteuse des cross-encodeurs tout en capturant les signaux d'appariement au niveau des tokens. L'architecture utilise 137M paramètres avec des encodeurs basés sur BERT et des encodings positionnels ALiBi pour le contexte de 8 192 tokens.

Performance

Sur la collection de datasets BEIR, le modèle atteint une performance supérieure : 49,4 % sur Arguana (contre 46,5 % pour ColBERTv2), 79,5 % sur FEVER (contre 78,8 %) et 75,0 % sur TREC-COVID (contre 72,6 %). Le plus impressionnant est l'amélioration spectaculaire sur le benchmark LoCo pour la compréhension de long contexte, avec 83,7 % contre 74,3 % pour ColBERTv2 — un gain de 9,4 points qui démontre la valeur des représentations au niveau des tokens pour les longs documents. Le modèle surpasse les modèles d'embedding à vecteur unique traditionnels tout en maintenant l'efficacité computationnelle grâce à l'approche late-interaction. Son nombre de 137M paramètres le rend pratique pour les déploiements en production.

Conseils

Utilisez ce modèle lorsque vous avez besoin de la qualité de recherche d'un cross-encodeur sans la latence d'un cross-encodeur. Il requiert une GPU compatible CUDA pour une performance optimale ; l'inférence CPU est possible pour le développement. La limite de documents de 8 192 tokens correspond à environ 6 000 mots, adaptée à la plupart des types de documents, y compris les articles académiques et la documentation technique. Le modèle est uniquement en anglais — pour les applications multilingues, utilisez jina-colbert-v2. Pour les déploiements en production, implémentez des stratégies de découpage (chunking) appropriées et utilisez des index de similarité de vecteurs (FAISS, Qdrant, Weaviate) pour une recherche efficace. Le modèle est particulièrement efficace dans les pipelines RAG utilisant des frameworks comme RAGatouille, qui simplifient la mise en œuvre late-interaction. Pour les besoins multilingues ou de précision plus élevée, envisagez jina-colbert-v2 ou jina-embeddings-v4 (mode multi-vecteur).

Blogs qui mentionnent ce modèle
août 30, 2024 • 10 minutes lues
Jina ColBERT v2 : Système de recherche par interaction tardive multilingue pour l'embedding et le reranking
Jina ColBERT v2 prend en charge 89 langues avec des performances de recherche supérieures, des dimensions de sortie contrôlées par l'utilisateur et une longueur de token de 8192.
juin 19, 2024 • 11 minutes lues
L'explicabilité de l'IA simplifiée : Comment l'interaction tardive rend Jina-ColBERT transparent
L'explicabilité et la transparence de l'IA sont des sujets brûlants. Comment pouvons-nous faire confiance à l'IA si nous ne pouvons pas voir comment elle fonctionne ? Jina-ColBERT vous montre comment, avec la bonne architecture de modèle, vous pouvez facilement faire révéler ses secrets à votre IA.
mai 13, 2024 • 5 minutes lues
Albus par Springworks : Donner aux employés les moyens d'effectuer des recherches d'entreprise
Découvrez comment une startup leader dans les RH utilise les modèles de Jina AI pour interagir avec des données structurées et non structurées.
avril 29, 2024 • 7 minutes lues
Jina Embeddings et Reranker sur Azure : Solutions d'IA évolutives et prêtes pour l'entreprise
Les Embeddings et Rerankers de Jina sont désormais disponibles sur Azure Marketplace. Les entreprises qui privilégient la confidentialité et la sécurité peuvent maintenant facilement intégrer les modèles de pointe de Jina AI directement dans leur écosystème Azure existant.
février 20, 2024 • 16 minutes lues
Qu'est-ce que ColBERT et l'interaction tardive (Late Interaction) et pourquoi sont-ils importants pour la recherche ?
Le ColBERT de Jina AI sur Hugging Face fait sensation sur Twitter, apportant une nouvelle perspective à la recherche avec sa capacité de traitement de 8192 tokens. Cet article explore les nuances de ColBERT et ColBERTv2, mettant en lumière leurs conceptions innovantes et expliquant pourquoi leur fonctionnalité d'interaction tardive révolutionne la recherche.