Aperçu
jina-colbert-v1-en est un modèle de recherche late-interaction anglais de 137M paramètres qui produit des embeddings au niveau des tokens (128 dimensions par token) au lieu d'un unique vecteur de document. Cela permet une qualité de cross-encodeur avec l'efficacité d'un bi-encodeur : les documents sont indexés une fois et la note de pertinence se fait au moment de la requête par max-pooling et sommation sur les paires de tokens. Il prend en charge des documents de 8 192 tokens et fut le premier modèle Jina à apporter la recherche de type ColBERT en production.
Méthodes
Le modèle emploie une architecture late-interaction basée sur une approche ColBERT adaptée. Au lieu de comparer des documents entiers d'un coup, il traite requêtes et documents indépendamment jusqu'à l'étape finale d'appariement. Le encodeur de documents traite du texte jusqu'à 8 192 tokens ; le encodeur de requêtes crée des représentations précises au niveau des tokens. Chaque token de la requête et du document reçoit son propre vecteur d'embedding de 128 dimensions, préservant l'information sémantique fine perdue dans les modèles à vecteur unique. Le mécanisme late-interaction calcule les scores de pertinence par max-pooling sur les tokens de la requête et sommation sur les tokens du document, évitant l'attention all-to-all coûteuse des cross-encodeurs tout en capturant les signaux d'appariement au niveau des tokens. L'architecture utilise 137M paramètres avec des encodeurs basés sur BERT et des encodings positionnels ALiBi pour le contexte de 8 192 tokens.
Performance
Sur la collection de datasets BEIR, le modèle atteint une performance supérieure : 49,4 % sur Arguana (contre 46,5 % pour ColBERTv2), 79,5 % sur FEVER (contre 78,8 %) et 75,0 % sur TREC-COVID (contre 72,6 %). Le plus impressionnant est l'amélioration spectaculaire sur le benchmark LoCo pour la compréhension de long contexte, avec 83,7 % contre 74,3 % pour ColBERTv2 — un gain de 9,4 points qui démontre la valeur des représentations au niveau des tokens pour les longs documents. Le modèle surpasse les modèles d'embedding à vecteur unique traditionnels tout en maintenant l'efficacité computationnelle grâce à l'approche late-interaction. Son nombre de 137M paramètres le rend pratique pour les déploiements en production.
Conseils
Utilisez ce modèle lorsque vous avez besoin de la qualité de recherche d'un cross-encodeur sans la latence d'un cross-encodeur. Il requiert une GPU compatible CUDA pour une performance optimale ; l'inférence CPU est possible pour le développement. La limite de documents de 8 192 tokens correspond à environ 6 000 mots, adaptée à la plupart des types de documents, y compris les articles académiques et la documentation technique. Le modèle est uniquement en anglais — pour les applications multilingues, utilisez jina-colbert-v2. Pour les déploiements en production, implémentez des stratégies de découpage (chunking) appropriées et utilisez des index de similarité de vecteurs (FAISS, Qdrant, Weaviate) pour une recherche efficace. Le modèle est particulièrement efficace dans les pipelines RAG utilisant des frameworks comme RAGatouille, qui simplifient la mise en œuvre late-interaction. Pour les besoins multilingues ou de précision plus élevée, envisagez jina-colbert-v2 ou jina-embeddings-v4 (mode multi-vecteur).











