Descripción general
jina-colbert-v2 es un modelo de recuperación de interacción tardía multilingüe de 560M parámetros que admite 89 idiomas. Es el primer modelo ColBERT-like multilingüe que genera embeddings compactos a nivel de token (64–128 dimensiones por token), lo que permite una búsqueda multilingüe escalable y rentable. El aprendizaje de representaciones Matryoshka permite reducir la dimensión de 128 a 64 con solo una disminución del 1,5 % en el rendimiento, reduciendo a la mitad los requisitos de almacenamiento.
Métodos
El modelo se basa en la arquitectura de interacción tardía de ColBERT con un backbone XLM-RoBERTa modificado (560M parámetros), mejorado con embeddings de posición rotacionales y optimizado con Flash Attention. El entrenamiento implica dos etapas clave: (1) preentrenamiento inicial con datos diversos débilmente supervisados de varios idiomas y (2) ajuste fino con datos de tripletes etiquetados y destilación supervisada desde un modelo maestro más grande. La innovación clave es la implementación del aprendizaje de representaciones Matryoshka para embeddings de vector múltiple: el modelo produce vectores a nivel de token en 128, 96 o 64 dimensiones a partir de un único proceso de entrenamiento, permitiendo la optimización dinámica del almacenamiento sin reentrenar. El contexto de documentos de 8.192 tokens (ampliable a 12.288) y el límite de consultas de 32 tokens se gestionan mediante codificaciones posicionales ALiBi.
Rendimiento
El modelo logra una mejora del 6,5 % sobre el ColBERT-v2 original en tareas en inglés, con una puntuación media de 0,521 en 14 benchmarks de BEIR. Supera a los métodos tradicionales de recuperación basados en BM25 en todos los idiomas probados en los benchmarks MIRACL, mostrando una fuerza particular en escenarios cross-lingüísticos. Reducir de 128 a 64 dimensiones produce solo una disminución del 1,5 % en el rendimiento y reduce a la mitad los requisitos de almacenamiento: por ejemplo, almacenar 100 millones de documentos con vectores de 64 dimensiones cuesta 659,62 $/mes en AWS, frente a 1.319,24 $ para 128 dimensiones. La cobertura multilingüe del modelo (89 idiomas) y sus embeddings de token compactos lo hacen único para aplicaciones de búsqueda global.
Guía
El modelo requiere hardware con soporte CUDA para un rendimiento óptimo. Admite longitudes de documentos de hasta 8.192 tokens (ampliables a 12.288), limitando las consultas a 32 tokens. Para despliegue en producción, está disponible a través de la Jina Search Foundation API, el marketplace de AWS y Azure, con una versión no comercial en Hugging Face. Al implementarlo, especifique si está generando embeddings de consultas o de documentos: el modelo usa codificación asimétrica. El modelo no está diseñado para procesar en tiempo real colecciones de documentos extremadamente grandes sin indexación adecuada; use FAISS, Qdrant o Weaviate para búsqueda ANN. Para tareas específicas de dominio, considere el ajuste fino en su corpus. Para recuperación de vector único con salida de mayor dimensión, considere jina-embeddings-v4 (modo de vector múltiple) o jina-embeddings-v5-text-small.









