Descripción general
jina-clip-v2 es un modelo de embeddings multimodal multilingüe de 865M parámetros que admite 89 idiomas y entrada de imagen de 512×512. Extiende jina-clip-v1 con alineación imagen-texto entre idiomas, aprendizaje de representaciones Matryoshka para la reducción de dimensiones (1024→64) y mejor rendimiento en documentos visualmente ricos. Alcanza un retrieval cross-lingüístico de imágenes state-of-the-art manteniendo un rendimiento sólido en texto únicamente y en modalidades individuales.
Métodos
El modelo emplea una arquitectura de doble codificador que combina un codificador de texto Jina XLM-RoBERTa (561M parámetros, 89 idiomas, contexto de 696.320 tokens) con un codificador visual EVA02-L14 (304M parámetros, entrada de 512×512 píxeles). El entrenamiento usa un paradigma de aprendizaje contrastivo multitarea y multietapa: el modelo se entrena simultáneamente en pares de texto, tripletes de texto y pares imagen-texto para soportar tanto tareas solo de texto como cross-modales. El conjunto de datos de entrenamiento se expandió para incluir textos multilingües de 29 idiomas no ingleses (incluidos hindi, chino, alemán y francés) e imágenes de documentos visualmente ricos. El aprendizaje de representaciones Matryoshka permite reducir la dimensión del embedding de 1024 a 64 dimensiones mientras preserva más del 99 % del rendimiento. El modelo usa Last-Token-Pooling para el embedding final.
Rendimiento
El modelo alcanza 98,0 % de precisión en la recuperación imagen-texto de Flickr30k, superando tanto a jina-clip-v1 como a NLLB-CLIP-SigLIP. En escenarios multilingües, muestra hasta un 4 % de mejora sobre NLLB-CLIP-SigLIP en la recuperación de imágenes entre idiomas. La compresión de embeddings es notablemente efectiva: reducir las dimensiones un 75 % (1024→256) aún preserva más del 99 % del rendimiento en tareas de texto, imagen y cross-modales. En Multilingual MTEB, alcanza 69,86 % en recuperación y 67,77 % en similitud semántica, con un rendimiento competitivo frente a modelos de embeddings de texto especializados. El soporte de 89 idiomas y el manejo de documentos visualmente ricos lo hacen particularmente apto para el comercio electrónico global y la gestión de contenido.
Guía
Redimensione las imágenes a 512×512 píxeles antes del procesamiento — las imágenes más grandes se dividen automáticamente en mosaicos, lo que aumenta el uso de tokens y el tiempo de procesamiento. El modelo destaca al hacer coincidir imágenes con texto descriptivo en 89 idiomas, ideal para la búsqueda de productos en el comercio electrónico global, la recomendación de contenido y la búsqueda visual multilingüe. Puede tener dificultades con conceptos abstractos o contenido de dominios altamente especializados. Al usar la reducción de dimensiones Matryoshka, los embeddings de 64 dimensiones mantienen un rendimiento sólido para indexación; use 512+ dimensiones para el re-ranking de aplicaciones críticas. El modelo requiere hardware con capacidad CUDA. Para cargas de trabajo solo de texto, jina-embeddings-v5-text-small ofrece mejor precisión por parámetro. Para recuperación de código, use jina-code-embeddings-1.5b. Disponible a través de Jina API, AWS, Azure y los marketplaces de GCP.











