Descripción general
jina-clip-v1 es un modelo de embeddings multimodal de 223M parámetros que alcanza un rendimiento state-of-the-art tanto en recuperación texto-texto como texto-imagen: un logro inédito entre los modelos de la familia CLIP. A diferencia de los modelos CLIP estándar, que sacrifican la recuperación solo de texto por la alineación entre modalidades, jina-clip-v1 usa entrenamiento contrastivo multitarea para mantener un rendimiento sólido en todas las combinaciones de recuperación. Admite un contexto de texto de 12.288 tokens, 100× el límite de 77 tokens del CLIP original.
Métodos
La arquitectura combina un codificador de texto Jina BERT v2 adaptado (con 12.288 tokens gracias a ALiBi) con el codificador de imagen EVA-02 de la Beijing Academy for AI. La innovación clave es el método de entrenamiento contrastivo multitarea: el modelo se entrena simultáneamente en (1) pares imagen-descripción para la alineación entre modalidades, (2) pares texto-texto para preservar la calidad de la recuperación solo de texto y (3) descripciones de texto más largas generadas por IA de las imágenes para mejorar la robustez ante distintas longitudes de texto. Una etapa final usa tripletes de texto con negativos difíciles para afinar la distinción semántica. Este enfoque multitarea previene el olvido catastrófico de la recuperación solo de texto que afecta al entrenamiento CLIP estándar. El codificador de imagen procesa mosaicos de 224×224 píxeles, y cada mosaico consume 1.000 tokens de capacidad de procesamiento.
Rendimiento
En recuperación solo de texto, el modelo logra un aumento de rendimiento del 165 % respecto a OpenAI CLIP (0,429 frente a 0,162 en MTEB). Para tareas de imagen: 2 % mejor en texto-imagen (0,899), 6 % en imagen-texto (0,803) y 12 % en imagen-imagen (0,916). En clasificación visual zero-shot (CIFAR-100) supera al CLIP estándar. El rendimiento multimodal en Flickr8k/30k y MSCOCO Captions es competitivo frente a modelos de una sola modalidad especializados. El contexto de texto de 12.288 tokens es una gran ventaja para recuperar documentos de texto extensos junto con imágenes. En 2026, jina-clip-v2 reemplaza a este modelo con soporte de 89 idiomas y procesamiento de imágenes de 512×512.
Guía
El modelo procesa imágenes en mosaicos de 224×224 píxeles; cada mosaico consume 1.000 tokens. Una imagen de 750×500 píxeles requiere 12 mosaicos (12.000 tokens). El texto requiere aproximadamente 1,1 tokens por palabra. Planifique los presupuestos de tokens en consecuencia para consultas multimodales. El modelo actualmente solo admite inglés — para aplicaciones multilingües, use jina-clip-v2. Está disponible a través de la Jina Embeddings API y como publicación de código abierto en Hugging Face bajo la licencia Apache 2.0. Para entornos de producción, las opciones de despliegue en AWS Marketplace y Azure ofrecen infraestructura optimizada. Use similitud de coseno para la comparación entre modalidades. Para nuevos proyectos multimodales, prefiera jina-clip-v2 (89 idiomas, imágenes de 512×512, soporte MRL) o jina-embeddings-v4 (contexto de 32K, modo multivector, soporte de código).









