Gráfico de E/S 1

Texto

jina-clip-v1

Vector

Gráfico de E/S 2

Imagen

jina-clip-v1

Vector

Frontera de Pareto
300M1B3.0B10B20406080100bge-visualized-m3BiModernVBERTDSE-Phi3dse-qwen2-2b-mrl-v1e5-vjina-clip-v2jina-embeddings-v3jina-embeddings-v4llama-nemoretriever-col…MoCa-3Bnemotron-colembed-vl-8b…nllb-siglip-largeONE-PEACESauerkrautLM-ColLFM2-45…SauerkrautLM-ColMinistr…siglip-so400m-patch14-3…SigLIP2-L-512/16VLM2VecVultronRetrieverFlash-Q…jina-clip-v1Parámetros (log)nDCG@5
Este modelo
En la frontera
Jina AI
Otros
ViDoRe v1
17.72
Parámetros
223M
Rango por score
32 / 33
Frontera de Pareto
En ella
Distribución de valores
AUC 0.8440
Corpus
Pares de traducción
Búsqueda documental
Imagen / banner
0.6750.000.200.400.600.80
Relacionados20.2%
Negativo difícil3.2%
No relacionados1.2%
Umbrales recomendados
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
equilibrado · 0.376
AUC
0.8440
Techo de ruido
0.779
Caída de exhaustividad
0.123
Pares medidos
119 / 11k
Componentes del vector
-0.18-0.010.15
σ 0.0361 · 183k valores
Geometría del embedding
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.283
Dim. efectivas
55 / 768
Elija modelos para comparar
Publicaciones (1)

Descripción general

jina-clip-v1 es un modelo de embeddings multimodal de 223M parámetros que alcanza un rendimiento state-of-the-art tanto en recuperación texto-texto como texto-imagen: un logro inédito entre los modelos de la familia CLIP. A diferencia de los modelos CLIP estándar, que sacrifican la recuperación solo de texto por la alineación entre modalidades, jina-clip-v1 usa entrenamiento contrastivo multitarea para mantener un rendimiento sólido en todas las combinaciones de recuperación. Admite un contexto de texto de 12.288 tokens, 100× el límite de 77 tokens del CLIP original.

Métodos

La arquitectura combina un codificador de texto Jina BERT v2 adaptado (con 12.288 tokens gracias a ALiBi) con el codificador de imagen EVA-02 de la Beijing Academy for AI. La innovación clave es el método de entrenamiento contrastivo multitarea: el modelo se entrena simultáneamente en (1) pares imagen-descripción para la alineación entre modalidades, (2) pares texto-texto para preservar la calidad de la recuperación solo de texto y (3) descripciones de texto más largas generadas por IA de las imágenes para mejorar la robustez ante distintas longitudes de texto. Una etapa final usa tripletes de texto con negativos difíciles para afinar la distinción semántica. Este enfoque multitarea previene el olvido catastrófico de la recuperación solo de texto que afecta al entrenamiento CLIP estándar. El codificador de imagen procesa mosaicos de 224×224 píxeles, y cada mosaico consume 1.000 tokens de capacidad de procesamiento.

Rendimiento

En recuperación solo de texto, el modelo logra un aumento de rendimiento del 165 % respecto a OpenAI CLIP (0,429 frente a 0,162 en MTEB). Para tareas de imagen: 2 % mejor en texto-imagen (0,899), 6 % en imagen-texto (0,803) y 12 % en imagen-imagen (0,916). En clasificación visual zero-shot (CIFAR-100) supera al CLIP estándar. El rendimiento multimodal en Flickr8k/30k y MSCOCO Captions es competitivo frente a modelos de una sola modalidad especializados. El contexto de texto de 12.288 tokens es una gran ventaja para recuperar documentos de texto extensos junto con imágenes. En 2026, jina-clip-v2 reemplaza a este modelo con soporte de 89 idiomas y procesamiento de imágenes de 512×512.

Guía

El modelo procesa imágenes en mosaicos de 224×224 píxeles; cada mosaico consume 1.000 tokens. Una imagen de 750×500 píxeles requiere 12 mosaicos (12.000 tokens). El texto requiere aproximadamente 1,1 tokens por palabra. Planifique los presupuestos de tokens en consecuencia para consultas multimodales. El modelo actualmente solo admite inglés — para aplicaciones multilingües, use jina-clip-v2. Está disponible a través de la Jina Embeddings API y como publicación de código abierto en Hugging Face bajo la licencia Apache 2.0. Para entornos de producción, las opciones de despliegue en AWS Marketplace y Azure ofrecen infraestructura optimizada. Use similitud de coseno para la comparación entre modalidades. Para nuevos proyectos multimodales, prefiera jina-clip-v2 (89 idiomas, imágenes de 512×512, soporte MRL) o jina-embeddings-v4 (contexto de 32K, modo multivector, soporte de código).

Blogs que mencionan este modelo
junio 25, 2025 • 12 minutos de lectura
Jina Embeddings v4:向量模型 (Embeddings) 通用模型,适用于多模态多语言检索
Jina Embeddings v4 es un modelo de "向量模型 (Embeddings)" universal de 3.8 mil millones de parámetros para la recuperación multimodal y multilingüe que admite salidas de "向量模型 (Embeddings)" de un solo vector y de múltiples vectores.
abril 08, 2025 • 21 minutos de lectura
jina-reranker-m0: Reranqueador multilingüe y multimodal de documentos
Presentamos jina-reranker-m0, nuestro nuevo reranker multimodal multilingüe para recuperar documentos visuales, con rendimiento SOTA en documentos largos multilingües y tareas de búsqueda de código.
diciembre 12, 2024 • 12 minutos de lectura
Escalando el Cómputo en Tiempo de Prueba para Modelos de Embeddings
Los mejores resultados escalan con la capacidad de cómputo—más en aprendizaje, más en búsqueda. Un buen modelo pre-entrenado te lleva lejos, pero el cómputo en tiempo de prueba te lleva aún más lejos. Es importante reconocer este nuevo paradigma de escalar el cómputo en tiempo de prueba, incluso para modelos de embeddings.
diciembre 04, 2024 • 13 minutos de lectura
¿Aún Se Necesita el Chunking Cuando los Modelos de Contexto Largo Pueden Hacerlo Todo?
Comparación de cómo se comportan los modelos de embeddings de contexto largo con diferentes estrategias de segmentación para encontrar el enfoque óptimo según tus necesidades.
noviembre 21, 2024 • 9 minutos de lectura
Jina CLIP v2: Embeddings multimodales y multilingües para texto e imágenes
Jina-CLIP v2, un modelo de embeddings multimodal de 0.9B con soporte multilingüe para 89 idiomas, alta resolución de imagen de 512x512 y representaciones Matryoshka.