Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Reader
Convierta cualquier URL a Markdown para un mejor anclaje de los LLM.
Embeddings
Embeddings multimodales y multilingües.
Reranker
Reranker para maximizar la relevancia de los resultados de búsqueda.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
warning
Este modelo está obsoleto por los modelos más nuevos.
Embeddings
Licencia Apache 2.0
open_in_new Publicación de lanzamiento

jina-clip-v1

Modelos de embedding multimodal para imágenes y texto en inglés
Licencia
Apache-2.0
Fecha de lanzamiento
calendar_month
2024-06-05
Entrada
image
Imagen
abc
Texto
arrow_forward
Producción
more_horiz
Vector
Detalles del modelo
Parámetros: 223M
Longitud del token de entrada: 8K
Tamaño de la imagen de entrada: 224×224
Dimensión de salida: 768
Modelo base help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
Idiomas entrenados help_outline
1 idiomas
Modelos relacionados
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
Disponible a través de
API de Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Gráfico de E/S 1

Texto

jina-clip-v1

Vector

Gráfico de E/S 2

Imagen

jina-clip-v1

Vector

Frontera de Pareto help_outline
workspace_premium
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
300M1B3.0B10B20406080100bge-visualized-m3BiModernVBERTDSE-Phi3dse-qwen2-2b-mrl-v1e5-vjina-clip-v2jina-embeddings-v3jina-embeddings-v4llama-nemoretriever-col…MoCa-3Bnemotron-colembed-vl-8b…nllb-siglip-largeONE-PEACESauerkrautLM-ColLFM2-45…SauerkrautLM-ColMinistr…siglip-so400m-patch14-3…SigLIP2-L-512/16VLM2VecVultronRetrieverFlash-Q…jina-clip-v1Parámetros (log)nDCG@5
Este modelo
En la frontera
Jina AI
Otros
ViDoRe v1
17.72
Parámetros
223M
Rango por score
32 / 33
Frontera de Pareto
En ella
Distribución de valoreshelp_outline
AUC 0.8440
Corpus
Pares de traducción
Búsqueda documental
Imagen / banner
0.6750.000.200.400.600.80
Relacionados20.2%
Negativo difícil3.2%
No relacionados1.2%
Umbrales recomendados
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
equilibrado · 0.376
AUC
0.8440
Techo de ruido
0.779
Caída de exhaustividad
0.123
Pares medidos
119 / 11k
Componentes del vectorhelp_outline
-0.18-0.010.15
σ 0.0361 · 183k valores
Geometría del embeddinghelp_outline
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.283
Dim. efectivas
55 / 768
Elija modelos para comparar
Publicaciones (1)
ICML 2024
mayo 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

Descripción general

jina-clip-v1 es un modelo de embeddings multimodal de 223M parámetros que alcanza un rendimiento state-of-the-art tanto en recuperación texto-texto como texto-imagen: un logro inédito entre los modelos de la familia CLIP. A diferencia de los modelos CLIP estándar, que sacrifican la recuperación solo de texto por la alineación entre modalidades, jina-clip-v1 usa entrenamiento contrastivo multitarea para mantener un rendimiento sólido en todas las combinaciones de recuperación. Admite un contexto de texto de 12.288 tokens, 100× el límite de 77 tokens del CLIP original.

Métodos

La arquitectura combina un codificador de texto Jina BERT v2 adaptado (con 12.288 tokens gracias a ALiBi) con el codificador de imagen EVA-02 de la Beijing Academy for AI. La innovación clave es el método de entrenamiento contrastivo multitarea: el modelo se entrena simultáneamente en (1) pares imagen-descripción para la alineación entre modalidades, (2) pares texto-texto para preservar la calidad de la recuperación solo de texto y (3) descripciones de texto más largas generadas por IA de las imágenes para mejorar la robustez ante distintas longitudes de texto. Una etapa final usa tripletes de texto con negativos difíciles para afinar la distinción semántica. Este enfoque multitarea previene el olvido catastrófico de la recuperación solo de texto que afecta al entrenamiento CLIP estándar. El codificador de imagen procesa mosaicos de 224×224 píxeles, y cada mosaico consume 1.000 tokens de capacidad de procesamiento.

Rendimiento

En recuperación solo de texto, el modelo logra un aumento de rendimiento del 165 % respecto a OpenAI CLIP (0,429 frente a 0,162 en MTEB). Para tareas de imagen: 2 % mejor en texto-imagen (0,899), 6 % en imagen-texto (0,803) y 12 % en imagen-imagen (0,916). En clasificación visual zero-shot (CIFAR-100) supera al CLIP estándar. El rendimiento multimodal en Flickr8k/30k y MSCOCO Captions es competitivo frente a modelos de una sola modalidad especializados. El contexto de texto de 12.288 tokens es una gran ventaja para recuperar documentos de texto extensos junto con imágenes. En 2026, jina-clip-v2 reemplaza a este modelo con soporte de 89 idiomas y procesamiento de imágenes de 512×512.

Guía

El modelo procesa imágenes en mosaicos de 224×224 píxeles; cada mosaico consume 1.000 tokens. Una imagen de 750×500 píxeles requiere 12 mosaicos (12.000 tokens). El texto requiere aproximadamente 1,1 tokens por palabra. Planifique los presupuestos de tokens en consecuencia para consultas multimodales. El modelo actualmente solo admite inglés — para aplicaciones multilingües, use jina-clip-v2. Está disponible a través de la Jina Embeddings API y como publicación de código abierto en Hugging Face bajo la licencia Apache 2.0. Para entornos de producción, las opciones de despliegue en AWS Marketplace y Azure ofrecen infraestructura optimizada. Use similitud de coseno para la comparación entre modalidades. Para nuevos proyectos multimodales, prefiera jina-clip-v2 (89 idiomas, imágenes de 512×512, soporte MRL) o jina-embeddings-v4 (contexto de 32K, modo multivector, soporte de código).

Blogs que mencionan este modelo
junio 25, 2025 • 12 minutos de lectura
Jina Embeddings v4:向量模型 (Embeddings) 通用模型,适用于多模态多语言检索
Jina Embeddings v4 es un modelo de "向量模型 (Embeddings)" universal de 3.8 mil millones de parámetros para la recuperación multimodal y multilingüe que admite salidas de "向量模型 (Embeddings)" de un solo vector y de múltiples vectores.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
abril 08, 2025 • 21 minutos de lectura
jina-reranker-m0: Reranqueador multilingüe y multimodal de documentos
Presentamos jina-reranker-m0, nuestro nuevo reranker multimodal multilingüe para recuperar documentos visuales, con rendimiento SOTA en documentos largos multilingües y tareas de búsqueda de código.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
diciembre 12, 2024 • 12 minutos de lectura
Escalando el Cómputo en Tiempo de Prueba para Modelos de Embeddings
Los mejores resultados escalan con la capacidad de cómputo—más en aprendizaje, más en búsqueda. Un buen modelo pre-entrenado te lleva lejos, pero el cómputo en tiempo de prueba te lleva aún más lejos. Es importante reconocer este nuevo paradigma de escalar el cómputo en tiempo de prueba, incluso para modelos de embeddings.
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
diciembre 04, 2024 • 13 minutos de lectura
¿Aún Se Necesita el Chunking Cuando los Modelos de Contexto Largo Pueden Hacerlo Todo?
Comparación de cómo se comportan los modelos de embeddings de contexto largo con diferentes estrategias de segmentación para encontrar el enfoque óptimo según tus necesidades.
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
noviembre 21, 2024 • 9 minutos de lectura
Jina CLIP v2: Embeddings multimodales y multilingües para texto e imágenes
Jina-CLIP v2, un modelo de embeddings multimodal de 0.9B con soporte multilingüe para 89 idiomas, alta resolución de imagen de 512x512 y representaciones Matryoshka.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
Idioma / tema actual
Search Foundation
Reader
Embeddings
Reranker
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y su contenido, software, productos y servicios asociados están destinados exclusivamente a un uso profesional. El uso por parte de consumidores no está previsto ni dirigido.