Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Reader
Convierta cualquier URL a Markdown para un mejor anclaje de los LLM.
Embeddings
Embeddings multimodales y multilingües.
reranker
Reranker para maximizar la relevancia de los resultados de búsqueda.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
warning
Este modelo está obsoleto por los modelos más nuevos.
Embeddings
Licencia Apache 2.0
open_in_new Publicación de lanzamiento

jina-clip-v1

Modelos de embedding multimodal para imágenes y texto en inglés
Licencia
Apache-2.0
Fecha de lanzamiento
calendar_month
2024-06-05
Aporte
image
Imagen
abc
Texto
arrow_forward
Producción
more_horiz
Vector
Detalles del modelo
Parámetros: 223M
Longitud del token de entrada: 8K
Tamaño de la imagen de entrada: 224×224
Dimensión de salida: 768
Modelo base help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
Idiomas entrenados help_outline
1 idiomas
Modelos relacionados
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
Disponible a través de
API de Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Gráfico de E/S 1

Texto

jina-clip-v1

Vector

Gráfico de E/S 2

Imagen

jina-clip-v1

Vector

Frontera de Paretohelp_outline
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14jina-clip-v2MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v1Parámetros (log)i2t-recall@5
Este modelo
En la frontera
Jina AI
Otros
CLIP Benchmark
87.65
Parámetros
223M
Rango por score
44 / 56
Frontera de Pareto
Por detrás
Distribución de valoreshelp_outline
AUC 0.8440
Corpus
Pares de traducción
Búsqueda documental
Imagen / banner
0.6750.000.200.400.600.80
Relacionados20.2%
Negativo difícil3.2%
No relacionados1.2%
Umbrales recomendados
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
equilibrado · 0.376
AUC
0.8440
Techo de ruido
0.779
Caída de exhaustividad
0.123
Pares medidos
119 / 11k
Componentes del vectorhelp_outline
-0.18-0.010.15
σ 0.0361 · 183k valores
Geometría del embeddinghelp_outline
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.283
Dim. efectivas
55 / 768
Elige modelos para comparar
Publicaciones (1)
ICML 2024
mayo 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

Descripción general

Jina CLIP v1 revoluciona la IA multimodal al ser el primer modelo que se destaca por igual en tareas de recuperación de texto a texto y de texto a imagen. A diferencia de los modelos CLIP tradicionales que tienen dificultades con escenarios de solo texto, este modelo logra un rendimiento de vanguardia en todas las combinaciones de recuperación, al tiempo que mantiene un tamaño de parámetro notablemente compacto de 223M. El modelo aborda un desafío crítico de la industria al eliminar la necesidad de modelos separados para el procesamiento de texto e imágenes, lo que reduce la complejidad del sistema y la sobrecarga computacional. Para los equipos que crean sistemas de búsqueda, motores de recomendación o herramientas de análisis de contenido, Jina CLIP v1 ofrece una solución única y eficiente que maneja tanto el contenido de texto como el visual con una precisión excepcional.

Métodos

La arquitectura del modelo representa una innovación significativa en el diseño de IA multimodal, ya que combina un codificador de texto Jina BERT v2 adaptado con el codificador de imágenes de vanguardia EVA-02 de la Academia de Inteligencia Artificial de Beijing. El codificador de texto admite secuencias de hasta 12 288 tokens (más de 100 veces más largas que el límite de 77 tokens del CLIP original), mientras que el codificador de imágenes procesa de manera eficiente 16 tokens de parche. El proceso de entrenamiento sigue un novedoso enfoque de tres pasos: primero, alinear pares de imágenes y subtítulos mientras se mantiene la comprensión del texto mediante el entrenamiento de pares de texto intercalados; segundo, incorporar descripciones de texto más largas de las imágenes generadas por IA; y finalmente, usar tripletes de texto negativos duros para mejorar las capacidades de distinción semántica. Esta metodología de entrenamiento única permite que el modelo mantenga un alto rendimiento tanto en subtítulos cortos como en descripciones textuales detalladas, al tiempo que preserva una sólida comprensión visual.

Actuación

Jina CLIP v1 demuestra mejoras notables con respecto al CLIP original de OpenAI en todos los puntos de referencia. En la recuperación de solo texto, logra un aumento del rendimiento del 165 % con una puntuación de 0,429 en comparación con el 0,162 de CLIP. Para las tareas relacionadas con imágenes, muestra mejoras consistentes: 2 % mejor en la recuperación de texto a imagen (0,899), 6 % en la recuperación de imagen a texto (0,803) y 12 % en la recuperación de imagen a imagen (0,916). El modelo se destaca particularmente en las tareas de clasificación visual zero-shot, categorizando imágenes con éxito sin entrenamiento previo en dominios específicos. Cuando se evalúa en puntos de referencia estándar como MTEB para recuperación de texto, CIFAR-100 para tareas de imagen y Flickr8k/30k y MSCOCO Captions para rendimiento intermodal, supera constantemente a los modelos monomodales especializados, al tiempo que mantiene un rendimiento competitivo en tareas intermodales.

Guía

Para implementar Jina CLIP v1 de manera eficaz, los equipos deben considerar tanto sus capacidades como sus requisitos de recursos. El modelo procesa imágenes en mosaicos de 224 x 224 píxeles, y cada mosaico consume 1000 tokens de capacidad de procesamiento. Para lograr un rendimiento óptimo, implemente un preprocesamiento de imágenes eficiente para que coincida con estas dimensiones. Si bien el modelo se destaca en el procesamiento de textos cortos y largos, actualmente solo admite la entrada en idioma inglés. Los equipos deben considerar cuidadosamente el uso de tokens: el texto requiere aproximadamente 1,1 tokens por palabra, mientras que las imágenes se procesan en mosaicos (por ejemplo, una imagen de 750 x 500 píxeles requiere 12 mosaicos, lo que consume 12 000 tokens). El modelo está disponible a través de la API Jina Embeddings y como una versión de código abierto en Hugging Face bajo la licencia Apache 2.0, lo que ofrece flexibilidad en las opciones de implementación. Para entornos de producción, considere usar las opciones de implementación de AWS Marketplace o Azure, que brindan configuraciones de infraestructura optimizadas.
Blogs que mencionan este modelo
junio 25, 2025 • 12 minutos de lectura
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
abril 08, 2025 • 21 minutos de lectura
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
diciembre 12, 2024 • 12 minutos de lectura
Scaling Test-Time Compute For Embedding Models
Better results scale with compute—more on learning, more on search. A good pretrained model takes you far, but test-time compute takes you further. It's time to recognize this paradigm of test-time compute, even for embedding models.
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
diciembre 04, 2024 • 13 minutos de lectura
Still Need Chunking When Long-Context Models Can Do It All?
Comparing how long-context embedding models perform with different chunking strategies to find the optimal approach for your needs.
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
noviembre 21, 2024 • 9 minutos de lectura
Jina CLIP v2: Multilingual Multimodal Embeddings for Text and Images
Jina-CLIP v2, a 0.9B multimodal embedding model with multilingual support of 89 languages, high image resolution at 512x512, and Matryoshka representations.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
Idioma / tema actual
Search Foundation
Reader
Embeddings
reranker
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.