Elastic
Jina AI
Noticias
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP terminalCLIarticlellms.txtsmart_toyAgentesdata_objectEsquemamenu_bookDocumentos



Acceso
login
Incrustaciones
copyright CC BY-NC 4.0
open_in_new Publicación de lanzamiento

jina-clip-v2

Incrustaciones multimodales multilingües para textos e imágenes
Licencia
copyright CC-BY-NC-4.0
Fecha de lanzamiento
calendar_month
2024-11-05
Aporte
image
Imagen
abc
Texto
arrow_forward
Producción
more_horiz
Vector
Dimensiones Matryoshka help_outline
64
128
256
512
768
1024
Detalles del modelo
Parámetros: 865M
Longitud del token de entrada: 8K
Tamaño de la imagen de entrada: 512×512
Dimensión de salida: 1024
Modelo base help_outline
open_in_new
XLM-RoBERTa Large
Idiomas entrenados help_outline
32 idiomas
Idiomas admitidos help_outline
108 idiomas
Modelos relacionados
link
jina-clip-v1
Disponible a través de
Elastic Inference Service
API de Jina
AWS SageMaker
Microsoft Azure
Nube de Google
Hugging Face
Air-gapped
Gráfico de E/S 1

Texto

jina-clip-v2

Vector

Gráfico de E/S 2

Imagen

jina-clip-v2

Vector

Distribución de valoreshelp_outline
AUC 0.8383
Corpus
Pares de traducción
Búsqueda documental
Imagen / banner
Imagen / logotipo
Tarea
default
retrieval.query
0.6040.000.200.400.60
Relacionados20.2%
Negativo difícil3.6%
No relacionados0.8%
Pasa el cursor o haz clic en el gráfico para mover el umbral
Umbrales recomendados
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
equilibrado · 0.403
AUC
0.8383
Techo de ruido
0.666
Caída de exhaustividad
0.224
Pares medidos
119 / 11k
Componentes del vectorhelp_outline
-0.43-0.070.29
σ 0.0313 · 244k valores
Geometría del embeddinghelp_outline
01024
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.420
Dim. efectivas
52 / 1024
Pares de idiomashelp_outline
de-ruen-deen-koen-zhja-ko
Dispersión del umbral entre pares: 0.064
Elige modelos para comparar
Publicaciones (2)
ICLR 2026
enero 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
diciembre 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

Descripción general

Jina CLIP v2 revoluciona la inteligencia artificial multimodal al reducir la brecha entre la comprensión visual y textual en 89 idiomas. Este modelo resuelve desafíos críticos en el comercio electrónico global, la gestión de contenido y la comunicación intercultural al permitir una correspondencia precisa entre imágenes y textos independientemente de las barreras lingüísticas. Para las empresas que se expanden internacionalmente o que gestionan contenido multilingüe, elimina la necesidad de modelos separados por idioma o de procesos de traducción complejos. El modelo se destaca particularmente en escenarios que requieren una búsqueda visual precisa a través de las fronteras lingüísticas, como el descubrimiento de productos en el mercado global o la gestión de activos digitales multilingües.

Métodos

En esencia, Jina CLIP v2 emplea una sofisticada arquitectura de codificador dual que combina un codificador de texto Jina XLM-RoBERTa (561 millones de parámetros) con un codificador de visión EVA02-L14 (304 millones de parámetros). El codificador de texto procesa contenido en 89 idiomas con una enorme ventana de contexto de 696.320 tokens, mientras que el codificador de visión maneja imágenes de alta resolución de hasta 512x512 píxeles. El modelo presenta un innovador aprendizaje de representación Matryoshka, que permite un ajuste dinámico de la dimensión de incrustación desde 1024 hasta 64 dimensiones, preservando el rendimiento. Esta arquitectura procesa tanto el texto como las imágenes a través de sus respectivos codificadores, proyectándolos en un espacio semántico compartido donde los conceptos similares se alinean independientemente de su modalidad o idioma original.

Actuación

El modelo alcanza un rendimiento de vanguardia con una precisión del 98,0 % en las tareas de recuperación de imágenes a texto de Flickr30k, superando tanto a su predecesor como a NLLB-CLIP-SigLIP. En escenarios multilingües, demuestra una mejora de hasta un 4 % sobre NLLB-CLIP-SigLIP en las tareas de recuperación de imágenes en varios idiomas, a pesar de tener menos parámetros que su mayor competidor. El modelo mantiene un rendimiento sólido incluso cuando se comprimen las incrustaciones: al reducir las dimensiones en un 75 %, aún conserva más del 99 % del rendimiento en tareas de texto, imágenes y multimodales. En los completos puntos de referencia multilingües de MTEB, alcanza un 69,86 % en la recuperación y un 67,77 % en las tareas de similitud semántica, con un rendimiento competitivo con los modelos de incrustación de texto especializados.

Guía

Para una implementación óptima, los usuarios deben tener en cuenta varios factores clave. El modelo requiere hardware compatible con CUDA para un procesamiento eficiente, con requisitos de memoria que se escalan en función del tamaño del lote y la resolución de la imagen. Para optimizar los costos y el rendimiento de la API, cambie el tamaño de las imágenes a 512 x 512 píxeles antes del procesamiento: las imágenes más grandes se organizan automáticamente en mosaicos, lo que aumenta el uso de tokens y el tiempo de procesamiento. El modelo se destaca por hacer coincidir imágenes con texto descriptivo en todos los idiomas, pero puede tener dificultades con conceptos abstractos o contenido altamente especializado y específico del dominio. Es particularmente eficaz para la búsqueda de productos de comercio electrónico, sistemas de recomendación de contenido y aplicaciones de búsqueda visual, pero puede no ser adecuado para tareas que requieran un análisis de detalles visuales de grano fino o experiencia en el dominio altamente especializada. Al utilizar la función de representación Matryoshka, considere la compensación entre la reducción de dimensiones y el rendimiento: si bien las incrustaciones de 64 dimensiones mantienen un rendimiento sólido, las aplicaciones críticas pueden beneficiarse de dimensiones más altas.
Blogs que mencionan este modelo
noviembre 21, 2024 • 9 minutos de lectura
Jina CLIP v2: Embeddings multimodales y multilingües para texto e imágenes
Jina-CLIP v2, un modelo de embeddings multimodal de 0.9B con soporte multilingüe para 89 idiomas, alta resolución de imagen de 512x512 y representaciones Matryoshka.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
octubre 29, 2024 • 11 minutos de lectura
Más allá de CLIP: Cómo Jina-CLIP avanza en la búsqueda multimodal
Aprende cómo Jina-CLIP mejora el CLIP de OpenAI con una mayor precisión en la recuperación y resultados más diversos a través de embeddings unificados de texto e imagen.
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
junio 05, 2024 • 9 minutos de lectura
Jina CLIP v1: Un modelo de embeddings verdaderamente multimodal para texto e imagen
El nuevo modelo de embedding multimodal de Jina AI no solo supera a OpenAI CLIP en la recuperación de texto e imágenes, sino que es a la vez un sólido modelo de embedding de imágenes y un modelo de embedding de texto de última generación. Ya no necesitas diferentes modelos para diferentes modalidades.
Sofia Vasileva
Scott Martens
Susana Guzmán
Abstract 3D render of a neon blue and green grid pattern on a black background, creating a sense of depth.
septiembre 27, 2024 • 15 minutos de lectura
Migración de Jina Embeddings v2 a v3
Recopilamos algunos consejos para ayudarte a migrar de Jina Embeddings v2 a v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
agosto 30, 2024 • 10 minutos de lectura
Jina ColBERT v2: Recuperador de interacción tardía multilingüe para incrustación y reordenamiento
ColBERT v2 de Jina admite 89 idiomas con un rendimiento de recuperación superior, dimensiones de salida controladas por el usuario y una longitud de token de 8192.
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
Search Foundation
Lector
Incrustaciones
reclasificador
Elastic Inference Service
open_in_new
Obtener la clave API de Jina
Límite de velocidad
Estado de la API
Términos
Seguridad
Términos y condiciones
Privacidad
Administrar cookies
No venda ni comparta mi información personal.
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Elastic © 2020-2026.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.