Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Reader
Convierta cualquier URL a Markdown para un mejor anclaje de los LLM.
Embeddings
Embeddings multimodales y multilingües.
Reranker
Reranker para maximizar la relevancia de los resultados de búsqueda.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Embeddings
copyright CC BY-NC 4.0
open_in_new Publicación de lanzamiento

jina-clip-v2

Embeddings multimodales multilingües para textos e imágenes
Licencia
copyright CC-BY-NC-4.0
Fecha de lanzamiento
calendar_month
2024-11-05
Entrada
image
Imagen
abc
Texto
arrow_forward
Producción
more_horiz
Vector
Dimensiones Matryoshka help_outline
64
128
256
512
768
1024
Detalles del modelo
Parámetros: 865M
Longitud del token de entrada: 8K
Tamaño de la imagen de entrada: 512×512
Dimensión de salida: 1024
Modelo base help_outline
open_in_new
EVA02-L-14
link
jina-embeddings-v3
Idiomas entrenados help_outline
32 idiomas
Idiomas admitidos help_outline
108 idiomas
Modelos relacionados
link
jina-clip-v1
Disponible a través de
Elastic Inference Service
API de Jina
AWS SageMaker
Microsoft Azure
Nube de Google
Hugging Face
Air-gapped
Gráfico de E/S 1

Texto

jina-clip-v2

Vector

Gráfico de E/S 2

Imagen

jina-clip-v2

Vector

Frontera de Paretohelp_outline
ViDoRe v1
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2Parámetros (log)i2t-recall@5
Este modelo
En la frontera
Jina AI
Otros
CLIP Benchmark
89.73
Parámetros
865M
Rango por score
34 / 56
Frontera de Pareto
Por detrás
Distribución de valoreshelp_outline
AUC 0.8383
Corpus
Pares de traducción
Búsqueda documental
Imagen / banner
Imagen / logotipo
Tarea
default
retrieval.query
0.6040.000.200.400.60
Relacionados20.2%
Negativo difícil3.6%
No relacionados0.8%
Umbrales recomendados
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
equilibrado · 0.403
AUC
0.8383
Techo de ruido
0.666
Caída de exhaustividad
0.224
Pares medidos
119 / 11k
Componentes del vectorhelp_outline
-0.43-0.070.29
σ 0.0313 · 244k valores
Geometría del embeddinghelp_outline
01024
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.420
Dim. efectivas
52 / 1024
Pares de idiomashelp_outline
de-ruen-deen-koen-zhja-ko
Dispersión del umbral entre pares: 0.064
Elija modelos para comparar
Publicaciones (2)
ICLR 2026
enero 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
diciembre 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

Descripción general

jina-clip-v2 es un modelo de embeddings multimodal multilingüe de 865M parámetros que admite 89 idiomas y entrada de imagen de 512×512. Extiende jina-clip-v1 con alineación imagen-texto entre idiomas, aprendizaje de representaciones Matryoshka para la reducción de dimensiones (1024→64) y mejor rendimiento en documentos visualmente ricos. Alcanza un retrieval cross-lingüístico de imágenes state-of-the-art manteniendo un rendimiento sólido en texto únicamente y en modalidades individuales.

Métodos

El modelo emplea una arquitectura de doble codificador que combina un codificador de texto Jina XLM-RoBERTa (561M parámetros, 89 idiomas, contexto de 696.320 tokens) con un codificador visual EVA02-L14 (304M parámetros, entrada de 512×512 píxeles). El entrenamiento usa un paradigma de aprendizaje contrastivo multitarea y multietapa: el modelo se entrena simultáneamente en pares de texto, tripletes de texto y pares imagen-texto para soportar tanto tareas solo de texto como cross-modales. El conjunto de datos de entrenamiento se expandió para incluir textos multilingües de 29 idiomas no ingleses (incluidos hindi, chino, alemán y francés) e imágenes de documentos visualmente ricos. El aprendizaje de representaciones Matryoshka permite reducir la dimensión del embedding de 1024 a 64 dimensiones mientras preserva más del 99 % del rendimiento. El modelo usa Last-Token-Pooling para el embedding final.

Rendimiento

El modelo alcanza 98,0 % de precisión en la recuperación imagen-texto de Flickr30k, superando tanto a jina-clip-v1 como a NLLB-CLIP-SigLIP. En escenarios multilingües, muestra hasta un 4 % de mejora sobre NLLB-CLIP-SigLIP en la recuperación de imágenes entre idiomas. La compresión de embeddings es notablemente efectiva: reducir las dimensiones un 75 % (1024→256) aún preserva más del 99 % del rendimiento en tareas de texto, imagen y cross-modales. En Multilingual MTEB, alcanza 69,86 % en recuperación y 67,77 % en similitud semántica, con un rendimiento competitivo frente a modelos de embeddings de texto especializados. El soporte de 89 idiomas y el manejo de documentos visualmente ricos lo hacen particularmente apto para el comercio electrónico global y la gestión de contenido.

Guía

Redimensione las imágenes a 512×512 píxeles antes del procesamiento — las imágenes más grandes se dividen automáticamente en mosaicos, lo que aumenta el uso de tokens y el tiempo de procesamiento. El modelo destaca al hacer coincidir imágenes con texto descriptivo en 89 idiomas, ideal para la búsqueda de productos en el comercio electrónico global, la recomendación de contenido y la búsqueda visual multilingüe. Puede tener dificultades con conceptos abstractos o contenido de dominios altamente especializados. Al usar la reducción de dimensiones Matryoshka, los embeddings de 64 dimensiones mantienen un rendimiento sólido para indexación; use 512+ dimensiones para el re-ranking de aplicaciones críticas. El modelo requiere hardware con capacidad CUDA. Para cargas de trabajo solo de texto, jina-embeddings-v5-text-small ofrece mejor precisión por parámetro. Para recuperación de código, use jina-code-embeddings-1.5b. Disponible a través de Jina API, AWS, Azure y los marketplaces de GCP.

Blogs que mencionan este modelo
julio 31, 2025 • 12 minutos de lectura
How Image Resolution Impacts Visual Document Retrieval
Image resolution is crucial for embedding visually rich documents. Too small and models miss key details; too large and they can't connect the parts.
Maximilian Werk
Michael Günther
Scott Martens
Abstract composition with a dark background featuring a flower-like design, radiant eye-like feature, rainbow-colored curved
julio 25, 2025 • 8 minutos de lectura
JinaVDR: New Visual Document Retrieval Benchmark with 95 Tasks in 20 Languages
JinaVDR is a new benchmark spanning 95 tasks across 20 languages for visual document retrieval, soon on MTEB.
Maximilian Werk
Alex C-G
Black-and-white design for "Jinavor Benchmark" with bold text. Below, "Visual Docs: 95 Tasks: 20 Languages" appears; an abstr
junio 25, 2025 • 12 minutos de lectura
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
mayo 28, 2025 • 4 minutos de lectura
Correlations: Vibe-Testing Embeddings in GUI
As serious as we are about MTEB, we also love vibe-testing. Correlations is a simple GUI we use for validating citations in DeepSearch, debugging late chunking, and vibe-testing embeddings. Now it's open-source.
Jina AI
Technical screen showing green and yellow visual data, including charts in the lower half and a heat-map-like visualization a
mayo 25, 2025 • 21 minutos de lectura
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
Idioma / tema actual
Search Foundation
Reader
Embeddings
Reranker
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y su contenido, software, productos y servicios asociados están destinados exclusivamente a un uso profesional. El uso por parte de consumidores no está previsto ni dirigido.