Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Incrustaciones
Licencia de investigación de Qwen
open_in_new Publicación de lanzamiento

jina-embeddings-v4

Modelo de integración universal para la recuperación multimodal y multilingüe
Licencia
Qwen Research License
Fecha de lanzamiento
calendar_month
2025-06-24
Aporte
abc
Texto
image
Imagen
picture_as_pdf
PDF
arrow_forward
Producción
more_horiz
Vector
apps
Multi-vectorial
Dimensiones Matryoshka help_outline
128
256
512
1024
2048
Fragmentación tardía help_outline
check_circle
Yes
Detalles del modelo
Parámetros: 3.8B
Longitud del token de entrada: 32K
Tamaño de la imagen de entrada: 768×28×28
Dimensión de salida: 2048
Modelo base help_outline
open_in_new
Qwen2.5-VL-3B-Instruct
Idiomas entrenados help_outline
34 idiomas
Idiomas admitidos help_outline
29 idiomas
Cuantizaciones help_outline
GGUF
Modelos relacionados
link
jina-embeddings-v3
link
jina-clip-v2
Tareas admitidas
search Recuperación
compare_arrows Coincidencia de texto
code Código
Disponible a través de
API de Jina
Hugging Face
Air-gapped
Gráfico de E/S 1

Texto

jina-embeddings-v4

Tarea

Vector

Gráfico de E/S 2

Imagen

jina-embeddings-v4

Tarea

Vector

Gráfico de E/S 3

múltiple

Vector

Texto

jina-embeddings-v4

Tarea

Gráfico de E/S 4

múltiple

Vector

Imagen

jina-embeddings-v4

Tarea

Pareto fronthelp_outline
RTEB public
LongEmbed
CoIR
ViDoRe v1
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v4Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
LongEmbed
69.88
Parameters
3.8B
Rank by score
7 / 69
Pareto front
Behind it
Distribución de valoreshelp_outline
AUC 0.8308
Corpus
Pares de traducción
Búsqueda documental
Código
Imagen / banner
Imagen / logotipo
Tarea
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
Relacionados6.7%
Negativo difícil1.1%
No relacionados0.8%
Umbrales recomendados
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
equilibrado · 0.618
AUC
0.8308
Techo de ruido
0.877
Caída de exhaustividad
0.516
Pares medidos
119 / 11k
Componentes del vectorhelp_outline
-0.19-0.020.15
σ 0.0221 · 487k valores
Geometría del embeddinghelp_outline
02048
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.496
Dim. efectivas
73 / 2048
Truncado de dimensioneshelp_outline
12825651210242048
text-matching · Umbral según las dimensiones solicitadas
Pares de idiomashelp_outline
de-ruen-deen-koen-zhja-ko
Dispersión del umbral entre pares: 0.069
Elige modelos para comparar
Publicaciones (2)
ICLR 2026
enero 22, 2026
Embedding Compression via Spherical Coordinates
EMNLP 2025
junio 24, 2025
jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval

Descripción general

Jina Embeddings V4 es un modelo de incrustación multimodal de 3800 millones de parámetros que proporciona capacidades unificadas de representación de texto e imágenes. Basado en la estructura principal Qwen2.5-VL-3B-Instruct, el modelo presenta una arquitectura que admite incrustaciones monovectoriales y multivectoriales en el estilo de interacción tardía, solucionando así las limitaciones de los modelos tradicionales de codificador dual estilo CLIP. El modelo incorpora tres adaptadores LoRA especializados para tareas específicas (60 millones de parámetros cada uno) que optimizan el rendimiento en diferentes escenarios de recuperación, incluyendo la recuperación asimétrica de documentos de consulta, la similitud semántica de texto y la búsqueda de código sin modificar los pesos de la estructura principal. El modelo demuestra un excelente rendimiento en el procesamiento de contenido visualmente rico, como tablas, gráficos, diagramas, capturas de pantalla y formatos multimedia mixtos, mediante una ruta de procesamiento unificada que reduce la brecha de modalidad presente en las arquitecturas convencionales. Al admitir capacidades multilingües, el modelo puede manejar textos de entrada de hasta 32.768 tokens con imágenes redimensionadas a 20 megapíxeles, lo que lo hace adecuado para diversas aplicaciones de recuperación de documentos y búsqueda intermodal en diferentes idiomas y dominios.

Métodos

Jina Embeddings V4 implementa una arquitectura unificada de modelo de lenguaje multimodal, diferente de los enfoques de codificador dual de estilo CLIP. El modelo procesa las entradas mediante una ruta compartida donde las imágenes se convierten primero en secuencias de tokens mediante un codificador de visión; posteriormente, el decodificador del modelo de lenguaje, con capas de atención contextual, procesa conjuntamente las modalidades de texto e imagen. Esta arquitectura admite dos modos de salida para adaptarse a diferentes casos de uso: incrustaciones de un solo vector que producen vectores de 2048 dimensiones truncables a 128 mediante el Aprendizaje de Representación Matryoshka, generados mediante agrupación de medias para una búsqueda eficiente de similitudes; e incrustaciones multivector que generan 128 dimensiones por token mediante capas de proyección para la recuperación de estilo de interacción tardía. El modelo incluye tres adaptadores LoRA específicos para cada tarea que proporcionan optimización especializada: el adaptador de recuperación utiliza codificación asimétrica basada en prefijos con entrenamiento de negativos duros para escenarios de consulta-documento; el adaptador de coincidencia de texto emplea la pérdida CoSENT para tareas de similitud semántica; y el adaptador de código se centra en aplicaciones de recuperación de lenguaje natural a código. El entrenamiento se realiza en dos fases: entrenamiento inicial de pares mediante pérdida contrastiva InfoNCE con pares texto-texto y texto-imagen de más de 300 fuentes; seguido de un ajuste preciso específico para cada tarea de los tres adaptadores LoRA mediante métodos basados en tripletes y funciones de pérdida especializadas adaptadas a los requisitos de cada dominio.

Actuación

Jina Embeddings V4 alcanza un rendimiento competitivo en múltiples categorías de referencia. En la recuperación visual de documentos, obtiene una puntuación media de 72,19 en la prueba JinaVDR, frente a los 64,50 de ColPali-v1.2, y de 84,11 en ViDoRe, frente a los 83,90 de ColPali. El modo multivectorial alcanza los 90,17 en ViDoRe. En la recuperación intermodal, el modelo obtiene una puntuación de 84,11 en la prueba CLIP, frente a los 81,12 de jina-clip-v2 y nllb-clip-large-siglip (83,19). En la recuperación de texto, alcanza los 55,97 en MTEB-en y los 66,49 en MMTEB, destacando el rendimiento en el procesamiento de documentos largos, con 67,11 en LongEmbed, frente a los 55,66 de su predecesor. El modelo demuestra un sólido rendimiento en similitud de texto semántico, con una puntuación de 85,89 en tareas STS en inglés y de 72,70 en pruebas STS multilingües. La capacidad de recuperación de código alcanza 71,59 en la prueba CoIR, aunque modelos especializados como voyage-code-3 (77,33) obtienen puntuaciones más altas en este dominio. El modelo muestra una mejor alineación intermodal, con una puntuación de 0,71 en comparación con 0,15 para OpenAI CLIP, lo que soluciona el problema de la brecha modal en modelos multimodales. El modo multivectorial supera consistentemente al modo monovectorial en tareas visualmente ricas, mientras que el modo monovectorial ofrece un rendimiento eficiente en escenarios de recuperación estándar.

Guía

Para utilizar Jina Embeddings V4 eficazmente, seleccione el adaptador LoRA adecuado según los requisitos específicos de su aplicación. Utilice el adaptador de recuperación para escenarios de recuperación asimétrica de documentos y consultas, donde las consultas y los documentos tienen estructuras diferentes, garantizando la aplicación de los prefijos adecuados para distinguir entre el contenido de la consulta y el del pasaje. El adaptador de coincidencia de texto es adecuado para tareas de similitud semántica y recuperación simétrica, donde el objetivo es encontrar contenido similar en lugar de respuestas a consultas, lo que lo hace apropiado para la agrupación de documentos, la detección de duplicados y los sistemas de recomendación de contenido. Para aplicaciones relacionadas con la programación, el adaptador de código está optimizado para la recuperación de lenguaje natural a código, la búsqueda de similitud de código a código y la resolución de preguntas técnicas. Seleccione los modos de salida según sus requisitos de rendimiento y eficiencia: las incrustaciones de un solo vector ofrecen una búsqueda de similitud eficiente y son adecuadas para entornos con limitaciones de almacenamiento, con dimensiones truncables que permiten la reducción de 2048 a 128-512 dimensiones con compensaciones de calidad aceptables, mientras que las incrustaciones multivectoriales proporcionan mayor precisión para tareas de recuperación complejas, especialmente al trabajar con documentos visualmente ricos donde la puntuación de interacción tardía captura relaciones detalladas. La arquitectura unificada del modelo permite el procesamiento de entradas mixtas de texto e imagen sin necesidad de codificadores independientes ni preprocesamiento de OCR para documentos visuales. Las capacidades de alineación intermodal del modelo y su compatibilidad multilingüe lo hacen adecuado para aplicaciones internacionales. Para implementaciones de producción, considere la sobrecarga de parámetros de 60 M por adaptador LoRA al planificar los requisitos de memoria, teniendo en cuenta que los tres adaptadores pueden mantenerse simultáneamente con menos del 2 % de consumo de memoria adicional, lo que permite una conmutación flexible de tareas durante la inferencia.
Blogs que mencionan este modelo
marzo 11, 2026 • 7 minutos de lectura
Bootstrapping Audio Embeddings from Multimodal LLMs
Turn any multimodal LLM into a small audio embedding model that beats CLAP with 25x less data.
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
febrero 19, 2026 • 7 minutos de lectura
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Two sub-1B multilingual embeddings with best-in-class performance, available on Elastic Inference Service, Llama.cpp and MLX.
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
septiembre 09, 2025 • 11 minutos de lectura
Multimodal Embeddings in Llama.cpp and GGUF
We brought multimodal embeddings to llama.cpp and GGUF, and uncovered a few surprising issues along the way.
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
septiembre 04, 2025 • 6 minutos de lectura
Jina Code Embeddings: SOTA Code Retrieval at 0.5B and 1.5B
Code generation LLMs → code embeddings: 0.5B/1.5B models achieve SOTA performance across 25 code retrieval benchmarks.
Jina AI
Green "Code Embeddings" text displayed in a LED dot style on a black background, evoking a futuristic and technological atmos
agosto 13, 2025 • 15 minutos de lectura
Optimizing GGUFs for Decoder-Only Embedding Models
4000 tokens/sec for a 3B-parameter embedding model on L4 GPU is probably as fast as you'll get with llama.cpp. Or is it?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.