Gráfico de E/S 1

Texto

jina-embeddings-v4

Tarea

Vector

Gráfico de E/S 2

Imagen

jina-embeddings-v4

Tarea

Vector

Gráfico de E/S 3

múltiple

Vector

Texto

jina-embeddings-v4

Tarea

Gráfico de E/S 4

múltiple

Vector

Imagen

jina-embeddings-v4

Tarea

Frontera de Pareto
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderjina-embeddings-v4Parámetros (log)nDCG@10
Este modelo
En la frontera
Jina AI
Otros
CoIR
71.59
Parámetros
3.8B
Rango por score
2 / 31
Frontera de Pareto
Por detrás
Distribución de valores
AUC 0.8308
Corpus
Pares de traducción
Búsqueda documental
Código
Imagen / banner
Imagen / logotipo
Tarea
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
Relacionados6.7%
Negativo difícil1.1%
No relacionados0.8%
Umbrales recomendados
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
equilibrado · 0.618
AUC
0.8308
Techo de ruido
0.877
Caída de exhaustividad
0.516
Pares medidos
119 / 11k
Componentes del vector
-0.19-0.020.15
σ 0.0221 · 487k valores
Geometría del embedding
02048
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.496
Dim. efectivas
73 / 2048
Truncado de dimensiones
12825651210242048
text-matching · Umbral según las dimensiones solicitadas
Pares de idiomas
de-ruen-deen-koen-zhja-ko
Dispersión del umbral entre pares: 0.069
Elija modelos para comparar
Publicaciones (2)

Descripción general

jina-embeddings-v4 es un modelo de embedding multimodal de 3,8B parámetros que unifica las representaciones de texto e imagen en una única arquitectura. Apoya de forma única tanto el modo de salida de vector único (denso) como el de múltiples vectores (interacción tardía/estilo ColBERT), permitiendo a los equipos compensar la eficiencia de indexación frente a la precisión de recuperación sin cambiar de modelo. El modelo alcanza un rendimiento state-of-the-art en la recuperación de documentos visualmente ricos, procesando tablas, gráficos, diagramas y formatos de medios mixtos de forma nativa.

Métodos

La arquitectura combina un backbone de encoder transformer grande con un vision encoder basado en Qwen2.5-VL, procesando texto (hasta 32K tokens) e imágenes (768×28×28 patches) a través de capas de atención compartidas. Tres adaptadores LoRA específicos por tarea (60M parámetros cada uno) especializan el modelo en: recuperación asimétrica consulta-documento, similitud semántica de texto y búsqueda de código. El diseño de doble salida es la clave de la innovación: el modelo puede producir un único vector denso de 2048 dimensiones (para indexado ANN rápido con truncamiento Matryoshka a 128 dimensiones) o un conjunto de vectores a nivel de token de 128 dimensiones para puntuación de interacción tardía. El entrenamiento usó un plan de estudios de dos etapas: preentrenamiento contrastivo conjunto en pares texto-imagen y texto-texto, seguido de entrenamiento de adaptadores LoRA específicos por tarea. Se soporta late chunking para documentos que exceden la ventana de contexto de 32K tokens. Se aplica la Qwen Research License.

Rendimiento

En JinaVDR (Visual Document Retrieval), el modelo puntúa un promedio de 72,19, frente a 64,50 para ColPali-v1.2. En ViDoRe, logra un promedio de 84,11 (90,17 en modo multi-vector) frente a 83,90 para ColPali. La recuperación cross-modal alcanza 84,11 en el benchmark CLIP, superando jina-clip-v2 (81,12) y nllb-clip-large-siglip (83,19). Puntuaciones de recuperación de texto: 55,97 en MTEB-en, 66,49 en MMTEB, 67,11 en LongEmbed (frente a 55,66 para jina-embeddings-v3). La similitud semántica alcanza 85,89 en English STS y 72,70 en STS multilingüe. La recuperación de código puntúa 71,59 en CoIR. El alineamiento cross-modal alcanza 0,71 de similitud coseno (frente a 0,15 para OpenAI CLIP). El modo multi-vector supera consistentemente al modo single-vector en tareas visualmente ricas; el modo single-vector ofrece rendimiento eficiente para la recuperación de texto estándar.

Guía

Elija el modo de salida según su pipeline: vector único para indexado ANN a gran escala (truncamiento Matryoshka a 128–512 dimensiones disponible), múltiples vectores para reclasificar los top-k candidatos en documentos visualmente ricos. Seleccione el adaptador LoRA a través del parámetro de tarea de la API: 'retrieval' para búsqueda consulta-documento, 'text-matching' para similitud semántica, 'code' para recuperación de código. Para documentos que exceden 32K tokens, use `late_chunking. El sobrecargo de 60M parámetros por adaptador LoRA es despreciable (<2 % de aumento de memoria) y los tres adaptadores pueden cargarse simultáneamente. El modelo está licenciado bajo Qwen Research License (uso no comercial sin licencia comercial). Para despliegues de producción, use GPUs con soporte CUDA; el modelo está disponible a través de Jina API, AWS, Azure y marketplaces de GCP. Para cargas de trabajo solo de texto, jina-embeddings-v5-text-small` ofrece mejor precisión por parámetro a una fracción del costo computacional.

Blogs que mencionan este modelo