Descripción general
jina-embeddings-v4 es un modelo de embedding multimodal de 3,8B parámetros que unifica las representaciones de texto e imagen en una única arquitectura. Apoya de forma única tanto el modo de salida de vector único (denso) como el de múltiples vectores (interacción tardía/estilo ColBERT), permitiendo a los equipos compensar la eficiencia de indexación frente a la precisión de recuperación sin cambiar de modelo. El modelo alcanza un rendimiento state-of-the-art en la recuperación de documentos visualmente ricos, procesando tablas, gráficos, diagramas y formatos de medios mixtos de forma nativa.
Métodos
La arquitectura combina un backbone de encoder transformer grande con un vision encoder basado en Qwen2.5-VL, procesando texto (hasta 32K tokens) e imágenes (768×28×28 patches) a través de capas de atención compartidas. Tres adaptadores LoRA específicos por tarea (60M parámetros cada uno) especializan el modelo en: recuperación asimétrica consulta-documento, similitud semántica de texto y búsqueda de código. El diseño de doble salida es la clave de la innovación: el modelo puede producir un único vector denso de 2048 dimensiones (para indexado ANN rápido con truncamiento Matryoshka a 128 dimensiones) o un conjunto de vectores a nivel de token de 128 dimensiones para puntuación de interacción tardía. El entrenamiento usó un plan de estudios de dos etapas: preentrenamiento contrastivo conjunto en pares texto-imagen y texto-texto, seguido de entrenamiento de adaptadores LoRA específicos por tarea. Se soporta late chunking para documentos que exceden la ventana de contexto de 32K tokens. Se aplica la Qwen Research License.
Rendimiento
En JinaVDR (Visual Document Retrieval), el modelo puntúa un promedio de 72,19, frente a 64,50 para ColPali-v1.2. En ViDoRe, logra un promedio de 84,11 (90,17 en modo multi-vector) frente a 83,90 para ColPali. La recuperación cross-modal alcanza 84,11 en el benchmark CLIP, superando jina-clip-v2 (81,12) y nllb-clip-large-siglip (83,19). Puntuaciones de recuperación de texto: 55,97 en MTEB-en, 66,49 en MMTEB, 67,11 en LongEmbed (frente a 55,66 para jina-embeddings-v3). La similitud semántica alcanza 85,89 en English STS y 72,70 en STS multilingüe. La recuperación de código puntúa 71,59 en CoIR. El alineamiento cross-modal alcanza 0,71 de similitud coseno (frente a 0,15 para OpenAI CLIP). El modo multi-vector supera consistentemente al modo single-vector en tareas visualmente ricas; el modo single-vector ofrece rendimiento eficiente para la recuperación de texto estándar.
Guía
Elija el modo de salida según su pipeline: vector único para indexado ANN a gran escala (truncamiento Matryoshka a 128–512 dimensiones disponible), múltiples vectores para reclasificar los top-k candidatos en documentos visualmente ricos. Seleccione el adaptador LoRA a través del parámetro de tarea de la API: 'retrieval' para búsqueda consulta-documento, 'text-matching' para similitud semántica, 'code' para recuperación de código. Para documentos que exceden 32K tokens, use `late_chunking. El sobrecargo de 60M parámetros por adaptador LoRA es despreciable (<2 % de aumento de memoria) y los tres adaptadores pueden cargarse simultáneamente. El modelo está licenciado bajo Qwen Research License (uso no comercial sin licencia comercial). Para despliegues de producción, use GPUs con soporte CUDA; el modelo está disponible a través de Jina API, AWS, Azure y marketplaces de GCP. Para cargas de trabajo solo de texto, jina-embeddings-v5-text-small` ofrece mejor precisión por parámetro a una fracción del costo computacional.
Licencia de investigación de Qwen 









