Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Arquitectura
Primeros pasos
Entrenamiento
Conclusión
star
Presentado
presione soltar
mayo 12, 2026

jina-embeddings-v5-omni: Modelos de vectores para texto, imagen, audio y vídeo

Un modelo, cuatro modalidades: texto, imagen, audio y video. Los mejores modelos de Embeddings omni de su clase con 1.6B y 0.9B de parámetros.
Han Xiao
Han Xiao • 7 minutos de lectura
jina-embeddings-v5-omni - una colección de jinaai
Modelos de 向量模型 multimodales (texto + imagen + video + audio) alineados con jina-embeddings-v5-text-*. Dos tamaños, cuatro variantes de tarea cada uno.
una colección de jinaai
jina-embeddings-v5-omni: Text-Geometry-Preserving Multimodal Embeddings via Frozen-Tower Composition
En este trabajo, presentamos la composición de modelos de codificador congelado, un enfoque novedoso para los modelos de 向量模型 multimodales. Nos basamos en la arquitectura de estilo VLM, en la que los codificadores que no son de texto se adaptan para generar entradas para un 大模型, que a su vez genera 向量模型 para todas las variedades de entrada. Presentamos el resultado: la suite jina-embeddings-v5-omni, un par de modelos que codifican entradas de texto, imagen, audio y video en un único espacio de 向量模型 semánticos. Nuestro método consiste en extender los dos modelos Jina Embeddings v5 Text para admitir medios adicionales mediante la adición de codificadores para imágenes y audio. Los modelos de 向量模型 de texto base y los codificadores de medios que no son de texto añadidos permanecen congelados. Solo entrenamos los componentes de conexión, que representan el 0,35 % de los pesos totales del modelo conjunto. Por lo tanto, el entrenamiento es mucho más eficiente que el reentrenamiento de parámetros completos. Además, el 大模型 permanece prácticamente inalterado, produciendo exactamente los mismos 向量模型 para las entradas de texto que los modelos Jina Embeddings v5 Text. Nuestras evaluaciones muestran que este enfoque produce resultados competitivos con el estado del arte, obteniendo un rendimiento casi igual al de los modelos de 向量模型 multimodales más grandes.
arXiv.orgFlorian Hönicke

Lanzamos jina-embeddings-v5-omni, que extiende nuestros modelos de 向量模型 v5-text a imágenes, audio y video. Ambos modelos comparten la misma base de texto congelada que v5-text, lo que significa que los 向量模型 de texto son idénticos; no es necesario reconstruir el índice. jina-embeddings-v5-omni-small obtiene una puntuación media de 53,93 en las cuatro modalidades, igualando a LCO-7B (54,43) con 5,7 veces menos parámetros, mientras que jina-embeddings-v5-omni-nano ofrece una recuperación de documentos competitiva con solo 0,95 mil millones de parámetros.

Frontera de Pareto
Frontera de Pareto de todos los modelos de 向量模型 omni de pesos abiertos (que admiten texto, imagen, audio y video). jina-embeddings-v5-omni-small (1,57 mil millones) iguala la puntuación media de LCO-7B (8,93 mil millones) utilizando 5,7 veces menos parámetros. jina-embeddings-v5-omni-nano (0,95 mil millones) supera a LanguageBind (1,14 mil millones) por +8,9 puntos. Líneas base: LanguageBind, Omni-Embed-Nemotron-3B, LCO-Embedding-Omni-3B, LCO-Embedding-Omni-7B.
Puntuaciones por modalidad
Desglose por modalidad en Texto (MMTEB), Imagen (MIEB), Video (MMEB-Video) y Audio (MAEB). jina-embeddings-v5-omni-small lidera todos los modelos omni en texto con 67,0, heredando toda la calidad de jina-embeddings-v5-text-small. En imagen (56,05), destaca en clasificación (68,55) y agrupamiento (84,57, el mejor entre todos los modelos). El audio (51,46) está cerca de LCO-7B (52,37), con la mejor puntuación en clasificación de audio (55,89). El video (41,20) es la brecha actual frente a LCO-7B (47,41), ya que el razonamiento temporal se beneficia más del entrenamiento de extremo a extremo.
Desglose de tareas
Rendimiento por tarea en 13 tipos de tareas. Las estrellas doradas marcan las tareas en las que jina-embeddings-v5-omni-small supera a la mejor línea base de pesos abiertos (3-9 veces más grande). Victorias: clasificación de imágenes (68,55 frente a 64,30), agrupamiento de imágenes (84,57 frente a 83,24), clasificación de audio (55,89 frente a 53,39). Brechas principales: recuperación de video (27,82 frente a 58,73) y composición/VQA (44,23 frente a 53,40).
Recuperación de documentos
Recuperación de documentos (ViDoRe-in-MIEB). jina-embeddings-v5-omni-small con 0,92 mil millones de parámetros activos de texto+imagen obtiene 79,08, superando a LCO-3B (78,24 con 4,07 mil millones). jina-embeddings-v5-omni-nano obtiene 70,05 con solo 0,31 mil millones de parámetros activos, muy por encima de LanguageBind (37,33). Nemotron-3B lidera con 85,64 pero utiliza 5,1 veces más parámetros.

tagArquitectura

v5-omni mantiene la base v5-text completamente congelada y añade codificadores de visión y audio preentrenados conectados a través de pequeños proyectores entrenables:

  • Visión: Codificadores de visión Qwen3.5 (adaptados de SigLIP2) con fusión espacial 2x2 (reducción de 4x 词元). Congelamos todo excepto la capa de proyección final (fc_vision_2), que reemplazamos con una capa inicializada aleatoriamente que mapea a la dimensión oculta de la base de texto.
  • Audio: Codificador Qwen2.5-Omni (adaptado de Whisper-large-v3). Una única capa fc_audio inicializada aleatoriamente proyecta la salida de 1280 dimensiones en la base de texto.
  • Video: Manejado como una secuencia de fotogramas visuales, precedidos opcionalmente por un segmento de audio extraído.

El modelo hereda los cuatro adaptadores LoRA específicos de tarea de v5-text (recuperación, coincidencia de texto, clasificación, agrupamiento) y entrena pesos de proyector separados para cada variante de tarea. La arquitectura es totalmente modular: la implementación solo de texto no carga pesos de visión o audio (idéntico a la huella de v5-text), la implementación solo de imagen omite el audio, y el modo omni completo carga todo.

Arquitectura
Arquitectura v5-omni. Los codificadores de visión y audio congelados alimentan proyectores entrenables hacia la base de texto congelada. Solo se entrenan los proyectores (0,35 % del peso total). Los adaptadores LoRA específicos de tarea manejan la recuperación, clasificación, agrupamiento y coincidencia de texto.
Característicajina-embeddings-v5-omni-smalljina-embeddings-v5-omni-nano
Modelo de texto basejina-embeddings-v5-text-small (Qwen3-0.6B)jina-embeddings-v5-text-nano (EuroBERT-210m)
Parámetros totales~1.56B~1.04B
ModalidadesTexto, Imagen, Audio, Video, PDFTexto, Imagen, Audio, Video, PDF
Dimensiones de 向量模型1024768
Dimensiones Matryoshka32, 64, 128, 256, 512, 768, 102432, 64, 128, 256, 512, 768
Longitud máxima de secuencia32768 词元8192 词元
Codificador de visiónQwen3.5-2B ViT (SigLIP2)SigLIP2 Base
Codificador de audioWhisper-large-v3Whisper-large-v3
Tareasrecuperación, coincidencia de texto, clasificación, agrupamientorecuperación, coincidencia de texto, clasificación, agrupamiento
Compatibilidad de textoIdéntico a jina-embeddings-v5-text-smallIdéntico a jina-embeddings-v5-text-nano
Parámetros entrenables~18M proyectores (0.35%)~7M proyectores (0.35%)
PoolingLast-tokenLast-token
LicenciaCC BY-NC 4.0CC BY-NC 4.0

tagPrimeros pasos

tagElasticsearch (Elastic Inference Service)

Si ya estás utilizando jina-embeddings-v5-text en Elasticsearch, tus índices de texto existentes funcionan con v5-omni sin necesidad de configuración adicional. Los modelos omni producen embeddings idénticos para entradas de texto que v5-text; misma entrada, mismo vector, byte a byte. No necesitas volver a generar los embeddings ni reconstruir ningún índice de texto. Para comenzar a buscar imágenes, audio y vídeo junto a tus datos de texto existentes, simplemente crea un nuevo índice con v5-omni e ingesta tu contenido multimodal en él.

Crea un índice semantic_text con v5-omni como punto de enlace de inferencia. EIS selecciona automáticamente el adaptador LoRA correcto para la indexación y recuperación:

PUT multimodal-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-omni-small"
      }
    }
  }
}

Ingesta texto, imágenes (como URIs de datos en base64), audio y vídeo en el mismo campo y el mismo índice:

// Ingesta de texto
POST multimodal-semantic-index/_doc
{
  "content": "'Kraft Dinner' es como los canadienses llaman a los macarrones con queso cuando se preparan a partir de un kit."
}

// Ingesta de una imagen (base64)
POST multimodal-semantic-index/_doc
{
  "content": "data:image/png;base64,iVBORw0KGgoAAAAN..."
}

Realiza búsquedas en todas las modalidades con una sola consulta de texto:

GET multimodal-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "Was bedeutet 'Kraft Dinner' für Kanadier?"
    }
  }
}

tagJina Embedding API

curl https://api.jina.ai/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "jina-embeddings-v5-omni-small",
    "task": "retrieval.query",
    "dimensions": 1024,
    "input": ["What does this image show?"],
    "images": ["data:image/png;base64,..."]
  }'

tagHugging Face

from sentence_transformers import SentenceTransformer
import torch

model = SentenceTransformer(
    "jinaai/jina-embeddings-v5-omni-small-retrieval",
    model_kwargs={"dtype": torch.bfloat16},
)

# Embedding de texto (idéntico a v5-text)
text_emb = model.encode("What is knowledge distillation?", prompt_name="query")

# Embedding de imagen
from PIL import Image
img = Image.open("photo.jpg")
img_emb = model.encode(img)

# Similitud cross-modal
similarity = model.similarity(text_emb, img_emb)

tagEntrenamiento

La idea central es la composición de modelos con codificadores congelados: tomar un modelo de vectorización de texto robusto, añadir codificadores de visión y audio preentrenados, conectarlos con pequeños proyectores entrenables y congelar todo excepto esos proyectores. Solo se entrena el 0.35% del total de los pesos, lo que nos proporciona tres propiedades: (1) preservación de la identidad del texto: el núcleo (backbone) no se modifica, la misma entrada produce un resultado idéntico; (2) eficiencia de entrenamiento: el entrenamiento solo de proyectores es entre 1.8 y 3.9 veces más rápido con un 42-64% menos de memoria GPU; (3) modularidad: las torres pueden cargarse de forma independiente.

Eficiencia de entrenamiento
Entrenamiento solo de proyectores frente a entrenamiento completo en 4 GPUs H100 (tamaño de lote 256, 15K pasos). El entrenamiento del proyector de audio es particularmente eficiente: 3.2 veces más rápido para el modelo small (154 min frente a 497 min) y 3.9 veces más rápido para el nano (112 min frente a 441 min). Los ahorros de memoria del 42-64% provienen de no almacenar gradientes ni estados de optimizador para los codificadores congelados.

v5-omni hereda el soporte de dimensiones Matryoshka de v5-text. Los embeddings de imagen y audio conservan la mayor parte de la calidad bajo truncamiento, mientras que el vídeo se degrada más en dimensiones pequeñas.

Resumen de radar
Resumen: perfil por modalidad de v5-omni frente a las mejores líneas base. jina-embeddings-v5-omni-small de 1.57B cubre texto, imagen y audio de manera competitiva, siendo el vídeo la brecha restante a cerrar.

tagConclusión

La sabiduría convencional dice que los embeddings multimodales requieren entrenar todo el modelo de extremo a extremo. No estamos de acuerdo. v5-omni congela el núcleo de texto, entrena el 0.35% de los pesos y supera a modelos de 5 a 7 veces su tamaño. La lección: la composición supera al reentrenamiento. Un codificador de texto robusto es la parte más difícil; una vez que lo tienes, añadir visión y audio a través de proyectores ligeros es prácticamente gratis.

Esto es importante para la producción. Tus índices v5-text existentes permanecen intactos. Misma consulta, mismo vector, byte a byte. Simplemente has ganado búsqueda de imagen, audio y vídeo sin necesidad de volver a procesar un solo documento. Ese es el verdadero desbloqueo: recuperación multimodal como una actualización directa, no como un proyecto de migración.

jina-embeddings-v5-omni-small es el mejor modelo de embedding omni de pesos abiertos por debajo de los 2B de parámetros. jina-embeddings-v5-omni-nano lo logra con 0.9B. Ambos disponibles ahora en Hugging Face, Jina Search Foundation API y como punto de enlace de inferencia nativo en Elasticsearch.

Categorías:
star
Presentado
presione soltar
rss_feed

Leer más
agosto 03, 2026 • 11 minutos de lectura
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
febrero 19, 2026 • 7 minutos de lectura
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
diciembre 04, 2025 • 7 minutos de lectura
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.