

Lanzamos jina-embeddings-v5-omni, que extiende nuestros modelos de 向量模型 v5-text a imágenes, audio y video. Ambos modelos comparten la misma base de texto congelada que v5-text, lo que significa que los 向量模型 de texto son idénticos; no es necesario reconstruir el índice. jina-embeddings-v5-omni-small obtiene una puntuación media de 53,93 en las cuatro modalidades, igualando a LCO-7B (54,43) con 5,7 veces menos parámetros, mientras que jina-embeddings-v5-omni-nano ofrece una recuperación de documentos competitiva con solo 0,95 mil millones de parámetros.




tagArquitectura
v5-omni mantiene la base v5-text completamente congelada y añade codificadores de visión y audio preentrenados conectados a través de pequeños proyectores entrenables:
- Visión: Codificadores de visión Qwen3.5 (adaptados de SigLIP2) con fusión espacial 2x2 (reducción de 4x 词元). Congelamos todo excepto la capa de proyección final (
fc_vision_2), que reemplazamos con una capa inicializada aleatoriamente que mapea a la dimensión oculta de la base de texto. - Audio: Codificador Qwen2.5-Omni (adaptado de Whisper-large-v3). Una única capa
fc_audioinicializada aleatoriamente proyecta la salida de 1280 dimensiones en la base de texto. - Video: Manejado como una secuencia de fotogramas visuales, precedidos opcionalmente por un segmento de audio extraído.
El modelo hereda los cuatro adaptadores LoRA específicos de tarea de v5-text (recuperación, coincidencia de texto, clasificación, agrupamiento) y entrena pesos de proyector separados para cada variante de tarea. La arquitectura es totalmente modular: la implementación solo de texto no carga pesos de visión o audio (idéntico a la huella de v5-text), la implementación solo de imagen omite el audio, y el modo omni completo carga todo.

| Característica | jina-embeddings-v5-omni-small | jina-embeddings-v5-omni-nano |
|---|---|---|
| Modelo de texto base | jina-embeddings-v5-text-small (Qwen3-0.6B) | jina-embeddings-v5-text-nano (EuroBERT-210m) |
| Parámetros totales | ~1.56B | ~1.04B |
| Modalidades | Texto, Imagen, Audio, Video, PDF | Texto, Imagen, Audio, Video, PDF |
| Dimensiones de 向量模型 | 1024 | 768 |
| Dimensiones Matryoshka | 32, 64, 128, 256, 512, 768, 1024 | 32, 64, 128, 256, 512, 768 |
| Longitud máxima de secuencia | 32768 词元 | 8192 词元 |
| Codificador de visión | Qwen3.5-2B ViT (SigLIP2) | SigLIP2 Base |
| Codificador de audio | Whisper-large-v3 | Whisper-large-v3 |
| Tareas | recuperación, coincidencia de texto, clasificación, agrupamiento | recuperación, coincidencia de texto, clasificación, agrupamiento |
| Compatibilidad de texto | Idéntico a jina-embeddings-v5-text-small | Idéntico a jina-embeddings-v5-text-nano |
| Parámetros entrenables | ~18M proyectores (0.35%) | ~7M proyectores (0.35%) |
| Pooling | Last-token | Last-token |
| Licencia | CC BY-NC 4.0 | CC BY-NC 4.0 |
tagPrimeros pasos
tagElasticsearch (Elastic Inference Service)
Si ya estás utilizando jina-embeddings-v5-text en Elasticsearch, tus índices de texto existentes funcionan con v5-omni sin necesidad de configuración adicional. Los modelos omni producen embeddings idénticos para entradas de texto que v5-text; misma entrada, mismo vector, byte a byte. No necesitas volver a generar los embeddings ni reconstruir ningún índice de texto. Para comenzar a buscar imágenes, audio y vídeo junto a tus datos de texto existentes, simplemente crea un nuevo índice con v5-omni e ingesta tu contenido multimodal en él.
Crea un índice semantic_text con v5-omni como punto de enlace de inferencia. EIS selecciona automáticamente el adaptador LoRA correcto para la indexación y recuperación:
PUT multimodal-semantic-index
{
"mappings": {
"properties": {
"content": {
"type": "semantic_text",
"inference_id": ".jina-embeddings-v5-omni-small"
}
}
}
}Ingesta texto, imágenes (como URIs de datos en base64), audio y vídeo en el mismo campo y el mismo índice:
// Ingesta de texto
POST multimodal-semantic-index/_doc
{
"content": "'Kraft Dinner' es como los canadienses llaman a los macarrones con queso cuando se preparan a partir de un kit."
}
// Ingesta de una imagen (base64)
POST multimodal-semantic-index/_doc
{
"content": "data:image/png;base64,iVBORw0KGgoAAAAN..."
}Realiza búsquedas en todas las modalidades con una sola consulta de texto:
GET multimodal-semantic-index/_search
{
"query": {
"semantic": {
"field": "content",
"query": "Was bedeutet 'Kraft Dinner' für Kanadier?"
}
}
}tagJina Embedding API
curl https://api.jina.ai/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "jina-embeddings-v5-omni-small",
"task": "retrieval.query",
"dimensions": 1024,
"input": ["What does this image show?"],
"images": ["data:image/png;base64,..."]
}'tagHugging Face
from sentence_transformers import SentenceTransformer
import torch
model = SentenceTransformer(
"jinaai/jina-embeddings-v5-omni-small-retrieval",
model_kwargs={"dtype": torch.bfloat16},
)
# Embedding de texto (idéntico a v5-text)
text_emb = model.encode("What is knowledge distillation?", prompt_name="query")
# Embedding de imagen
from PIL import Image
img = Image.open("photo.jpg")
img_emb = model.encode(img)
# Similitud cross-modal
similarity = model.similarity(text_emb, img_emb)tagEntrenamiento
La idea central es la composición de modelos con codificadores congelados: tomar un modelo de vectorización de texto robusto, añadir codificadores de visión y audio preentrenados, conectarlos con pequeños proyectores entrenables y congelar todo excepto esos proyectores. Solo se entrena el 0.35% del total de los pesos, lo que nos proporciona tres propiedades: (1) preservación de la identidad del texto: el núcleo (backbone) no se modifica, la misma entrada produce un resultado idéntico; (2) eficiencia de entrenamiento: el entrenamiento solo de proyectores es entre 1.8 y 3.9 veces más rápido con un 42-64% menos de memoria GPU; (3) modularidad: las torres pueden cargarse de forma independiente.

v5-omni hereda el soporte de dimensiones Matryoshka de v5-text. Los embeddings de imagen y audio conservan la mayor parte de la calidad bajo truncamiento, mientras que el vídeo se degrada más en dimensiones pequeñas.

tagConclusión
La sabiduría convencional dice que los embeddings multimodales requieren entrenar todo el modelo de extremo a extremo. No estamos de acuerdo. v5-omni congela el núcleo de texto, entrena el 0.35% de los pesos y supera a modelos de 5 a 7 veces su tamaño. La lección: la composición supera al reentrenamiento. Un codificador de texto robusto es la parte más difícil; una vez que lo tienes, añadir visión y audio a través de proyectores ligeros es prácticamente gratis.
Esto es importante para la producción. Tus índices v5-text existentes permanecen intactos. Misma consulta, mismo vector, byte a byte. Simplemente has ganado búsqueda de imagen, audio y vídeo sin necesidad de volver a procesar un solo documento. Ese es el verdadero desbloqueo: recuperación multimodal como una actualización directa, no como un proyecto de migración.
jina-embeddings-v5-omni-small es el mejor modelo de embedding omni de pesos abiertos por debajo de los 2B de parámetros. jina-embeddings-v5-omni-nano lo logra con 0.9B. Ambos disponibles ahora en Hugging Face, Jina Search Foundation API y como punto de enlace de inferencia nativo en Elasticsearch.






