Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Incrustaciones
copyright CC BY-NC 4.0
open_in_new Publicación de lanzamiento

jina-embeddings-v5-omni-small

Incrustaciones multimodales para texto, imagen, audio, vídeo y PDF.
Licencia
copyright CC-BY-NC-4.0
Fecha de lanzamiento
calendar_month
2026-05-07
Aporte
abc
Texto
image
Imagen
audiotrack
Audio
videocam
Video
picture_as_pdf
PDF
arrow_forward
Producción
more_horiz
Vector
Dimensiones Matryoshka help_outline
32
64
128
256
512
768
1024
Detalles del modelo
Parámetros: 1.7B
Longitud del token de entrada: 32K
Dimensión de salida: 1024
Modelo base help_outline
open_in_new
jina-embeddings-v5-text-small
Idiomas entrenados help_outline
32 idiomas
Idiomas admitidos help_outline
93 idiomas
Cuantizaciones help_outline
GGUF
Soporte para Apple Silicon help_outline
MLX
Modelos relacionados
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
Tareas admitidas
search Recuperación
compare_arrows Coincidencia de texto
bubble_chart Agrupamiento
label Clasificación
Disponible a través de
Elastic Inference Service
API de Jina
AWS SageMaker
Hugging Face
Air-gapped
Gráfico de E/S 1

Texto

jina-embeddings-v5-omni-small

Imagen

Tarea

Vector

Gráfico de E/S 2

Texto

jina-embeddings-v5-omni-small

Audio

Tarea

Vector

Gráfico de E/S 3

Texto

jina-embeddings-v5-omni-small

Video

Tarea

Vector

Gráfico de E/S 4

múltiple

Vector

Texto

jina-embeddings-v5-omni-small

PDF

Tarea

Pareto fronthelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
30M100M300M1B3.0B10B20406080bekko-embedding-v1-a25mbge-large-enbge-large-en-v1.5bge-m3bge-small-en-v1.5BOOM-4B-v1e5-base-v2e5-mistral-7b-instructF2LLM-v2-14BF2LLM-v2-330MF2LLM-v2-4BF2LLM-v2-80Mgranite-embedding-small…GritLM-7Bjina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-omni…jina-embeddings-v5-text…jina-embeddings-v5-text…LaBSEMoD-EmbeddingNemotron-3-Embed-8BNV-Embed-v2Octen-Embedding-0.6BOcten-Embedding-4BOcten-Embedding-8Bparaphrase-multilingual…paraphrase-multilingual…PIXIE-Rune-v1.0potion-multilingual-128Msnowflake-arctic-embed-…UAE-Large-V1voyage-4-nanoParameters (log)nDCG@10
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
Distribución de valoreshelp_outline
AUC 0.8269
Corpus
Pares de traducción
Búsqueda documental
Código
Imagen / banner
Imagen / logotipo
Tarea
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Relacionados10.9%
Negativo difícil2.1%
No relacionados0.9%
Umbrales recomendados
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
equilibrado · 0.697
AUC
0.8269
Techo de ruido
0.855
Caída de exhaustividad
0.566
Pares medidos
119 / 11k
Este modelo comparte su torre de texto con jina-embeddings-v5-text-small. Las distribuciones que se muestran son las de ese modelo, con el que coincide hasta la precisión fp16 del transporte.
Componentes del vectorhelp_outline
-0.160.010.18
σ 0.0313 · 244k valores
Geometría del embeddinghelp_outline
01024
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.300
Dim. efectivas
70 / 1024
Truncado de dimensioneshelp_outline
32641282565121024
text-matching · Umbral según las dimensiones solicitadas
Pares de idiomashelp_outline
de-ruen-deen-koen-zhja-ko
Dispersión del umbral entre pares: 0.024
Elige modelos para comparar
Publicaciones (1)
SIGIR 2026
mayo 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

Descripción general

jina-embeddings-v5-omni-small (~1.74B parámetros) es un modelo de incrustación multimodal que acepta texto, imágenes, video y audio, y produce incrustaciones en un espacio vectorial compartido alineado con jina-embeddings-v5-text-small. Puede indexar con texto y consultar con cualquier modalidad, o viceversa, sin reindexar. La estructura de texto y los cuatro adaptadores LoRA específicos para cada tarea (recuperación, coincidencia de texto, agrupamiento, clasificación) se congelan durante el entrenamiento multimodal, por lo que las salidas solo de texto son idénticas a jina-embeddings-v5-text-small. El modelo produce incrustaciones de 1024 dimensiones con truncamiento Matryoshka a 32 dimensiones y admite una longitud de contexto de token de 32K.

Métodos

Entrenado en una tercera etapa que extiende jina-embeddings-v5-text-small. La estructura principal del texto y los cuatro adaptadores LoRA específicos para la tarea están congelados; solo los proyectores multimodales se entrenan de nuevo. Un codificador de visión SigLIP2 So400m maneja imágenes y vídeo (32 fotogramas muestreados uniformemente). Un codificador de audio Whisper-large-v3 maneja la entrada de audio. Las páginas PDF se renderizan como imágenes y se procesan a través de la vía visual. El entrenamiento utiliza pérdida contrastiva con negativos duros multimodales para alinear las representaciones visuales y de audio con el espacio de incrustación de texto existente.

Actuación

El rendimiento en texto plano es idéntico al de jina-embeddings-v5-text-small: la estructura de texto y los adaptadores LoRA permanecen sin cambios durante el entrenamiento multimodal. En la recuperación multimodal, el modelo demuestra una sólida alineación en tareas de texto-imagen, texto-audio y texto-vídeo. La recuperación de páginas PDF se gestiona mediante la vía visual. El modelo omni-small ofrece la mejor relación precisión-eficiencia entre los modelos de incrustación multimodal de Jina para su implementación en servidores.

Guía

Los mismos cuatro adaptadores LoRA que v5-text-small: recuperación, coincidencia de texto, agrupamiento y clasificación. Para entradas multimodales a través de la API, pase directamente URL de imágenes, URL de archivos de audio, URL de archivos de video o URL de PDF; el modelo enruta cada modalidad a través del codificador apropiado. Los formatos de audio compatibles incluyen WAV, MP3, FLAC, OGG, M4A y Opus. Las entradas de video se procesan como 32 fotogramas muestreados uniformemente. Mezcle modalidades libremente dentro de un solo lote: el espacio de incrustación se comparte entre todas las modalidades. Use la similitud del coseno para la comparación. Se admite la truncación Matryoshka de 1024 a 32 dimensiones. Las incrustaciones solo de texto son compatibles directamente con jina-embeddings-v5-text-small; no se necesita reindexar al actualizar.
Blogs que mencionan este modelo
mayo 12, 2026 • 7 minutos de lectura
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.