Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Reader
Convierta cualquier URL a Markdown para un mejor anclaje de los LLM.
Embeddings
Embeddings multimodales y multilingües.
Reranker
Reranker para maximizar la relevancia de los resultados de búsqueda.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Embeddings
copyright CC BY-NC 4.0
open_in_new Publicación de lanzamiento

jina-embeddings-v5-omni-small

Embeddings multimodales para texto, imagen, audio, vídeo y PDF.
Licencia
copyright CC-BY-NC-4.0
Fecha de lanzamiento
calendar_month
2026-05-07
Entrada
abc
Texto
image
Imagen
audiotrack
Audio
videocam
Vídeo
picture_as_pdf
PDF
arrow_forward
Producción
more_horiz
Vector
Dimensiones Matryoshka help_outline
32
64
128
256
512
768
1024
Detalles del modelo
Parámetros: 1.7B
Longitud del token de entrada: 32K
Dimensión de salida: 1024
Modelo base help_outline
link
jina-embeddings-v5-text-small
open_in_new
SigLIP2 Large
open_in_new
Whisper-large-v3
Idiomas entrenados help_outline
32 idiomas
Idiomas admitidos help_outline
93 idiomas
Cuantizaciones help_outline
GGUF
Soporte para Apple Silicon help_outline
MLX
Modelos relacionados
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
Tareas admitidas
search Recuperación
compare_arrows Coincidencia de texto
bubble_chart Agrupamiento
label Clasificación
Disponible a través de
Elastic Inference Service
API de Jina
AWS SageMaker
Hugging Face
Air-gapped
Gráfico de E/S 1

Texto

jina-embeddings-v5-omni-small

Imagen

Tarea

Vector

Gráfico de E/S 2

Texto

jina-embeddings-v5-omni-small

Audio

Tarea

Vector

Gráfico de E/S 3

Texto

jina-embeddings-v5-omni-small

Vídeo

Tarea

Vector

Gráfico de E/S 4

múltiple

Vector

Texto

jina-embeddings-v5-omni-small

PDF

Tarea

Frontera de Paretohelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…Parámetros (log)score
Este modelo
En la frontera
Jina AI
Otros
MAEB
49.96
Parámetros
1.6B
Rango por score
5 / 21
Frontera de Pareto
En ella
Distribución de valoreshelp_outline
AUC 0.8269
Corpus
Pares de traducción
Búsqueda documental
Código
Imagen / banner
Imagen / logotipo
Tarea
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Relacionados10.9%
Negativo difícil2.1%
No relacionados0.9%
Umbrales recomendados
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
equilibrado · 0.697
AUC
0.8269
Techo de ruido
0.855
Caída de exhaustividad
0.566
Pares medidos
119 / 11k
Este modelo comparte su torre de texto con jina-embeddings-v5-text-small. Las distribuciones que se muestran son las de ese modelo, con el que coincide hasta la precisión fp16 del transporte.
Componentes del vectorhelp_outline
-0.160.010.18
σ 0.0313 · 244k valores
Geometría del embeddinghelp_outline
01024
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.300
Dim. efectivas
70 / 1024
Truncado de dimensioneshelp_outline
32641282565121024
text-matching · Umbral según las dimensiones solicitadas
Pares de idiomashelp_outline
de-ruen-deen-koen-zhja-ko
Dispersión del umbral entre pares: 0.024
Elija modelos para comparar
Publicaciones (1)
SIGIR 2026
mayo 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

Descripción general

jina-embeddings-v5-omni-small es un modelo de embeddings multimodal de ~1,74B parámetros que acepta texto, imágenes, video, audio y PDF, produciendo embeddings en un espacio vectorial compartido de 1024 dimensiones. Es el modelo de embeddings predeterminado de la API de Jina y ofrece el mejor equilibrio de precisión-eficiencia entre los modelos de embeddings multimodales de Jina. Las salidas solo de texto son bit-idénticas a jina-embeddings-v5-text-small, lo que permite una migración sin fisuras de solo texto a multimodal sin reindexación.

Métodos

El modelo se entrena en una tercera etapa que extiende jina-embeddings-v5-text-small. Durante el entrenamiento multimodal, el backbone de texto Qwen3-0,6B-Base y los cuatro adaptadores LoRA específicos de tarea se congelan; solo los proyectores intermodales se entrenan de nuevo. Un vision encoder SigLIP2 Large maneja imágenes y video (32 frames muestreados uniformemente por video). Un audio encoder Whisper-large-v3 maneja la entrada de audio. Las páginas de PDF se renderizan como imágenes y se procesan a través de la vía visual. El entrenamiento usa una pérdida contrastiva con negativos duros intermodales para alinear las representaciones visuales y de audio con el espacio de embedding de texto existente. La salida de 1024 dimensiones soporta recorte Matryoshka hasta 32 dimensiones. La ventana de contexto de 32K tokens cubre la entrada de texto. El modelo soporta inferencia cuantizada y MLX para Apple Silicon.

Rendimiento

El rendimiento solo de texto es bit-identico a jina-embeddings-v5-text-small (67,0 promedio MMTEB de nivel de tarea, 71,7 MTEB en inglés) — el backbone de texto y los adaptadores LoRA permanecen intactos durante el entrenamiento multimodal. En recuperación intermodal, el modelo demuestra una fuerte alineación en tareas de texto-imagen, texto-audio y texto-video. La recuperación de páginas de PDF se maneja a través de la vía visual. El modelo omni-small ofrece el mejor equilibrio de precisión-eficiencia entre los modelos de embeddings multimodales de Jina para despliegue en servidor, y sus embeddings de 1024 dimensiones ofrecen más poder discriminatorio que la variante omni-nano de 768 dimensiones.

Guía

Seleccione el adaptador LoRA apropiado: retrieval, text-matching, clustering o classification. Para entradas multimodales vía la API, pase directamente URLs de imágenes, URLs de archivos de audio, URLs de archivos de video o URLs de PDF — el modelo enruta cada modalidad a través del encoder apropiado. Los formatos de audio soportados incluyen WAV, MP3, FLAC, OGG, M4A y Opus. Las entradas de video se procesan como 32 frames muestreados uniformemente. Mezcle modalidades libremente dentro de un solo batch: el espacio de embedding se comparte entre todas las modalidades. Use similitud coseno para la comparación. El recorte Matryoshka de 1024 a 32 dimensiones está soportado. Los embeddings solo de texto son compatibles drop-in con jina-embeddings-v5-text-small — no se necesita reindexación al actualizar. Para despliegues en edge sin GPU, use en su lugar jina-embeddings-v5-omni-nano.

Blogs que mencionan este modelo
mayo 12, 2026 • 7 minutos de lectura
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
Idioma / tema actual
Search Foundation
Reader
Embeddings
Reranker
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y su contenido, software, productos y servicios asociados están destinados exclusivamente a un uso profesional. El uso por parte de consumidores no está previsto ni dirigido.