Descripción general
jina-embeddings-v5-omni-small es un modelo de embeddings multimodal de ~1,74B parámetros que acepta texto, imágenes, video, audio y PDF, produciendo embeddings en un espacio vectorial compartido de 1024 dimensiones. Es el modelo de embeddings predeterminado de la API de Jina y ofrece el mejor equilibrio de precisión-eficiencia entre los modelos de embeddings multimodales de Jina. Las salidas solo de texto son bit-idénticas a jina-embeddings-v5-text-small, lo que permite una migración sin fisuras de solo texto a multimodal sin reindexación.
Métodos
El modelo se entrena en una tercera etapa que extiende jina-embeddings-v5-text-small. Durante el entrenamiento multimodal, el backbone de texto Qwen3-0,6B-Base y los cuatro adaptadores LoRA específicos de tarea se congelan; solo los proyectores intermodales se entrenan de nuevo. Un vision encoder SigLIP2 Large maneja imágenes y video (32 frames muestreados uniformemente por video). Un audio encoder Whisper-large-v3 maneja la entrada de audio. Las páginas de PDF se renderizan como imágenes y se procesan a través de la vía visual. El entrenamiento usa una pérdida contrastiva con negativos duros intermodales para alinear las representaciones visuales y de audio con el espacio de embedding de texto existente. La salida de 1024 dimensiones soporta recorte Matryoshka hasta 32 dimensiones. La ventana de contexto de 32K tokens cubre la entrada de texto. El modelo soporta inferencia cuantizada y MLX para Apple Silicon.
Rendimiento
El rendimiento solo de texto es bit-identico a jina-embeddings-v5-text-small (67,0 promedio MMTEB de nivel de tarea, 71,7 MTEB en inglés) — el backbone de texto y los adaptadores LoRA permanecen intactos durante el entrenamiento multimodal. En recuperación intermodal, el modelo demuestra una fuerte alineación en tareas de texto-imagen, texto-audio y texto-video. La recuperación de páginas de PDF se maneja a través de la vía visual. El modelo omni-small ofrece el mejor equilibrio de precisión-eficiencia entre los modelos de embeddings multimodales de Jina para despliegue en servidor, y sus embeddings de 1024 dimensiones ofrecen más poder discriminatorio que la variante omni-nano de 768 dimensiones.
Guía
Seleccione el adaptador LoRA apropiado: retrieval, text-matching, clustering o classification. Para entradas multimodales vía la API, pase directamente URLs de imágenes, URLs de archivos de audio, URLs de archivos de video o URLs de PDF — el modelo enruta cada modalidad a través del encoder apropiado. Los formatos de audio soportados incluyen WAV, MP3, FLAC, OGG, M4A y Opus. Las entradas de video se procesan como 32 frames muestreados uniformemente. Mezcle modalidades libremente dentro de un solo batch: el espacio de embedding se comparte entre todas las modalidades. Use similitud coseno para la comparación. El recorte Matryoshka de 1024 a 32 dimensiones está soportado. Los embeddings solo de texto son compatibles drop-in con jina-embeddings-v5-text-small — no se necesita reindexación al actualizar. Para despliegues en edge sin GPU, use en su lugar jina-embeddings-v5-omni-nano.



