Descripción general
jina-embeddings-v5-omni-nano es un modelo de embeddings multimodal de ~1,04B parámetros que acepta texto, imágenes, video y audio, produciendo embeddings en un espacio vectorial compartido. Es la variante compacta de la familia v5-omni, diseñada para hardware edge y de consumo donde no hay GPU disponible. Las salidas solo de texto son bit-idénticas a jina-embeddings-v5-text-nano, lo que lo convierte en una mejora drop-in de solo texto a multimodal sin reindexación.
Métodos
El modelo extiende jina-embeddings-v5-text-nano con capacidades multimodales mediante una tercera etapa de entrenamiento. El backbone de texto EuroBERT-210M y los cuatro adaptadores LoRA específicos de tarea se congelan; solo los proyectores intermodales se entrenan de nuevo. Un vision encoder SigLIP2 Base maneja imágenes y video (32 frames muestreados uniformemente por video). Un audio encoder Whisper-large-v3 maneja la entrada de audio. Las páginas de PDF se renderizan como imágenes y se procesan a través de la vía visual. El entrenamiento usa una pérdida contrastiva con negativos duros intermodales para alinear las representaciones visuales y de audio con el espacio de embedding de texto existente. El espacio de salida de 768 dimensiones soporta recorte Matryoshka hasta 32 dimensiones. La ventana de contexto de 8K tokens cubre la entrada de texto; las entradas de imagen y audio se procesan a través de sus respectivos encoders.
Rendimiento
El rendimiento solo de texto es bit-identico a jina-embeddings-v5-text-nano (65,5 promedio MMTEB de nivel de tarea, 71,0 MTEB en inglés). El rendimiento multimodal está ligeramente por debajo de jina-embeddings-v5-omni-small debido al espacio de embedding de 768 dimensiones (frente a 1024) y al backbone de texto más pequeño, pero mantiene una fuerte alineación intermodal en la recuperación de texto-imagen, texto-audio y texto-video. El modelo está optimizado para CPU y hardware edge, donde el modelo omni-small más grande no puede ejecutarse de forma eficiente. La calidad de recuperación intermodal es competitiva para su clase de tamaño.
Guía
Mismo patrón de uso que jina-embeddings-v5-omni-small: Seleccione el adaptador LoRA apropiado (retrieval, text-matching, clustering, classification) y pase directamente URLs de imágenes, URLs de archivos de audio, URLs de archivos de video o URLs de PDF vía la API — el modelo enruta cada modalidad a través del encoder apropiado. Formatos de audio soportados: WAV, MP3, FLAC, OGG, M4A, Opus. Las entradas de video se procesan como 32 frames muestreados uniformemente. Mezcle modalidades libremente dentro de un solo batch; el espacio de embedding se comparte entre todas las modalidades. Use similitud coseno para la comparación. El recorte Matryoshka de 768 a 32 dimensiones está soportado. Los embeddings solo de texto son compatibles drop-in con jina-embeddings-v5-text-nano — no se necesita reindexación al actualizar. Para despliegues en servidor que requieren mayor precisión, use jina-embeddings-v5-omni-small (1024 dimensiones, backbone más grande).



