Gráfico de E/S 1
Gráfico de E/S 2
Gráfico de E/S 3
Gráfico de E/S 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
Distribución de valoreshelp_outlineAUC 0.8269
Corpus
Pares de traducción
Búsqueda documental
Código
Imagen / banner
Imagen / logotipo
Tarea
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
Relacionados10.9%
Negativo difícil2.1%
No relacionados0.9%
Umbrales recomendados
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
equilibrado · 0.697
AUC
0.8269
Techo de ruido
0.855
Caída de exhaustividad
0.566
Pares medidos
119 / 11k
Este modelo comparte su torre de texto con jina-embeddings-v5-text-small. Las distribuciones que se muestran son las de ese modelo, con el que coincide hasta la precisión fp16 del transporte.
Componentes del vectorhelp_outline
σ 0.0313 · 244k valores
Geometría del embeddinghelp_outline
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.300
Dim. efectivas
70 / 1024
Truncado de dimensioneshelp_outline
text-matching · Umbral según las dimensiones solicitadas
Pares de idiomashelp_outline
Dispersión del umbral entre pares: 0.024
Elige modelos para comparar
Publicaciones (1)
Descripción general
jina-embeddings-v5-omni-small (~1.74B parámetros) es un modelo de incrustación multimodal que acepta texto, imágenes, video y audio, y produce incrustaciones en un espacio vectorial compartido alineado con jina-embeddings-v5-text-small. Puede indexar con texto y consultar con cualquier modalidad, o viceversa, sin reindexar. La estructura de texto y los cuatro adaptadores LoRA específicos para cada tarea (recuperación, coincidencia de texto, agrupamiento, clasificación) se congelan durante el entrenamiento multimodal, por lo que las salidas solo de texto son idénticas a jina-embeddings-v5-text-small. El modelo produce incrustaciones de 1024 dimensiones con truncamiento Matryoshka a 32 dimensiones y admite una longitud de contexto de token de 32K.
Métodos
Entrenado en una tercera etapa que extiende jina-embeddings-v5-text-small. La estructura principal del texto y los cuatro adaptadores LoRA específicos para la tarea están congelados; solo los proyectores multimodales se entrenan de nuevo. Un codificador de visión SigLIP2 So400m maneja imágenes y vídeo (32 fotogramas muestreados uniformemente). Un codificador de audio Whisper-large-v3 maneja la entrada de audio. Las páginas PDF se renderizan como imágenes y se procesan a través de la vía visual. El entrenamiento utiliza pérdida contrastiva con negativos duros multimodales para alinear las representaciones visuales y de audio con el espacio de incrustación de texto existente.
Actuación
El rendimiento en texto plano es idéntico al de jina-embeddings-v5-text-small: la estructura de texto y los adaptadores LoRA permanecen sin cambios durante el entrenamiento multimodal. En la recuperación multimodal, el modelo demuestra una sólida alineación en tareas de texto-imagen, texto-audio y texto-vídeo. La recuperación de páginas PDF se gestiona mediante la vía visual. El modelo omni-small ofrece la mejor relación precisión-eficiencia entre los modelos de incrustación multimodal de Jina para su implementación en servidores.
Guía
Los mismos cuatro adaptadores LoRA que v5-text-small: recuperación, coincidencia de texto, agrupamiento y clasificación. Para entradas multimodales a través de la API, pase directamente URL de imágenes, URL de archivos de audio, URL de archivos de video o URL de PDF; el modelo enruta cada modalidad a través del codificador apropiado. Los formatos de audio compatibles incluyen WAV, MP3, FLAC, OGG, M4A y Opus. Las entradas de video se procesan como 32 fotogramas muestreados uniformemente. Mezcle modalidades libremente dentro de un solo lote: el espacio de incrustación se comparte entre todas las modalidades. Use la similitud del coseno para la comparación. Se admite la truncación Matryoshka de 1024 a 32 dimensiones. Las incrustaciones solo de texto son compatibles directamente con jina-embeddings-v5-text-small; no se necesita reindexar al actualizar.
Blogs que mencionan este modelo



