Gráfico de E/S 1
Gráfico de E/S 2
Gráfico de E/S 3
Gráfico de E/S 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
RTEB public
64.08
Parameters
986M
Rank by score
21 / 62
Pareto front
Behind it
Distribución de valoreshelp_outlineAUC 0.8242
Corpus
Pares de traducción
Búsqueda documental
Código
Imagen / banner
Imagen / logotipo
Tarea
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
Relacionados20.2%
Negativo difícil1.7%
No relacionados1.1%
Umbrales recomendados
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
equilibrado · 0.678
AUC
0.8242
Techo de ruido
0.840
Caída de exhaustividad
0.557
Pares medidos
119 / 11k
Este modelo comparte su torre de texto con jina-embeddings-v5-text-nano. Las distribuciones que se muestran son las de ese modelo, con el que coincide hasta la precisión fp16 del transporte.
Componentes del vectorhelp_outline
σ 0.0361 · 183k valores
Geometría del embeddinghelp_outline
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.288
Dim. efectivas
69 / 768
Truncado de dimensioneshelp_outline
text-matching · Umbral según las dimensiones solicitadas
Pares de idiomashelp_outline
Dispersión del umbral entre pares: 0.027
Elige modelos para comparar
Publicaciones (1)
Descripción general
jina-embeddings-v5-omni-nano (~1.04B parámetros) es la variante compacta de la familia v5-omni, diseñada para hardware de borde y comercial. Extiende jina-embeddings-v5-text-nano con las mismas capacidades multimodales: entradas de texto, imágenes, vídeo y audio en un espacio vectorial compartido. Las salidas de solo texto son idénticas a jina-embeddings-v5-text-nano. El modelo produce incrustaciones de 768 dimensiones con truncamiento Matryoshka a 32 dimensiones y admite una longitud de contexto de token de 8K.
Métodos
Sigue el mismo entrenamiento de tercera etapa que omni-small, extendiendo jina-embeddings-v5-text-nano. La red troncal de texto EuroBERT-210M y los adaptadores LoRA están congelados. Los proyectores multimodales conectan un codificador de visión SigLIP2 Base y un codificador de audio Whisper-large-v3 a la red troncal de texto. Los datos y objetivos de entrenamiento son idénticos a los de omni-small.
Actuación
El rendimiento en texto plano es idéntico al de jina-embeddings-v5-text-nano. El rendimiento multimodal es ligeramente inferior al de omni-small debido al espacio de incrustación más reducido (768 frente a 1024 dimensiones) y a la estructura de texto más pequeña, pero mantiene una sólida alineación entre modos. Optimizado para CPU y hardware de borde donde el modelo omni-small, de mayor tamaño, no puede ejecutarse.
Guía
Mismo patrón de uso que omni-small con la misma selección de adaptador LoRA y manejo de entrada multimodal. Diferencias clave: espacio de salida de 768 dimensiones (truncamiento Matryoshka a 32) y ventana de contexto de 8K. La variante nano se ejecuta en hardware estándar sin aceleración por GPU. Las incrustaciones de solo texto son compatibles directamente con jina-embeddings-v5-text-nano.
Blogs que mencionan este modelo



