Graphique d'E/S 1
Graphique d'E/S 2
Graphique d'E/S 3
Graphique d'E/S 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
Distribution des valeurshelp_outlineAUC 0.8269
Corpus
Paires de traduction
Recherche documentaire
Code
Image / bannière
Image / logo
Tâche
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
Liées10.9%
Négatif difficile2.1%
Non liées0.9%
Seuils recommandés
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
équilibré · 0.697
AUC
0.8269
Plafond de bruit
0.855
Décrochage du rappel
0.566
Paires mesurées
119 / 11k
Ce modèle partage sa tour texte avec jina-embeddings-v5-text-small. Les distributions présentées sont celles de ce modèle, qu'il rejoint à la précision fp16 du transport.
Composantes des vecteurshelp_outline
σ 0.0313 · 244k valeurs
Géométrie des embeddingshelp_outline
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.300
Dim. effectives
70 / 1024
Troncature des dimensionshelp_outline
text-matching · Seuil selon les dimensions demandées
Paires de langueshelp_outline
Écart du seuil entre les paires : 0.024
Choisissez les modèles à comparer
Publications (1)
Aperçu
jina-embeddings-v5-omni-small (~1,74 milliard de paramètres) est un modèle d'embeddings multimodal qui accepte le texte, les images, la vidéo et l'audio et produit des embeddings dans un espace vectoriel partagé, aligné avec jina-embeddings-v5-text-small. Vous pouvez indexer avec du texte et interroger avec n'importe quelle modalité, ou inversement, sans réindexation. Le modèle de base pour le texte et les quatre adaptateurs LoRA spécifiques à la tâche (recherche, correspondance de texte, clustering, classification) sont figés pendant l'entraînement multimodal ; les sorties textuelles sont donc identiques, bit à bit, à celles de jina-embeddings-v5-text-small. Le modèle produit des embeddings de dimension 1024 avec une troncature Matryoshka à 32 dimensions et prend en charge une longueur de contexte de token de 32 000.
Méthodes
Entraîné en trois étapes, ce modèle étend jina-embeddings-v5-text-small. La structure de base du texte et les quatre adaptateurs LoRA spécifiques à la tâche sont figés ; seuls les projecteurs intermodaux sont nouvellement entraînés. Un encodeur visuel SigLIP2 So400m gère les images et la vidéo (32 images échantillonnées uniformément). Un encodeur audio Whisper-large-v3 gère l'entrée audio. Les pages PDF sont rendues sous forme d'images et traitées par le chemin visuel. L'entraînement utilise une perte contrastive avec des négatifs durs intermodaux pour aligner les représentations visuelles et audio avec l'espace d'intégration du texte existant.
Performance
Les performances en mode texte seul sont identiques à celles de jina-embeddings-v5-text-small : la structure de base du texte et les adaptateurs LoRA restent inchangés lors de l'entraînement multimodal. En recherche intermodale, le modèle présente une excellente concordance entre les tâches texte-image, texte-audio et texte-vidéo. La récupération des pages PDF est gérée par le traitement visuel. Le modèle omni-small offre le meilleur compromis précision-efficacité parmi les modèles d'intégration multimodale Jina pour un déploiement sur serveur.
Conseils
Les quatre mêmes adaptateurs LoRA que v5-text-small sont utilisés : recherche, correspondance de texte, clustering et classification. Pour les entrées multimodales via l'API, transmettez directement les URL d'images, de fichiers audio, de fichiers vidéo ou de PDF ; le modèle achemine chaque modalité vers l'encodeur approprié. Les formats audio pris en charge incluent WAV, MP3, FLAC, OGG, M4A et Opus. Les entrées vidéo sont traitées comme 32 images échantillonnées uniformément. Combinez librement les modalités au sein d'un même lot : l'espace d'embeddings est partagé entre toutes les modalités. Utilisez la similarité cosinus pour la comparaison. La troncature Matryoshka de 1024 à 32 dimensions est prise en charge. Les embeddings purement textuels sont directement compatibles avec jina-embeddings-v5-text-small ; aucune réindexation n'est nécessaire lors de la mise à niveau.
Blogs qui mentionnent ce modèle



