Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Embeddings
copyright CC BY-NC 4.0
open_in_new Article de lancement

jina-embeddings-v5-omni-small

Embeddings multimodales pour le texte, l'image, l'audio, la vidéo et le PDF
Licence
copyright CC-BY-NC-4.0
Date de sortie
calendar_month
2026-05-07
Saisie
abc
Texte
image
Image
audiotrack
Audio
videocam
Vidéo
picture_as_pdf
PDF
arrow_forward
Sortir
more_horiz
Vecteur
Dimensions Matryoshka help_outline
32
64
128
256
512
768
1024
Détails du modèle
Paramètres: 1.7B
Longueur du token d'entrée: 32K
Dimension de sortie: 1024
Modèle de base help_outline
link
jina-embeddings-v5-text-small
open_in_new
SigLIP2 Large
open_in_new
Whisper-large-v3
Langues enseignées help_outline
32 langues
Langues prises en charge help_outline
93 langues
Quantifications help_outline
GGUF
Prise en charge d'Apple Silicon help_outline
MLX
Modèles associés
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
Tâches prises en charge
search Récupération
compare_arrows Correspondance de texte
bubble_chart Clustering
label Classification
Disponible via
Elastic Inference Service
API Jina
AWS SageMaker
Hugging Face
Air-gapped
Graphique d'E/S 1

Texte

jina-embeddings-v5-omni-small

Image

Tâche

Vecteur

Graphique d'E/S 2

Texte

jina-embeddings-v5-omni-small

Audio

Tâche

Vecteur

Graphique d'E/S 3

Texte

jina-embeddings-v5-omni-small

Vidéo

Tâche

Vecteur

Graphique d'E/S 4

multiple

Vecteur

Texte

jina-embeddings-v5-omni-small

PDF

Tâche

Frontière de Paretohelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…Paramètres (log)score
Ce modèle
Sur la frontière
Jina AI
Autres
MAEB
49.96
Paramètres
1.6B
Rang par score
5 / 21
Frontière de Pareto
Sur elle
Distribution des valeurshelp_outline
AUC 0.8269
Corpus
Paires de traduction
Recherche documentaire
Code
Image / bannière
Image / logo
Tâche
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Liées10.9%
Négatif difficile2.1%
Non liées0.9%
Seuils recommandés
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
équilibré · 0.697
AUC
0.8269
Plafond de bruit
0.855
Décrochage du rappel
0.566
Paires mesurées
119 / 11k
Ce modèle partage sa tour texte avec jina-embeddings-v5-text-small. Les distributions présentées sont celles de ce modèle, qu'il rejoint à la précision fp16 du transport.
Composantes des vecteurshelp_outline
-0.160.010.18
σ 0.0313 · 244k valeurs
Géométrie des embeddingshelp_outline
01024
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.300
Dim. effectives
70 / 1024
Troncature des dimensionshelp_outline
32641282565121024
text-matching · Seuil selon les dimensions demandées
Paires de langueshelp_outline
de-ruen-deen-koen-zhja-ko
Écart du seuil entre les paires : 0.024
Choisissez les modèles à comparer
Publications (1)
SIGIR 2026
mai 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

Aperçu

jina-embeddings-v5-omni-small est un modèle d'embeddings multimodal d'environ 1,74B de paramètres qui accepte du texte, des images, de la vidéo, de l'audio et des PDF, produisant des embeddings dans un espace vectoriel partagé de 1024 dimensions. C'est le modèle d'embeddings par défaut de l'API Jina et il offre le meilleur compromis précision-efficacité parmi les modèles d'embeddings multimodaux de Jina. Les sorties texte seul sont bit-identiques à jina-embeddings-v5-text-small, permettant une migration fluide du texte seul au multimodal sans re-indexation.

Méthodes

Le modèle est entraîné dans une troisième étape qui étend jina-embeddings-v5-text-small. Pendant l'entraînement multimodal, le backbone texte Qwen3-0,6B-Base et les quatre adaptateurs LoRA spécifiques aux tâches sont figés ; seuls les projecteurs cross-modal sont nouvellement entraînés. Un vision encoder SigLIP2 Large traite les images et la vidéo (32 frames échantillonnés uniformément par vidéo). Un audio encoder Whisper-large-v3 traite l'entrée audio. Les pages PDF sont rendues en images et traitées via le chemin visuel. L'entraînement utilise une perte contrastive avec des négatifs durs cross-modal pour aligner les représentations visuelles et audio sur l'espace d'embedding de texte existant. La sortie de 1024 dimensions prend en charge la troncature Matryoshka jusqu'à 32 dimensions. La fenêtre de contexte de 32K tokens couvre l'entrée texte. Le modèle prend en charge l'inférence quantifiée et MLX pour Apple Silicon.

Performance

La performance texte seul est bit-identique à jina-embeddings-v5-text-small (67,0 de moyenne MMTEB au niveau tâche, 71,7 MTEB en anglais) — le backbone texte et les adaptateurs LoRA restent intacts pendant l'entraînement multimodal. En récupération cross-modal, le modèle démontre un fort alignement sur les tâches texte-image, texte-audio et texte-vidéo. La récupération de pages PDF est traitée via le chemin visuel. Le modèle omni-small offre le meilleur compromis précision-efficacité parmi les modèles d'embeddings multimodaux de Jina pour le déploiement serveur, ses embeddings de 1024 dimensions offrant plus de puissance discriminante que la variante omni-nano de 768 dimensions.

Conseils

Sélectionnez l'adaptateur LoRA approprié : retrieval, text-matching, clustering ou classification. Pour les entrées multimodales via l'API, passez directement des URL d'images, des URL de fichiers audio, des URL de fichiers vidéo ou des URL de PDF — le modèle achemine chaque modalité via l'encodeur approprié. Les formats audio pris en charge comprennent WAV, MP3, FLAC, OGG, M4A et Opus. Les entrées vidéo sont traitées comme 32 frames échantillonnés uniformément. Mélangez les modalités librement au sein d'un seul batch : l'espace d'embedding est partagé entre toutes les modalités. Utilisez la similarité cosinus pour la comparaison. La troncature Matryoshka de 1024 à 32 dimensions est prise en charge. Les embeddings texte seul sont compatibles drop-in avec jina-embeddings-v5-text-small — aucune re-indexation n'est nécessaire lors de la mise à niveau. Pour les déploiements edge sans GPU, utilisez plutôt jina-embeddings-v5-omni-nano.

Blogs qui mentionnent ce modèle
mai 12, 2026 • 7 minutes lues
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reclasseur
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.