Aperçu
jina-embeddings-v5-omni-small est un modèle d'embeddings multimodal d'environ 1,74B de paramètres qui accepte du texte, des images, de la vidéo, de l'audio et des PDF, produisant des embeddings dans un espace vectoriel partagé de 1024 dimensions. C'est le modèle d'embeddings par défaut de l'API Jina et il offre le meilleur compromis précision-efficacité parmi les modèles d'embeddings multimodaux de Jina. Les sorties texte seul sont bit-identiques à jina-embeddings-v5-text-small, permettant une migration fluide du texte seul au multimodal sans re-indexation.
Méthodes
Le modèle est entraîné dans une troisième étape qui étend jina-embeddings-v5-text-small. Pendant l'entraînement multimodal, le backbone texte Qwen3-0,6B-Base et les quatre adaptateurs LoRA spécifiques aux tâches sont figés ; seuls les projecteurs cross-modal sont nouvellement entraînés. Un vision encoder SigLIP2 Large traite les images et la vidéo (32 frames échantillonnés uniformément par vidéo). Un audio encoder Whisper-large-v3 traite l'entrée audio. Les pages PDF sont rendues en images et traitées via le chemin visuel. L'entraînement utilise une perte contrastive avec des négatifs durs cross-modal pour aligner les représentations visuelles et audio sur l'espace d'embedding de texte existant. La sortie de 1024 dimensions prend en charge la troncature Matryoshka jusqu'à 32 dimensions. La fenêtre de contexte de 32K tokens couvre l'entrée texte. Le modèle prend en charge l'inférence quantifiée et MLX pour Apple Silicon.
Performance
La performance texte seul est bit-identique à jina-embeddings-v5-text-small (67,0 de moyenne MMTEB au niveau tâche, 71,7 MTEB en anglais) — le backbone texte et les adaptateurs LoRA restent intacts pendant l'entraînement multimodal. En récupération cross-modal, le modèle démontre un fort alignement sur les tâches texte-image, texte-audio et texte-vidéo. La récupération de pages PDF est traitée via le chemin visuel. Le modèle omni-small offre le meilleur compromis précision-efficacité parmi les modèles d'embeddings multimodaux de Jina pour le déploiement serveur, ses embeddings de 1024 dimensions offrant plus de puissance discriminante que la variante omni-nano de 768 dimensions.
Conseils
Sélectionnez l'adaptateur LoRA approprié : retrieval, text-matching, clustering ou classification. Pour les entrées multimodales via l'API, passez directement des URL d'images, des URL de fichiers audio, des URL de fichiers vidéo ou des URL de PDF — le modèle achemine chaque modalité via l'encodeur approprié. Les formats audio pris en charge comprennent WAV, MP3, FLAC, OGG, M4A et Opus. Les entrées vidéo sont traitées comme 32 frames échantillonnés uniformément. Mélangez les modalités librement au sein d'un seul batch : l'espace d'embedding est partagé entre toutes les modalités. Utilisez la similarité cosinus pour la comparaison. La troncature Matryoshka de 1024 à 32 dimensions est prise en charge. Les embeddings texte seul sont compatibles drop-in avec jina-embeddings-v5-text-small — aucune re-indexation n'est nécessaire lors de la mise à niveau. Pour les déploiements edge sans GPU, utilisez plutôt jina-embeddings-v5-omni-nano.



