Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Architecture
Mise en route
Entraînement
Conclusion
star
Mis en exergue
communiqué de presse
mai 12, 2026

jina-embeddings-v5-omni : Modèles vectoriels pour le texte, l'image, l'audio et la vidéo

Un modèle, quatre modalités : texte, image, audio, vidéo. Des modèles d'embeddings omni de premier ordre en 1,6B et 0,9B.
Han Xiao
Han Xiao • 7 minutes lues
jina-embeddings-v5-omni - a jinaai Collection
Modèles de vecteurs multimodaux (texte + image + vidéo + audio) alignés avec jina-embeddings-v5-text-*. Deux tailles, quatre variantes de tâches chacune.
a jinaai Collection
jina-embeddings-v5-omni: Text-Geometry-Preserving Multimodal Embeddings via Frozen-Tower Composition
Dans ce travail, nous introduisons la composition de modèles à encodeur figé, une nouvelle approche pour les modèles de vecteurs multimodaux. Nous nous appuyons sur l'architecture de type VLM, où les encodeurs non textuels sont adaptés pour produire des entrées pour un grand modèle (LLM), qui à son tour génère des vecteurs pour tous types d'entrées. Nous présentons le résultat : la suite jina-embeddings-v5-omni, une paire de modèles qui encodent les entrées texte, image, audio et vidéo dans un espace vectoriel sémantique unique. Notre méthode consiste à étendre les deux modèles Jina Embeddings v5 Text pour prendre en charge des médias supplémentaires en ajoutant des encodeurs pour les images et l'audio. Les modèles de vecteurs textuels de base et les encodeurs de médias non textuels ajoutés restent figés. Nous n'avons entraîné que les composants de connexion, représentant 0,35 % du poids total du modèle conjoint. L'entraînement est donc beaucoup plus efficace qu'un réentraînement complet des paramètres. De plus, le grand modèle reste pratiquement inchangé, produisant exactement les mêmes vecteurs pour les entrées textuelles que les modèles Jina Embeddings v5 Text. Nos évaluations montrent que cette approche produit des résultats compétitifs par rapport à l'état de l'art, offrant des performances presque égales à celles de modèles de vecteurs multimodaux plus grands.
arXiv.orgFlorian Hönicke

Nous lançons jina-embeddings-v5-omni, étendant nos modèles de vecteurs v5-text aux images, à l'audio et à la vidéo. Les deux modèles partagent la même base textuelle figée que v5-text, ce qui signifie que les vecteurs textuels sont identiques - aucune reconstruction d'index n'est nécessaire. jina-embeddings-v5-omni-small obtient un score moyen de 53,93 sur quatre modalités, égalant LCO-7B (54,43) avec 5,7 fois moins de paramètres, tandis que jina-embeddings-v5-omni-nano offre une recherche de documents compétitive avec seulement 0,95 milliard de paramètres.

Frontière de Pareto
Frontière de Pareto de tous les modèles de vecteurs omni à poids ouverts (prenant en charge le texte, l'image, l'audio et la vidéo). jina-embeddings-v5-omni-small (1,57 Md) égale le score moyen de LCO-7B (8,93 Md) tout en utilisant 5,7 fois moins de paramètres. jina-embeddings-v5-omni-nano (0,95 Md) surpasse LanguageBind (1,14 Md) de +8,9 points. Références : LanguageBind, Omni-Embed-Nemotron-3B, LCO-Embedding-Omni-3B, LCO-Embedding-Omni-7B.
Scores par modalité
Ventilation par modalité sur Texte (MMTEB), Image (MIEB), Vidéo (MMEB-Video) et Audio (MAEB). jina-embeddings-v5-omni-small mène tous les modèles omni sur le texte avec 67,0, héritant de la qualité totale de jina-embeddings-v5-text-small. Sur l'image (56,05), il excelle dans la classification (68,55) et le regroupement (84,57, meilleur parmi tous les modèles). L'audio (51,46) est proche de LCO-7B (52,37), avec le meilleur score de classification audio (55,89). La vidéo (41,20) représente l'écart actuel par rapport à LCO-7B (47,41), car le raisonnement temporel bénéficie davantage de l'entraînement de bout en bout.
Répartition des tâches
Performance par tâche sur 13 types de tâches. Les étoiles dorées marquent les tâches où jina-embeddings-v5-omni-small bat la meilleure référence à poids ouverts (3 à 9 fois plus grande). Victoires : classification d'images (68,55 contre 64,30), regroupement d'images (84,57 contre 83,24), classification audio (55,89 contre 53,39). Écarts principaux : recherche vidéo (27,82 contre 58,73) et composition/VQA (44,23 contre 53,40).
Recherche de documents
Recherche de documents (ViDoRe-in-MIEB). jina-embeddings-v5-omni-small avec 0,92 milliard de paramètres actifs texte+image obtient 79,08, surpassant LCO-3B (78,24 avec 4,07 milliards). jina-embeddings-v5-omni-nano obtient 70,05 avec seulement 0,31 milliard de paramètres actifs, bien au-dessus de LanguageBind (37,33). Nemotron-3B est en tête avec 85,64 mais utilise 5,1 fois plus de paramètres.

tagArchitecture

v5-omni maintient la base v5-text complètement figée et ajoute des encodeurs de vision et audio pré-entraînés, connectés par de petits projecteurs entraînables :

  • Vision : Encodeurs de vision Qwen3.5 (adaptés de SigLIP2) avec fusion spatiale 2x2 (réduction de 4x des 词元). Nous figeons tout, sauf la dernière couche de projection (fc_vision_2), que nous remplaçons par une couche initialisée aléatoirement mappant vers la dimension cachée de la base textuelle.
  • Audio : Encodeur Qwen2.5-Omni (adapté de Whisper-large-v3). Une seule couche fc_audio initialisée aléatoirement projette la sortie en 1280 dimensions vers la base textuelle.
  • Vidéo : Traitée comme une séquence d'images visuelles, précédée optionnellement d'un segment audio extrait.

Le modèle hérite des quatre adaptateurs LoRA spécifiques aux tâches de v5-text (recherche, correspondance de texte, classification, regroupement) et entraîne des poids de projecteur distincts pour chaque variante de tâche. L'architecture est entièrement modulaire : le déploiement texte seul ne charge aucun poids de vision ou audio (empreinte identique à v5-text), l'image seule saute l'audio, et l'omni complet charge tout.

Architecture
Architecture v5-omni. Les encodeurs de vision et audio figés alimentent des projecteurs entraînables vers la base textuelle figée. Seuls les projecteurs (0,35 % du poids total) sont entraînés. Les adaptateurs LoRA spécifiques aux tâches gèrent la recherche, la classification, le regroupement et la correspondance de texte.
Fonctionnalitéjina-embeddings-v5-omni-smalljina-embeddings-v5-omni-nano
Modèle textuel de basejina-embeddings-v5-text-small (Qwen3-0.6B)jina-embeddings-v5-text-nano (EuroBERT-210m)
Paramètres totaux~1,56 Md~1,04 Md
ModalitésTexte, Image, Audio, Vidéo, PDFTexte, Image, Audio, Vidéo, PDF
Dimensions des vecteurs1024768
Dimensions Matryoshka32, 64, 128, 256, 512, 768, 102432, 64, 128, 256, 512, 768
Longueur de séquence max.32768 词元8192 词元
Encodeur de visionQwen3.5-2B ViT (SigLIP2)SigLIP2 Base
Encodeur audioWhisper-large-v3Whisper-large-v3
Tâchesrecherche, correspondance de texte, classification, regroupementrecherche, correspondance de texte, classification, regroupement
Compatibilité texteIdentique à jina-embeddings-v5-text-smallIdentique à jina-embeddings-v5-text-nano
Paramètres entraînables~18M projecteurs (0,35 %)~7M projecteurs (0,35 %)
PoolingLast-tokenLast-token
LicenceCC BY-NC 4.0CC BY-NC 4.0

tagMise en route

tagElasticsearch (Elastic Inference Service)

Si vous utilisez déjà jina-embeddings-v5-text dans Elasticsearch, vos index textuels existants fonctionnent avec v5-omni sans aucune modification. Les modèles omni produisent des embeddings identiques pour les entrées textuelles par rapport à v5-text — même entrée, même vecteur, octet pour octet. Vous n'avez pas besoin de ré-encoder ou de reconstruire un quelconque index textuel. Pour commencer à effectuer des recherches sur des images, de l'audio et de la vidéo parallèlement à vos données textuelles existantes, créez simplement un nouvel index avec v5-omni et ingérez-y votre contenu multimodal.

Créez un index semantic_text avec v5-omni comme point de terminaison d'inférence. EIS sélectionne automatiquement l'adaptateur LoRA correct pour l'indexation et la récupération :

PUT multimodal-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-omni-small"
      }
    }
  }
}

Ingérez du texte, des images (sous forme d'URI de données base64), de l'audio et de la vidéo dans le même champ, au sein du même index :

// Ingestion de texte
POST multimodal-semantic-index/_doc
{
  "content": "'Kraft Dinner' est le nom que les Canadiens donnent aux macaronis au fromage préparés à partir d'un kit."
}

// Ingestion d'une image (base64)
POST multimodal-semantic-index/_doc
{
  "content": "data:image/png;base64,iVBORw0KGgoAAAAN..."
}

Recherchez à travers toutes les modalités avec une seule requête textuelle :

GET multimodal-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "Was bedeutet 'Kraft Dinner' für Kanadier?"
    }
  }
}

tagJina Embedding API

curl https://api.jina.ai/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "jina-embeddings-v5-omni-small",
    "task": "retrieval.query",
    "dimensions": 1024,
    "input": ["What does this image show?"],
    "images": ["data:image/png;base64,..."]
  }'

tagHugging Face

from sentence_transformers import SentenceTransformer
import torch

model = SentenceTransformer(
    "jinaai/jina-embeddings-v5-omni-small-retrieval",
    model_kwargs={"dtype": torch.bfloat16},
)

# Embedding textuel (identique à v5-text)
text_emb = model.encode("What is knowledge distillation?", prompt_name="query")

# Embedding d'image
from PIL import Image
img = Image.open("photo.jpg")
img_emb = model.encode(img)

# Similarité intermodale
similarity = model.similarity(text_emb, img_emb)

tagEntraînement

L'idée centrale est la composition de modèles à encodeur gelé : prendre un modèle d'embedding textuel puissant, ajouter des encodeurs vision et audio pré-entraînés, les connecter avec de petits projecteurs entraînables, et tout geler à l'exception de ces projecteurs. Seuls 0,35 % des poids totaux sont entraînés, ce qui nous confère trois propriétés : (1) préservation de l'identité textuelle — le backbone est inchangé, la même entrée produit la même sortie ; (2) efficacité de l'entraînement — l'entraînement uniquement des projecteurs est 1,8 à 3,9 fois plus rapide avec 42 à 64 % de mémoire GPU en moins ; (3) modularité — les tours peuvent être chargées indépendamment.

Efficacité de l'entraînement
Entraînement uniquement des projecteurs vs entraînement complet sur 4 GPU H100 (taille de lot 256, 15 000 étapes). L'entraînement du projecteur audio est particulièrement efficace : 3,2 fois plus rapide pour le modèle small (154 min vs 497 min) et 3,9 fois plus rapide pour le modèle nano (112 min vs 441 min). Les économies de mémoire de 42 à 64 % proviennent du fait de ne pas stocker les gradients et les états de l'optimiseur pour les encodeurs gelés.

v5-omni hérite du support des dimensions Matryoshka de v5-text. Les embeddings d'images et audio préservent l'essentiel de leur qualité après troncature, tandis que la vidéo se dégrade davantage avec de petites dimensions.

Résumé radar
Résumé : profil par modalité de v5-omni par rapport aux meilleures références. jina-embeddings-v5-omni-small à 1,57B couvre le texte, l'image et l'audio de manière compétitive, la vidéo restant l'écart à combler.

tagConclusion

La sagesse conventionnelle veut que les embeddings multimodaux nécessitent l'entraînement de l'ensemble du modèle de bout en bout. Nous ne sommes pas d'accord. v5-omni gèle le backbone textuel, entraîne 0,35 % des poids et égale des modèles 5 à 7 fois plus gros que lui. La leçon : la composition surpasse le ré-entraînement. Un encodeur textuel puissant est la partie la plus difficile — une fois que vous l'avez, ajouter la vision et l'audio via des projecteurs légers est presque gratuit.

Ceci est important pour la production. Vos index v5-text existants ne sont pas touchés. Même requête, même vecteur, octet pour octet. Vous venez de gagner la recherche d'images, d'audio et de vidéo sans avoir à ré-encoder un seul document. C'est là la véritable avancée : la récupération multimodale comme mise à niveau intégrable, et non comme un projet de migration.

jina-embeddings-v5-omni-small est le modèle d'embedding omni à poids ouverts le plus performant sous la barre des 2 milliards de paramètres. jina-embeddings-v5-omni-nano y parvient avec 0,9 milliard. Tous deux sont disponibles dès maintenant sur Hugging Face, Jina Search Foundation API, et en tant que point de terminaison d'inférence natif dans Elasticsearch.

Catégories:
star
Mis en exergue
communiqué de presse
rss_feed

En savoir plus
août 03, 2026 • 11 minutes lues
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
février 19, 2026 • 7 minutes lues
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
décembre 04, 2025 • 7 minutes lues
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.