

Nous lançons jina-embeddings-v5-omni, étendant nos modèles de vecteurs v5-text aux images, à l'audio et à la vidéo. Les deux modèles partagent la même base textuelle figée que v5-text, ce qui signifie que les vecteurs textuels sont identiques - aucune reconstruction d'index n'est nécessaire. jina-embeddings-v5-omni-small obtient un score moyen de 53,93 sur quatre modalités, égalant LCO-7B (54,43) avec 5,7 fois moins de paramètres, tandis que jina-embeddings-v5-omni-nano offre une recherche de documents compétitive avec seulement 0,95 milliard de paramètres.




tagArchitecture
v5-omni maintient la base v5-text complètement figée et ajoute des encodeurs de vision et audio pré-entraînés, connectés par de petits projecteurs entraînables :
- Vision : Encodeurs de vision Qwen3.5 (adaptés de SigLIP2) avec fusion spatiale 2x2 (réduction de 4x des 词元). Nous figeons tout, sauf la dernière couche de projection (
fc_vision_2), que nous remplaçons par une couche initialisée aléatoirement mappant vers la dimension cachée de la base textuelle. - Audio : Encodeur Qwen2.5-Omni (adapté de Whisper-large-v3). Une seule couche
fc_audioinitialisée aléatoirement projette la sortie en 1280 dimensions vers la base textuelle. - Vidéo : Traitée comme une séquence d'images visuelles, précédée optionnellement d'un segment audio extrait.
Le modèle hérite des quatre adaptateurs LoRA spécifiques aux tâches de v5-text (recherche, correspondance de texte, classification, regroupement) et entraîne des poids de projecteur distincts pour chaque variante de tâche. L'architecture est entièrement modulaire : le déploiement texte seul ne charge aucun poids de vision ou audio (empreinte identique à v5-text), l'image seule saute l'audio, et l'omni complet charge tout.

| Fonctionnalité | jina-embeddings-v5-omni-small | jina-embeddings-v5-omni-nano |
|---|---|---|
| Modèle textuel de base | jina-embeddings-v5-text-small (Qwen3-0.6B) | jina-embeddings-v5-text-nano (EuroBERT-210m) |
| Paramètres totaux | ~1,56 Md | ~1,04 Md |
| Modalités | Texte, Image, Audio, Vidéo, PDF | Texte, Image, Audio, Vidéo, PDF |
| Dimensions des vecteurs | 1024 | 768 |
| Dimensions Matryoshka | 32, 64, 128, 256, 512, 768, 1024 | 32, 64, 128, 256, 512, 768 |
| Longueur de séquence max. | 32768 词元 | 8192 词元 |
| Encodeur de vision | Qwen3.5-2B ViT (SigLIP2) | SigLIP2 Base |
| Encodeur audio | Whisper-large-v3 | Whisper-large-v3 |
| Tâches | recherche, correspondance de texte, classification, regroupement | recherche, correspondance de texte, classification, regroupement |
| Compatibilité texte | Identique à jina-embeddings-v5-text-small | Identique à jina-embeddings-v5-text-nano |
| Paramètres entraînables | ~18M projecteurs (0,35 %) | ~7M projecteurs (0,35 %) |
| Pooling | Last-token | Last-token |
| Licence | CC BY-NC 4.0 | CC BY-NC 4.0 |
tagMise en route
tagElasticsearch (Elastic Inference Service)
Si vous utilisez déjà jina-embeddings-v5-text dans Elasticsearch, vos index textuels existants fonctionnent avec v5-omni sans aucune modification. Les modèles omni produisent des embeddings identiques pour les entrées textuelles par rapport à v5-text — même entrée, même vecteur, octet pour octet. Vous n'avez pas besoin de ré-encoder ou de reconstruire un quelconque index textuel. Pour commencer à effectuer des recherches sur des images, de l'audio et de la vidéo parallèlement à vos données textuelles existantes, créez simplement un nouvel index avec v5-omni et ingérez-y votre contenu multimodal.
Créez un index semantic_text avec v5-omni comme point de terminaison d'inférence. EIS sélectionne automatiquement l'adaptateur LoRA correct pour l'indexation et la récupération :
PUT multimodal-semantic-index
{
"mappings": {
"properties": {
"content": {
"type": "semantic_text",
"inference_id": ".jina-embeddings-v5-omni-small"
}
}
}
}Ingérez du texte, des images (sous forme d'URI de données base64), de l'audio et de la vidéo dans le même champ, au sein du même index :
// Ingestion de texte
POST multimodal-semantic-index/_doc
{
"content": "'Kraft Dinner' est le nom que les Canadiens donnent aux macaronis au fromage préparés à partir d'un kit."
}
// Ingestion d'une image (base64)
POST multimodal-semantic-index/_doc
{
"content": "data:image/png;base64,iVBORw0KGgoAAAAN..."
}Recherchez à travers toutes les modalités avec une seule requête textuelle :
GET multimodal-semantic-index/_search
{
"query": {
"semantic": {
"field": "content",
"query": "Was bedeutet 'Kraft Dinner' für Kanadier?"
}
}
}tagJina Embedding API
curl https://api.jina.ai/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "jina-embeddings-v5-omni-small",
"task": "retrieval.query",
"dimensions": 1024,
"input": ["What does this image show?"],
"images": ["data:image/png;base64,..."]
}'tagHugging Face
from sentence_transformers import SentenceTransformer
import torch
model = SentenceTransformer(
"jinaai/jina-embeddings-v5-omni-small-retrieval",
model_kwargs={"dtype": torch.bfloat16},
)
# Embedding textuel (identique à v5-text)
text_emb = model.encode("What is knowledge distillation?", prompt_name="query")
# Embedding d'image
from PIL import Image
img = Image.open("photo.jpg")
img_emb = model.encode(img)
# Similarité intermodale
similarity = model.similarity(text_emb, img_emb)tagEntraînement
L'idée centrale est la composition de modèles à encodeur gelé : prendre un modèle d'embedding textuel puissant, ajouter des encodeurs vision et audio pré-entraînés, les connecter avec de petits projecteurs entraînables, et tout geler à l'exception de ces projecteurs. Seuls 0,35 % des poids totaux sont entraînés, ce qui nous confère trois propriétés : (1) préservation de l'identité textuelle — le backbone est inchangé, la même entrée produit la même sortie ; (2) efficacité de l'entraînement — l'entraînement uniquement des projecteurs est 1,8 à 3,9 fois plus rapide avec 42 à 64 % de mémoire GPU en moins ; (3) modularité — les tours peuvent être chargées indépendamment.

v5-omni hérite du support des dimensions Matryoshka de v5-text. Les embeddings d'images et audio préservent l'essentiel de leur qualité après troncature, tandis que la vidéo se dégrade davantage avec de petites dimensions.

tagConclusion
La sagesse conventionnelle veut que les embeddings multimodaux nécessitent l'entraînement de l'ensemble du modèle de bout en bout. Nous ne sommes pas d'accord. v5-omni gèle le backbone textuel, entraîne 0,35 % des poids et égale des modèles 5 à 7 fois plus gros que lui. La leçon : la composition surpasse le ré-entraînement. Un encodeur textuel puissant est la partie la plus difficile — une fois que vous l'avez, ajouter la vision et l'audio via des projecteurs légers est presque gratuit.
Ceci est important pour la production. Vos index v5-text existants ne sont pas touchés. Même requête, même vecteur, octet pour octet. Vous venez de gagner la recherche d'images, d'audio et de vidéo sans avoir à ré-encoder un seul document. C'est là la véritable avancée : la récupération multimodale comme mise à niveau intégrable, et non comme un projet de migration.
jina-embeddings-v5-omni-small est le modèle d'embedding omni à poids ouverts le plus performant sous la barre des 2 milliards de paramètres. jina-embeddings-v5-omni-nano y parvient avec 0,9 milliard. Tous deux sont disponibles dès maintenant sur Hugging Face, Jina Search Foundation API, et en tant que point de terminaison d'inférence natif dans Elasticsearch.






