

Nous publions jina-embeddings-v5-text, la cinquième génération de notre famille de modèles de vecteurs, qui repousse les limites de la frontière qualité-efficacité pour les vecteurs multilingues de moins de 1 milliard de paramètres :
- jina-embeddings-v5-text-small (677 M paramètres) : 67,0 sur MMTEB, 71,7 sur MTEB English
- jina-embeddings-v5-text-nano (239 M paramètres) : 65,5 sur MMTEB, 71,0 sur MTEB English
Le petit modèle prend en charge un contexte de 32 000 词元 (8 000 pour la version nano), 4 adaptateurs LoRA spécifiques à la tâche (recherche, appariement de texte, classification, clustering), et la troncature de dimension Matryoshka de 1024 à 32. Avec 239 millions de paramètres, le modèle nano égale la qualité de recherche de modèles deux fois plus grands.
Par rapport à nos générations précédentes : v5-text-small égale jina-embeddings-v4 (3,8 Mds) en recherche tout en étant 5,6 fois plus petit, et surpasse jina-embeddings-v3 (572 M) sur toutes les tâches avec un nombre de paramètres similaire.
| Caractéristique | v5-text-small | v5-text-nano |
|---|---|---|
| Modèle de base | Qwen3-0.6B-Base | EuroBERT-210m |
| Paramètres | 677 M | 239 M |
| Dimensions des vecteurs | 1024 | 768 |
| Longueur de contexte | 32 768 | 8 192 |
| Langues | 119 (tokéniseur Qwen3) | 15+ (tokéniseur EuroBERT) |
| Pooling | Last-token | Last-token |
| Adaptateurs LoRA | 4 (recherche, appariement, classification, clustering) | |
| Dimensions Matryoshka | 32-1024 | 32-768 |
| Score MMTEB | 67,0 | 65,5 |
| MTEB English | 71,7 | 71,0 |
| Licence | CC BY-NC 4.0 |
v5-text-small atteint 67,0 sur MMTEB (moyenne sur 131 tâches réparties en 9 types), surpassant le meilleur modèle suivant de moins de 1 Md de paramètres (Qwen3-0.6B avec instructions à 64,3) de +2,7 points. Le modèle nano à 239 M de paramètres obtient un score de 65,5, battant des modèles deux fois plus grands.v5-text-small est en tête de tous les modèles multilingues de moins de 1 Md de paramètres avec 71,7 (moyenne sur 41 tâches en 7 types), suivi de près par KaLM-mini-v2.5 (71,3) et v5-text-nano (71,0). Le modèle nano de 239 M de paramètres atteint la parité avec le modèle KaLM de 494 M pour moins de la moitié de sa taille.v5-text-small obtient la meilleure moyenne au niveau des tâches (63,28) sur cinq benchmarks de recherche (MTEB Multilingual, MTEB English, RTEB, BEIR et LongEmbed) parmi les modèles de moins de 4 Mds de paramètres, égalant jina-embeddings-v4 (3,8 Mds, 63,62) tout en étant 5,6 fois plus petit.
jina-embeddings-v5-small (0,6 Md de paramètres, rang n°8) est le modèle de vecteurs le plus puissant de moins de 1 Md de paramètres sur MTEB Multilingual v2, surpassant Qwen3-Embedding-0.6b sur chaque métrique. jina-embeddings-v5-nano (0,2 Md de paramètres, rang n°11) offre des performances de top-11 pour une fraction de la taille ; aucun autre modèle dans cette classe de paramètres ne s'en approche.tagArchitecture

v5-text utilise des backbones « decoder-only » avec un pooling sur le dernier 词元 (last-token pooling) au lieu d'un pooling moyen. Quatre adaptateurs LoRA légers sont injectés à chaque couche transformer, gérant indépendamment la recherche, l'appariement de texte, la classification et le clustering. Les utilisateurs sélectionnent l'adaptateur approprié au moment de l'inférence. Pour la recherche, les requêtes reçoivent un préfixe "Query:" et les documents "Document:". La longueur de contexte est de 32 000 词元 pour le modèle small (8 000 pour le nano), soit une augmentation de 4x par rapport à la v3.
tagPour commencer
tagService d'inférence Elastic
Le moyen le plus rapide d'utiliser v5-text en production. Elastic Inference Service (EIS) fournit une inférence de vecteurs gérée avec mise à l'échelle intégrée, afin que vous puissiez générer des vecteurs directement dans votre déploiement Elastic sans gérer l'infrastructure.
PUT _inference/text_embedding/jina-v5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-embeddings-v5-text-small"
}
}
Consultez la documentation EIS pour les détails de configuration.
tagAPI de vecteurs Jina
Notre API hébergée avec une tarification au 词元. Prend en charge la sélection de tâches, la troncature de dimension et le traitement par lots dès la sortie de boîte. Aucun GPU requis.
curl https://api.jina.ai/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "jina-embeddings-v5-text-small",
"task": "retrieval.query",
"dimensions": 1024,
"input": ["What is knowledge distillation?"]
}'
Obtenez une clé API sur jina.ai/embeddings.
tagHugging Face + sentence-transformers
Exécutez localement avec un contrôle total sur l'inférence. Les poids sont disponibles sur Hugging Face avec une intégration prête à l'emploi de sentence-transformers.
from sentence_transformers import SentenceTransformer
import torch
model = SentenceTransformer(
"jinaai/jina-embeddings-v5-text-small-retrieval",
model_kwargs={"dtype": torch.bfloat16},
)
query_emb = model.encode("What is knowledge distillation?", prompt_name="query")
doc_embs = model.encode(["Knowledge distillation transfers...", "Venus is..."], prompt_name="document")
similarity = model.similarity(query_emb, doc_embs)
tagvLLM
Service à haut débit pour les charges de travail en production. vLLM prend en charge v5-text nativement avec le pooling du dernier词元 (last-token pooling).
from vllm import LLM
from vllm.config.pooler import PoolerConfig
model = LLM(
model="jinaai/jina-embeddings-v5-text-small-retrieval",
dtype="float16",
runner="pooling",
pooler_config=PoolerConfig(seq_pooling_type="LAST", normalize=True),
)
outputs = model.encode(["Query: climate change impacts"], pooling_task="embed")
Pour une inférence locale optimisée via llama.cpp et MLX, les poids LoRA de chaque adaptateur de tâche sont fusionnés dans le modèle de base pour produire des fichiers de poids autonomes. C'est pourquoi vous voyez des dépôts séparés par tâche (retrieval, text-matching, classification, clustering) : chacun contient les poids fusionnés complets prêts à être chargés directement, sans surcoût LoRA au moment de l'inférence.
tagllama.cpp (GGUF)
Exécutez des modèles quantifiés sur CPU ou sur des appareils de périphérie (edge devices). Nous fournissons 14 variantes de quantification GGUF pour chaque modèle, allant de F16 à IQ1_S.
llama-server -hf jinaai/jina-embeddings-v5-text-small-retrieval-GGUF:Q4_K_M \
--embedding --pooling last -ub 32768
tagMLX
Inférence native sur Apple Silicon via MLX. Disponible en pleine précision, ainsi qu'en quantification 4 bits et 8 bits pour tous les adaptateurs de tâches.
import mlx.core as mx
from tokenizers import Tokenizer
from model import JinaEmbeddingModel
import json
with open("config.json") as f:
config = json.load(f)
model = JinaEmbeddingModel(config)
weights = mx.load("model-4bit.safetensors") # ou model.safetensors, model-8bit.safetensors
model.load_weights(list(weights.items()))
tokenizer = Tokenizer.from_file("tokenizer.json")
texts = ["Query: What is machine learning?"]
embeddings = model.encode(texts, tokenizer)
Téléchargez depuis Hugging Face : jinaai/jina-embeddings-v5-text-small-retrieval-mlx (également disponible pour les adaptateurs de text-matching, classification et clustering).
tagEntraînement
Les deux modèles sont distillés à partir de Qwen3-Embedding-4B, un modèle de 向量模型 (Embeddings) entraîné beaucoup plus grand. La variante « small » utilise Qwen3-0.6B-Base comme colonne vertébrale, tandis que la variante « nano » utilise EuroBERT-210m. Notre entraînement combine deux signaux complémentaires :
- Distillation de 向量模型 (Embeddings) depuis le modèle enseignant 4B via une perte par similarité cosinus. L'étudiant apprend à approximer l'espace des 向量模型 (Embeddings) de l'enseignant sans nécessiter de 提示词 (Prompt) de type instruction. Cela est particulièrement efficace pour les langues et les tâches où les données étiquetées sont rares.
- Perte contrastive spécifique à la tâche (
InfoNCE) sur des paires requête-document étiquetées avec un minage de négatifs difficiles (hard negative mining) et des négatifs au sein des lots (in-batch negatives). Après avoir gelé la colonne vertébrale distillée, nous entraînons des adaptateurs LoRA séparés pour chaque catégorie de tâche.
Nos études d'ablation montrent que cette approche combinée surpasse systématiquement chaque méthode prise isolément. Sur le benchmark MTEB English retrieval, la méthode combinée atteint 60,1 nDCG@10, contre 58,6 pour la distillation seule et 54,3 pour la méthode contrastive seule sur la même base.
Nous appliquons également la GOR (Generalized Orthogonal Regularization) pendant l'entraînement, ce qui encourage les composantes des 向量模型 (Embeddings) à être réparties de manière plus uniforme. Cela n'améliore pas radicalement les scores des benchmarks standard, mais rend la quantification binaire presque sans perte, une propriété cruciale pour le déploiement sur des systèmes aux ressources mémoire limitées.
Quelques observations issues de l'entraînement méritent d'être notées :
- La distillation et l'apprentissage contrastif sont complémentaires d'une manière que nous n'avions pas prévue initialement.
- La suppression de n'importe quel composant de notre mélange de pertes dégrade les performances sur toute la ligne.
- Les adaptateurs LoRA spécifiques à la tâche surpassent l'entraînement multi-tâches pour un surcoût en paramètres négligeable.
- La régularisation GOR rend la quantification binaire presque sans perte, ce qui compte davantage pour le déploiement que les gains marginaux en pleine précision.
tagConclusion
Les modèles de 向量模型 (Embeddings) sont de plus en plus utilisés comme composants de chaîne d'outils au sein de systèmes plus vastes. Les agents 大模型 (LLM) appellent des API de 向量模型 (Embeddings) pour la recherche (retrieval), la mémoire et la classification dans le cadre de flux de travail agentiques. Des projets comme OpenClaw et OpenViking traitent les 向量模型 (Embeddings) comme une couche d'infrastructure centrale pour la gestion du contexte des agents, et non comme des points de terminaison de recherche isolés. Dans ce cadre, le coût d'inférence et la latence par appel importent tout autant que les scores de benchmark, et les modèles compacts deviennent le choix naturel.
La tendance vers des modèles de 向量模型 (Embeddings) plus petits reflète un changement plus large. La recherche sur appareil (on-device), la recherche basée sur le navigateur et le déploiement en périphérie exigent tous des modèles qui tiennent dans des contraintes de mémoire limitées. La prise en charge des dimensions Matryoshka permet à un seul modèle de servir à la fois pour la recherche haute précision et la recherche approximative ultra-rapide sans réentraînement. Associé à la quantification GGUF jusqu'à 1-2 bits, l'empreinte mémoire effective pour un service de 向量模型 (Embeddings) en production diminue d'un ordre de grandeur.
Nous travaillons sur jina-embeddings-v5-multimodal, étendant la même architecture à la vision et à la recherche intermodale. Les premiers résultats suggèrent qu'il est possible d'aligner un encodeur de vision avec un modèle de 向量模型 (Embeddings) de texte finement ajusté sans dégrader les performances textuelles. Restez à l'écoute.






