Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Architecture
Pour commencer
Entraînement
Conclusion
star
Mis en exergue
communiqué de presse
février 19, 2026

jina-embeddings-v5-text : Nouveaux Embeddings multilingues de petite taille SOTA

Deux modèles de plongements (embeddings) multilingues de moins de 1 milliard de paramètres offrant des performances de premier ordre, disponibles sur Elastic Inference Service, Llama.cpp et MLX.
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Han Xiao
Han Xiao • 7 minutes lues
jina-embeddings-v5-text: Distillation de vecteurs ciblée par tâche
Les modèles de vecteurs (Embeddings) sont largement utilisés pour les tâches de similarité sémantique, notamment la recherche d'informations, le clustering et la classification. Les modèles à usage général sont généralement entraînés via des processus à une ou plusieurs étapes utilisant des fonctions de perte contrastive. Nous introduisons un nouveau régime d'entraînement qui combine des techniques de distillation de modèles avec une perte contrastive spécifique à la tâche pour produire des modèles de vecteurs compacts et performants. Nos résultats suggèrent que cette approche est plus efficace pour entraîner des petits modèles (SLM) que les paradigmes d'entraînement purement contrastifs ou basés sur la distillation seuls. Les scores de référence pour les modèles résultants, jina-embeddings-v5-text-small et jina-embeddings-v5-text-nano, dépassent ou égalent l'état de l'art pour des modèles de taille similaire. Les modèles jina-embeddings-v5-text prennent en outre en charge les textes longs (jusqu'à 32 000词元 pour la version small, 8 000 pour la nano) dans de nombreuses langues, et génèrent des vecteurs qui restent robustes face à la troncature et à la quantification binaire. Les poids des modèles sont disponibles publiquement, dans l'espoir d'inspirer de nouvelles avancées dans le développement de modèles de vecteurs.
arXiv.orgMohammad Kalim Akram
jina-embeddings-v5-text - une collection jinaai
Nos vecteurs de 5e génération : deux modèles multilingues légers avec des performances de pointe (SOTA) en recherche, appariement, clustering et classification.
une collection jinaai

Nous publions jina-embeddings-v5-text, la cinquième génération de notre famille de modèles de vecteurs, qui repousse les limites de la frontière qualité-efficacité pour les vecteurs multilingues de moins de 1 milliard de paramètres :

  • jina-embeddings-v5-text-small (677 M paramètres) : 67,0 sur MMTEB, 71,7 sur MTEB English
  • jina-embeddings-v5-text-nano (239 M paramètres) : 65,5 sur MMTEB, 71,0 sur MTEB English

Le petit modèle prend en charge un contexte de 32 000 词元 (8 000 pour la version nano), 4 adaptateurs LoRA spécifiques à la tâche (recherche, appariement de texte, classification, clustering), et la troncature de dimension Matryoshka de 1024 à 32. Avec 239 millions de paramètres, le modèle nano égale la qualité de recherche de modèles deux fois plus grands.

Par rapport à nos générations précédentes : v5-text-small égale jina-embeddings-v4 (3,8 Mds) en recherche tout en étant 5,6 fois plus petit, et surpasse jina-embeddings-v3 (572 M) sur toutes les tâches avec un nombre de paramètres similaire.

Caractéristiquev5-text-smallv5-text-nano
Modèle de baseQwen3-0.6B-BaseEuroBERT-210m
Paramètres677 M239 M
Dimensions des vecteurs1024768
Longueur de contexte32 7688 192
Langues119 (tokéniseur Qwen3)15+ (tokéniseur EuroBERT)
PoolingLast-tokenLast-token
Adaptateurs LoRA4 (recherche, appariement, classification, clustering)
Dimensions Matryoshka32-102432-768
Score MMTEB67,065,5
MTEB English71,771,0
LicenceCC BY-NC 4.0
MMTEB Multilingual Benchmark
v5-text-small atteint 67,0 sur MMTEB (moyenne sur 131 tâches réparties en 9 types), surpassant le meilleur modèle suivant de moins de 1 Md de paramètres (Qwen3-0.6B avec instructions à 64,3) de +2,7 points. Le modèle nano à 239 M de paramètres obtient un score de 65,5, battant des modèles deux fois plus grands.
MTEB English Benchmark
Sur l'évaluation en anglais, v5-text-small est en tête de tous les modèles multilingues de moins de 1 Md de paramètres avec 71,7 (moyenne sur 41 tâches en 7 types), suivi de près par KaLM-mini-v2.5 (71,3) et v5-text-nano (71,0). Le modèle nano de 239 M de paramètres atteint la parité avec le modèle KaLM de 494 M pour moins de la moitié de sa taille.
Retrieval Benchmark Results
v5-text-small obtient la meilleure moyenne au niveau des tâches (63,28) sur cinq benchmarks de recherche (MTEB Multilingual, MTEB English, RTEB, BEIR et LongEmbed) parmi les modèles de moins de 4 Mds de paramètres, égalant jina-embeddings-v4 (3,8 Mds, 63,62) tout en étant 5,6 fois plus petit.
Table showing multilingual MTEB model performance metrics, rankings, and evaluations across various tasks and language benchm
Selon le classement MTEB au 21/02/2026, jina-embeddings-v5-small (0,6 Md de paramètres, rang n°8) est le modèle de vecteurs le plus puissant de moins de 1 Md de paramètres sur MTEB Multilingual v2, surpassant Qwen3-Embedding-0.6b sur chaque métrique. jina-embeddings-v5-nano (0,2 Md de paramètres, rang n°11) offre des performances de top-11 pour une fraction de la taille ; aucun autre modèle dans cette classe de paramètres ne s'en approche.

tagArchitecture

<code>jina-embeddings-v5-text</code> Architecture

v5-text utilise des backbones « decoder-only » avec un pooling sur le dernier 词元 (last-token pooling) au lieu d'un pooling moyen. Quatre adaptateurs LoRA légers sont injectés à chaque couche transformer, gérant indépendamment la recherche, l'appariement de texte, la classification et le clustering. Les utilisateurs sélectionnent l'adaptateur approprié au moment de l'inférence. Pour la recherche, les requêtes reçoivent un préfixe "Query:" et les documents "Document:". La longueur de contexte est de 32 000 词元 pour le modèle small (8 000 pour le nano), soit une augmentation de 4x par rapport à la v3.

tagPour commencer

tagService d'inférence Elastic

Le moyen le plus rapide d'utiliser v5-text en production. Elastic Inference Service (EIS) fournit une inférence de vecteurs gérée avec mise à l'échelle intégrée, afin que vous puissiez générer des vecteurs directement dans votre déploiement Elastic sans gérer l'infrastructure.

PUT _inference/text_embedding/jina-v5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-embeddings-v5-text-small"
  }
}

Consultez la documentation EIS pour les détails de configuration.

tagAPI de vecteurs Jina

Notre API hébergée avec une tarification au 词元. Prend en charge la sélection de tâches, la troncature de dimension et le traitement par lots dès la sortie de boîte. Aucun GPU requis.

curl https://api.jina.ai/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "jina-embeddings-v5-text-small",
    "task": "retrieval.query",
    "dimensions": 1024,
    "input": ["What is knowledge distillation?"]
  }'

Obtenez une clé API sur jina.ai/embeddings.

tagHugging Face + sentence-transformers

Exécutez localement avec un contrôle total sur l'inférence. Les poids sont disponibles sur Hugging Face avec une intégration prête à l'emploi de sentence-transformers.

from sentence_transformers import SentenceTransformer
import torch

model = SentenceTransformer(
    "jinaai/jina-embeddings-v5-text-small-retrieval",
    model_kwargs={"dtype": torch.bfloat16},
)

query_emb = model.encode("What is knowledge distillation?", prompt_name="query")
doc_embs = model.encode(["Knowledge distillation transfers...", "Venus is..."], prompt_name="document")
similarity = model.similarity(query_emb, doc_embs)

tagvLLM

Service à haut débit pour les charges de travail en production. vLLM prend en charge v5-text nativement avec le pooling du dernier词元 (last-token pooling).

from vllm import LLM
from vllm.config.pooler import PoolerConfig

model = LLM(
    model="jinaai/jina-embeddings-v5-text-small-retrieval",
    dtype="float16",
    runner="pooling",
    pooler_config=PoolerConfig(seq_pooling_type="LAST", normalize=True),
)
outputs = model.encode(["Query: climate change impacts"], pooling_task="embed")

Pour une inférence locale optimisée via llama.cpp et MLX, les poids LoRA de chaque adaptateur de tâche sont fusionnés dans le modèle de base pour produire des fichiers de poids autonomes. C'est pourquoi vous voyez des dépôts séparés par tâche (retrieval, text-matching, classification, clustering) : chacun contient les poids fusionnés complets prêts à être chargés directement, sans surcoût LoRA au moment de l'inférence.

tagllama.cpp (GGUF)

Exécutez des modèles quantifiés sur CPU ou sur des appareils de périphérie (edge devices). Nous fournissons 14 variantes de quantification GGUF pour chaque modèle, allant de F16 à IQ1_S.

llama-server -hf jinaai/jina-embeddings-v5-text-small-retrieval-GGUF:Q4_K_M \
  --embedding --pooling last -ub 32768

tagMLX

Inférence native sur Apple Silicon via MLX. Disponible en pleine précision, ainsi qu'en quantification 4 bits et 8 bits pour tous les adaptateurs de tâches.

import mlx.core as mx
from tokenizers import Tokenizer
from model import JinaEmbeddingModel
import json

with open("config.json") as f:
    config = json.load(f)

model = JinaEmbeddingModel(config)
weights = mx.load("model-4bit.safetensors")  # ou model.safetensors, model-8bit.safetensors
model.load_weights(list(weights.items()))

tokenizer = Tokenizer.from_file("tokenizer.json")
texts = ["Query: What is machine learning?"]
embeddings = model.encode(texts, tokenizer)

Téléchargez depuis Hugging Face : jinaai/jina-embeddings-v5-text-small-retrieval-mlx (également disponible pour les adaptateurs de text-matching, classification et clustering).

tagEntraînement

Les deux modèles sont distillés à partir de Qwen3-Embedding-4B, un modèle de 向量模型 (Embeddings) entraîné beaucoup plus grand. La variante « small » utilise Qwen3-0.6B-Base comme colonne vertébrale, tandis que la variante « nano » utilise EuroBERT-210m. Notre entraînement combine deux signaux complémentaires :

  1. Distillation de 向量模型 (Embeddings) depuis le modèle enseignant 4B via une perte par similarité cosinus. L'étudiant apprend à approximer l'espace des 向量模型 (Embeddings) de l'enseignant sans nécessiter de 提示词 (Prompt) de type instruction. Cela est particulièrement efficace pour les langues et les tâches où les données étiquetées sont rares.
  2. Perte contrastive spécifique à la tâche (InfoNCE) sur des paires requête-document étiquetées avec un minage de négatifs difficiles (hard negative mining) et des négatifs au sein des lots (in-batch negatives). Après avoir gelé la colonne vertébrale distillée, nous entraînons des adaptateurs LoRA séparés pour chaque catégorie de tâche.

Nos études d'ablation montrent que cette approche combinée surpasse systématiquement chaque méthode prise isolément. Sur le benchmark MTEB English retrieval, la méthode combinée atteint 60,1 nDCG@10, contre 58,6 pour la distillation seule et 54,3 pour la méthode contrastive seule sur la même base.

Nous appliquons également la GOR (Generalized Orthogonal Regularization) pendant l'entraînement, ce qui encourage les composantes des 向量模型 (Embeddings) à être réparties de manière plus uniforme. Cela n'améliore pas radicalement les scores des benchmarks standard, mais rend la quantification binaire presque sans perte, une propriété cruciale pour le déploiement sur des systèmes aux ressources mémoire limitées.

Quelques observations issues de l'entraînement méritent d'être notées :

  • La distillation et l'apprentissage contrastif sont complémentaires d'une manière que nous n'avions pas prévue initialement.
  • La suppression de n'importe quel composant de notre mélange de pertes dégrade les performances sur toute la ligne.
  • Les adaptateurs LoRA spécifiques à la tâche surpassent l'entraînement multi-tâches pour un surcoût en paramètres négligeable.
  • La régularisation GOR rend la quantification binaire presque sans perte, ce qui compte davantage pour le déploiement que les gains marginaux en pleine précision.

tagConclusion

Les modèles de 向量模型 (Embeddings) sont de plus en plus utilisés comme composants de chaîne d'outils au sein de systèmes plus vastes. Les agents 大模型 (LLM) appellent des API de 向量模型 (Embeddings) pour la recherche (retrieval), la mémoire et la classification dans le cadre de flux de travail agentiques. Des projets comme OpenClaw et OpenViking traitent les 向量模型 (Embeddings) comme une couche d'infrastructure centrale pour la gestion du contexte des agents, et non comme des points de terminaison de recherche isolés. Dans ce cadre, le coût d'inférence et la latence par appel importent tout autant que les scores de benchmark, et les modèles compacts deviennent le choix naturel.

La tendance vers des modèles de 向量模型 (Embeddings) plus petits reflète un changement plus large. La recherche sur appareil (on-device), la recherche basée sur le navigateur et le déploiement en périphérie exigent tous des modèles qui tiennent dans des contraintes de mémoire limitées. La prise en charge des dimensions Matryoshka permet à un seul modèle de servir à la fois pour la recherche haute précision et la recherche approximative ultra-rapide sans réentraînement. Associé à la quantification GGUF jusqu'à 1-2 bits, l'empreinte mémoire effective pour un service de 向量模型 (Embeddings) en production diminue d'un ordre de grandeur.

Nous travaillons sur jina-embeddings-v5-multimodal, étendant la même architecture à la vision et à la recherche intermodale. Les premiers résultats suggèrent qu'il est possible d'aligner un encodeur de vision avec un modèle de 向量模型 (Embeddings) de texte finement ajusté sans dégrader les performances textuelles. Restez à l'écoute.

Catégories:
star
Mis en exergue
communiqué de presse
rss_feed

En savoir plus
août 03, 2026 • 11 minutes lues
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
mai 12, 2026 • 7 minutes lues
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
décembre 04, 2025 • 7 minutes lues
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.