Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Intégrations
Licence de recherche Qwen
open_in_new Publication de publication

jina-embeddings-v4

Modèle d'intégration universel pour la recherche multimodale et multilingue
Licence
Qwen Research License
Date de sortie
calendar_month
2025-06-24
Saisir
abc
Texte
image
Image
picture_as_pdf
PDF
arrow_forward
Sortir
more_horiz
Vecteur
apps
Multi-vecteur
Dimensions Matryoshka help_outline
128
256
512
1024
2048
Chunkage tardif help_outline
check_circle
Yes
Détails du modèle
Paramètres: 3.8B
Longueur du jeton d'entrée: 32K
Taille de l'image d'entrée: 768×28×28
Dimension de sortie: 2048
Modèle de base help_outline
open_in_new
Qwen2.5-VL-3B-Instruct
Langues enseignées help_outline
34 langues
Langues prises en charge help_outline
29 langues
Quantifications help_outline
GGUF
Modèles associés
link
jina-embeddings-v3
link
jina-clip-v2
Tâches prises en charge
search Récupération
compare_arrows Correspondance de texte
code Code
Disponible via
API Jina
Hugging Face
Air-gapped
Graphique d'E/S 1

Texte

jina-embeddings-v4

Tâche

Vecteur

Graphique d'E/S 2

Image

jina-embeddings-v4

Tâche

Vecteur

Graphique d'E/S 3

multiple

Vecteur

Texte

jina-embeddings-v4

Tâche

Graphique d'E/S 4

multiple

Vecteur

Image

jina-embeddings-v4

Tâche

Pareto fronthelp_outline
RTEB public
LongEmbed
CoIR
ViDoRe v1
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v4Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
LongEmbed
69.88
Parameters
3.8B
Rank by score
7 / 69
Pareto front
Behind it
Distribution des valeurshelp_outline
AUC 0.8308
Corpus
Paires de traduction
Recherche documentaire
Code
Image / bannière
Image / logo
Tâche
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
Liées6.7%
Négatif difficile1.1%
Non liées0.8%
Seuils recommandés
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
équilibré · 0.618
AUC
0.8308
Plafond de bruit
0.877
Décrochage du rappel
0.516
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.19-0.020.15
σ 0.0221 · 487k valeurs
Géométrie des embeddingshelp_outline
02048
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.496
Dim. effectives
73 / 2048
Troncature des dimensionshelp_outline
12825651210242048
text-matching · Seuil selon les dimensions demandées
Paires de langueshelp_outline
de-ruen-deen-koen-zhja-ko
Écart du seuil entre les paires : 0.069
Choisissez les modèles à comparer
Publications (2)
ICLR 2026
janvier 22, 2026
Embedding Compression via Spherical Coordinates
EMNLP 2025
juin 24, 2025
jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval

Aperçu

Jina Embeddings V4 est un modèle d'intégration multimodale de 3,8 milliards de paramètres offrant des capacités de représentation unifiée de texte et d'images. Basé sur le backbone Qwen2.5-VL-3B-Instruct, ce modèle présente une architecture prenant en charge les intégrations mono-vecteur et multi-vecteur en mode interaction tardive, remédiant ainsi aux limitations des modèles traditionnels à double encodeur de type CLIP. Il intègre trois adaptateurs LoRA spécifiques à chaque tâche (60 millions de paramètres chacun) qui optimisent les performances dans différents scénarios de récupération, notamment la récupération asymétrique de documents, la similarité sémantique de texte et la recherche de code, sans modifier les pondérations figées du backbone. Ce modèle affiche d'excellentes performances dans le traitement de contenus visuellement riches tels que les tableaux, les graphiques, les diagrammes, les captures d'écran et les formats multimédias, grâce à un chemin de traitement unifié qui réduit l'écart de modalité présent dans les architectures conventionnelles. Prenant en charge des capacités multilingues, le modèle peut gérer des textes d'entrée jusqu'à 32 768 jetons avec des images redimensionnées à 20 mégapixels, ce qui le rend adapté à diverses applications de recherche de documents et de recherche intermodale dans différentes langues et domaines.

Méthodes

Jina Embeddings V4 implémente une architecture de modèle de langage multimodal unifiée, différente des approches à double encodeur de type CLIP. Le modèle traite les entrées via un chemin partagé où les images sont d'abord converties en séquences de jetons via un encodeur de vision, puis les modalités texte et image sont traitées conjointement par le décodeur du modèle de langage avec des couches d'attention contextuelle. Cette architecture prend en charge deux modes de sortie pour s'adapter à différents cas d'utilisation : les intégrations mono-vectorielles qui produisent des vecteurs de 2048 dimensions tronquables à 128 dimensions grâce à l'apprentissage de représentation Matryoshka, générés par regroupement de moyennes pour une recherche de similarité efficace ; et les intégrations multi-vectorielles qui génèrent 128 dimensions par jeton via des couches de projection pour une récupération de style d'interaction tardive. Le modèle comprend trois adaptateurs LoRA spécifiques à chaque tâche, offrant une optimisation spécialisée : l'adaptateur de récupération utilise un codage asymétrique basé sur les préfixes avec un entraînement aux négatifs durs pour les scénarios requête-document ; l'adaptateur de correspondance textuelle utilise la perte CoSENT pour les tâches de similarité sémantique ; et l'adaptateur de code se concentre sur les applications de récupération langage naturel-code. L'entraînement se déroule en deux phases : l'entraînement initial des paires utilisant la perte contrastive InfoNCE avec des paires texte-texte et texte-image provenant de plus de 300 sources, suivi d'un réglage fin des trois adaptateurs LoRA, spécifique à chaque tâche, à l'aide de méthodes basées sur les triplets et de fonctions de perte spécialisées adaptées aux exigences de chaque domaine.

Performance

Jina Embeddings V4 obtient des performances compétitives dans plusieurs catégories de benchmarks. En recherche visuelle de documents, il obtient une moyenne de 72,19 au benchmark JinaVDR, contre 64,50 pour ColPali-v1.2, et une moyenne de 84,11 sur ViDoRe, contre 83,90 pour ColPali. Le mode multi-vecteur atteint 90,17 sur ViDoRe. En recherche intermodale, le modèle obtient 84,11 au benchmark CLIP, contre 81,12 pour jina-clip-v2 et 83,19 pour nllb-clip-large-siglip. En recherche textuelle, il obtient 55,97 sur MTEB-en et 66,49 sur MMTEB, avec des performances notables en traitement de documents longs, avec 67,11 sur LongEmbed, contre 55,66 pour son prédécesseur. Le modèle affiche de solides performances en termes de similarité sémantique textuelle, avec un score de 85,89 sur les tâches STS en anglais et de 72,70 sur les tests STS multilingues. Les capacités de récupération de code atteignent 71,59 sur le test CoIR, bien que des modèles spécialisés comme voyage-code-3 (77,33) obtiennent des scores plus élevés dans ce domaine. Le modèle présente un alignement intermodal amélioré avec un score de 0,71 contre 0,15 pour OpenAI CLIP, ce qui résout le problème de l'écart de modalité dans les modèles multimodaux. Le mode multi-vecteur surpasse systématiquement le mode mono-vecteur sur les tâches visuellement riches, tandis que le mode mono-vecteur offre des performances efficaces pour les scénarios de récupération standard.

Conseils

Pour utiliser efficacement Jina Embeddings V4, sélectionnez l'adaptateur LoRA adapté aux exigences spécifiques de votre application. Utilisez l'adaptateur « retrieval » pour les scénarios de recherche asymétrique de documents et de requêtes, où les requêtes et les documents ont des structures différentes, en veillant à appliquer des préfixes appropriés pour distinguer le contenu de la requête du contenu du passage. L'adaptateur « text-matching » est adapté aux tâches de similarité sémantique et de recherche symétrique, où l'objectif est de trouver du contenu similaire plutôt que des réponses aux requêtes. Il est donc idéal pour le clustering de documents, la détection des doublons et les systèmes de recommandation de contenu. Pour les applications de programmation, l'adaptateur « code » est optimisé pour la recherche de langage naturel vers code, la recherche de similarité code à code et les scénarios de réponse aux questions techniques. Choisissez les modes de sortie en fonction de vos exigences de performance et d'efficacité : les intégrations mono-vecteur offrent une recherche de similarité efficace et conviennent aux environnements à espace de stockage limité. Leurs dimensions tronquables permettent de réduire le nombre de dimensions de 2 048 à 128-512 avec des compromis de qualité acceptables. Les intégrations multi-vecteurs offrent quant à elles une plus grande précision pour les tâches de recherche complexes, notamment avec des documents visuellement riches où la notation des interactions tardives capture des relations détaillées. L'architecture unifiée du modèle permet le traitement d'entrées mixtes texte-image sans nécessiter d'encodeurs distincts ni de prétraitement OCR pour les documents visuels. Les capacités d'alignement intermodal et la prise en charge multilingue du modèle le rendent adapté aux applications internationales. Pour les déploiements en production, tenez compte de la surcharge de 60 M de paramètres par adaptateur LoRA lors de la planification des besoins en mémoire. Notez que les trois adaptateurs peuvent être gérés simultanément avec moins de 2 % d'empreinte mémoire supplémentaire, ce qui permet une commutation flexible des tâches pendant l'inférence.
Blogs qui mentionnent ce modèle
mars 11, 2026 • 7 minutes lues
Bootstrapping Audio Embeddings from Multimodal LLMs
Turn any multimodal LLM into a small audio embedding model that beats CLAP with 25x less data.
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
février 19, 2026 • 7 minutes lues
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Two sub-1B multilingual embeddings with best-in-class performance, available on Elastic Inference Service, Llama.cpp and MLX.
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
septembre 09, 2025 • 11 minutes lues
Multimodal Embeddings in Llama.cpp and GGUF
We brought multimodal embeddings to llama.cpp and GGUF, and uncovered a few surprising issues along the way.
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
septembre 04, 2025 • 6 minutes lues
Jina Code Embeddings: SOTA Code Retrieval at 0.5B and 1.5B
Code generation LLMs → code embeddings: 0.5B/1.5B models achieve SOTA performance across 25 code retrieval benchmarks.
Jina AI
Green "Code Embeddings" text displayed in a LED dot style on a black background, evoking a futuristic and technological atmos
août 13, 2025 • 15 minutes lues
Optimizing GGUFs for Decoder-Only Embedding Models
4000 tokens/sec for a 3B-parameter embedding model on L4 GPU is probably as fast as you'll get with llama.cpp. Or is it?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.