Graphique d'E/S 1

Texte

jina-clip-v1

Vecteur

Graphique d'E/S 2

Image

jina-clip-v1

Vecteur

Frontière de Pareto
300M1B3.0B10B20406080100bge-visualized-m3BiModernVBERTDSE-Phi3dse-qwen2-2b-mrl-v1e5-vjina-clip-v2jina-embeddings-v3jina-embeddings-v4llama-nemoretriever-col…MoCa-3Bnemotron-colembed-vl-8b…nllb-siglip-largeONE-PEACESauerkrautLM-ColLFM2-45…SauerkrautLM-ColMinistr…siglip-so400m-patch14-3…SigLIP2-L-512/16VLM2VecVultronRetrieverFlash-Q…jina-clip-v1Paramètres (log)nDCG@5
Ce modèle
Sur la frontière
Jina AI
Autres
ViDoRe v1
17.72
Paramètres
223M
Rang par score
32 / 33
Frontière de Pareto
Sur elle
Distribution des valeurs
AUC 0.8440
Corpus
Paires de traduction
Recherche documentaire
Image / bannière
0.6750.000.200.400.600.80
Liées20.2%
Négatif difficile3.2%
Non liées1.2%
Seuils recommandés
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
équilibré · 0.376
AUC
0.8440
Plafond de bruit
0.779
Décrochage du rappel
0.123
Paires mesurées
119 / 11k
Composantes des vecteurs
-0.18-0.010.15
σ 0.0361 · 183k valeurs
Géométrie des embeddings
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.283
Dim. effectives
55 / 768
Choisissez les modèles à comparer
Publications (1)

Aperçu

jina-clip-v1 est un modèle d'embedding multimodal de 223M paramètres qui atteint des performances state-of-the-art à la fois en recherche texte-vers-texte et texte-vers-image : une première pour la famille CLIP. Contrairement aux modèles CLIP standards qui sacrifient la recherche texte uniquement pour l'alignement multimodal, jina-clip-v1 utilise un entraînement contrastif multi-tâches pour maintenir de bonnes performances sur toutes les combinaisons de recherche. Il prend en charge un contexte texte de 12 288 tokens — 100× la limite de 77 tokens du CLIP d'origine.

Méthodes

L'architecture combine un encodeur de texte Jina BERT v2 adapté (12 288 tokens grâce à ALiBi) avec l'encodeur d'images EVA-02 de la Beijing Academy for AI. L'innovation clé est la méthode d'entraînement contrastif multi-tâches : le modèle est entraîné simultanément sur (1) des paires image-légende pour l'alignement multimodal, (2) des paires texte-texte pour préserver la qualité de la recherche texte uniquement et (3) des descriptions d'images plus longues générées par IA pour améliorer la robustesse face aux longueurs de texte variées. Une étape finale utilise des triplets de texte avec négatifs difficiles pour affiner la distinction sémantique. Cette approche multi-tâches empêche l'oubli catastrophique de la recherche texte uniquement qui affecte l'entraînement CLIP standard. L'encodeur d'images traite des tuiles de 224×224 pixels, chaque tuile consommant 1 000 tokens de capacité de traitement.

Performance

En recherche texte uniquement, le modèle atteint une augmentation de 165 % par rapport à OpenAI CLIP (0,429 contre 0,162 sur MTEB). Pour les tâches d'images : 2 % de mieux en texte-vers-image (0,899), 6 % en image-vers-texte (0,803) et 12 % en image-vers-image (0,916). En classification visuelle zero-shot (CIFAR-100), il surpasse le CLIP standard. Les performances multimodales sur Flickr8k/30k et MSCOCO Captions sont compétitives face aux modèles mono-modalité spécialisés. Le contexte texte de 12 288 tokens est un avantage majeur pour la récupération de documents texte longs aux côtés d'images. En 2026, jina-clip-v2 remplace ce modèle avec le support de 89 langues et le traitement d'images 512×512.

Conseils

Le modèle traite les images en tuiles de 224×224 pixels ; chaque tuile consomme 1 000 tokens. Une image de 750×500 pixels nécessite 12 tuiles (12 000 tokens). Le texte nécessite environ 1,1 tokens par mot. Planifiez les budgets de tokens en conséquence pour les requêtes multimodales. Le modèle ne prend actuellement en charge que l'anglais — pour les applications multilingues, utilisez jina-clip-v2. Disponible via l'API Jina Embeddings et en version open source sur Hugging Face sous la licence Apache 2.0. Pour les environnements de production, les options de déploiement AWS Marketplace et Azure offrent une infrastructure optimisée. Utilisez la similarité cosinus pour les comparaisons multimodales. Pour les nouveaux projets multimodaux, préférez jina-clip-v2 (89 langues, images 512×512, support MRL) ou jina-embeddings-v4 (contexte 32K, mode multi-vecteurs, support de code).

Blogs qui mentionnent ce modèle
juin 25, 2025 • 12 minutes lues
Jina Embeddings v4 : Vecteurs universels pour la recherche multimodale et multilingue
Jina Embeddings v4 est un modèle d'向量模型 (Embeddings) universel de 3,8 milliards de paramètres pour la recherche multimodale et multilingue qui prend en charge les sorties d'向量模型 (Embeddings) à vecteur unique et à vecteurs multiples.
avril 08, 2025 • 21 minutes lues
jina-reranker-m0 : Reclasseur multilingue et multimodal de documents
Présentation de jina-reranker-m0, notre nouveau réordonnanceur multimodal multilingue pour la recherche de documents visuels, offrant des performances à l'état de l'art sur la recherche de longs documents multilingues et de code source.
décembre 12, 2024 • 12 minutes lues
Augmenter les ressources de calcul au moment du test pour les modèles d'embedding
Les meilleurs résultats augmentent avec la puissance de calcul—plus d'apprentissage, plus de recherche. Un bon modèle pré-entraîné vous mène loin, mais le calcul lors de l'inférence vous mène encore plus loin. Il est important de reconnaître ce nouveau paradigme d'augmentation de la puissance de calcul lors de l'inférence, même pour les modèles d'embedding.
décembre 04, 2024 • 13 minutes lues
A-t-on encore besoin du découpage avec les modèles qui gèrent les longs contextes ?
Comparaison des performances des modèles d'embedding à contexte long selon différentes stratégies de découpage pour trouver l'approche optimale adaptée à vos besoins.
novembre 21, 2024 • 9 minutes lues
Jina CLIP v2 : Embeddings multilingues et multimodales pour le texte et les images
Jina-CLIP v2, un modèle d'embedding multimodal de 0,9B avec un support multilingue de 89 langues, une haute résolution d'image à 512x512, et des représentations Matryoshka.