Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reranker
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
warning
Ce modèle est obsolète pour les modèles plus récents.
Embeddings
Licence Apache 2.0
open_in_new Article de lancement

jina-clip-v1

Modèles d'embedding multimodaux pour les images et le texte anglais
Licence
Apache-2.0
Date de sortie
calendar_month
2024-06-05
Saisie
image
Image
abc
Texte
arrow_forward
Sortir
more_horiz
Vecteur
Détails du modèle
Paramètres: 223M
Longueur du token d'entrée: 8K
Taille de l'image d'entrée: 224×224
Dimension de sortie: 768
Modèle de base help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
Langues enseignées help_outline
1 langues
Modèles associés
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
Disponible via
API Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Graphique d'E/S 1

Texte

jina-clip-v1

Vecteur

Graphique d'E/S 2

Image

jina-clip-v1

Vecteur

Frontière de Pareto help_outline
workspace_premium
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
300M1B3.0B10B20406080100bge-visualized-m3BiModernVBERTDSE-Phi3dse-qwen2-2b-mrl-v1e5-vjina-clip-v2jina-embeddings-v3jina-embeddings-v4llama-nemoretriever-col…MoCa-3Bnemotron-colembed-vl-8b…nllb-siglip-largeONE-PEACESauerkrautLM-ColLFM2-45…SauerkrautLM-ColMinistr…siglip-so400m-patch14-3…SigLIP2-L-512/16VLM2VecVultronRetrieverFlash-Q…jina-clip-v1Paramètres (log)nDCG@5
Ce modèle
Sur la frontière
Jina AI
Autres
ViDoRe v1
17.72
Paramètres
223M
Rang par score
32 / 33
Frontière de Pareto
Sur elle
Distribution des valeurshelp_outline
AUC 0.8440
Corpus
Paires de traduction
Recherche documentaire
Image / bannière
0.6750.000.200.400.600.80
Liées20.2%
Négatif difficile3.2%
Non liées1.2%
Seuils recommandés
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
équilibré · 0.376
AUC
0.8440
Plafond de bruit
0.779
Décrochage du rappel
0.123
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.18-0.010.15
σ 0.0361 · 183k valeurs
Géométrie des embeddingshelp_outline
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.283
Dim. effectives
55 / 768
Choisissez les modèles à comparer
Publications (1)
ICML 2024
mai 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

Aperçu

jina-clip-v1 est un modèle d'embedding multimodal de 223M paramètres qui atteint des performances state-of-the-art à la fois en recherche texte-vers-texte et texte-vers-image : une première pour la famille CLIP. Contrairement aux modèles CLIP standards qui sacrifient la recherche texte uniquement pour l'alignement multimodal, jina-clip-v1 utilise un entraînement contrastif multi-tâches pour maintenir de bonnes performances sur toutes les combinaisons de recherche. Il prend en charge un contexte texte de 12 288 tokens — 100× la limite de 77 tokens du CLIP d'origine.

Méthodes

L'architecture combine un encodeur de texte Jina BERT v2 adapté (12 288 tokens grâce à ALiBi) avec l'encodeur d'images EVA-02 de la Beijing Academy for AI. L'innovation clé est la méthode d'entraînement contrastif multi-tâches : le modèle est entraîné simultanément sur (1) des paires image-légende pour l'alignement multimodal, (2) des paires texte-texte pour préserver la qualité de la recherche texte uniquement et (3) des descriptions d'images plus longues générées par IA pour améliorer la robustesse face aux longueurs de texte variées. Une étape finale utilise des triplets de texte avec négatifs difficiles pour affiner la distinction sémantique. Cette approche multi-tâches empêche l'oubli catastrophique de la recherche texte uniquement qui affecte l'entraînement CLIP standard. L'encodeur d'images traite des tuiles de 224×224 pixels, chaque tuile consommant 1 000 tokens de capacité de traitement.

Performance

En recherche texte uniquement, le modèle atteint une augmentation de 165 % par rapport à OpenAI CLIP (0,429 contre 0,162 sur MTEB). Pour les tâches d'images : 2 % de mieux en texte-vers-image (0,899), 6 % en image-vers-texte (0,803) et 12 % en image-vers-image (0,916). En classification visuelle zero-shot (CIFAR-100), il surpasse le CLIP standard. Les performances multimodales sur Flickr8k/30k et MSCOCO Captions sont compétitives face aux modèles mono-modalité spécialisés. Le contexte texte de 12 288 tokens est un avantage majeur pour la récupération de documents texte longs aux côtés d'images. En 2026, jina-clip-v2 remplace ce modèle avec le support de 89 langues et le traitement d'images 512×512.

Conseils

Le modèle traite les images en tuiles de 224×224 pixels ; chaque tuile consomme 1 000 tokens. Une image de 750×500 pixels nécessite 12 tuiles (12 000 tokens). Le texte nécessite environ 1,1 tokens par mot. Planifiez les budgets de tokens en conséquence pour les requêtes multimodales. Le modèle ne prend actuellement en charge que l'anglais — pour les applications multilingues, utilisez jina-clip-v2. Disponible via l'API Jina Embeddings et en version open source sur Hugging Face sous la licence Apache 2.0. Pour les environnements de production, les options de déploiement AWS Marketplace et Azure offrent une infrastructure optimisée. Utilisez la similarité cosinus pour les comparaisons multimodales. Pour les nouveaux projets multimodaux, préférez jina-clip-v2 (89 langues, images 512×512, support MRL) ou jina-embeddings-v4 (contexte 32K, mode multi-vecteurs, support de code).

Blogs qui mentionnent ce modèle
juin 25, 2025 • 12 minutes lues
Jina Embeddings v4 : Vecteurs universels pour la recherche multimodale et multilingue
Jina Embeddings v4 est un modèle d'向量模型 (Embeddings) universel de 3,8 milliards de paramètres pour la recherche multimodale et multilingue qui prend en charge les sorties d'向量模型 (Embeddings) à vecteur unique et à vecteurs multiples.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
avril 08, 2025 • 21 minutes lues
jina-reranker-m0 : Reclasseur multilingue et multimodal de documents
Présentation de jina-reranker-m0, notre nouveau réordonnanceur multimodal multilingue pour la recherche de documents visuels, offrant des performances à l'état de l'art sur la recherche de longs documents multilingues et de code source.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
décembre 12, 2024 • 12 minutes lues
Augmenter les ressources de calcul au moment du test pour les modèles d'embedding
Les meilleurs résultats augmentent avec la puissance de calcul—plus d'apprentissage, plus de recherche. Un bon modèle pré-entraîné vous mène loin, mais le calcul lors de l'inférence vous mène encore plus loin. Il est important de reconnaître ce nouveau paradigme d'augmentation de la puissance de calcul lors de l'inférence, même pour les modèles d'embedding.
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
décembre 04, 2024 • 13 minutes lues
A-t-on encore besoin du découpage avec les modèles qui gèrent les longs contextes ?
Comparaison des performances des modèles d'embedding à contexte long selon différentes stratégies de découpage pour trouver l'approche optimale adaptée à vos besoins.
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
novembre 21, 2024 • 9 minutes lues
Jina CLIP v2 : Embeddings multilingues et multimodales pour le texte et les images
Jina-CLIP v2, un modèle d'embedding multimodal de 0,9B avec un support multilingue de 89 langues, une haute résolution d'image à 512x512, et des représentations Matryoshka.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reranker
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.