Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur ancrage des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
warning
Ce modèle est obsolète pour les modèles plus récents.
Embeddings
Licence Apache 2.0
open_in_new Publication de publication

jina-clip-v1

Modèles d'embedding multimodaux pour les images et le texte anglais
Licence
Apache-2.0
Date de sortie
calendar_month
2024-06-05
Saisir
image
Image
abc
Texte
arrow_forward
Sortir
more_horiz
Vecteur
Détails du modèle
Paramètres: 223M
Longueur du token d'entrée: 8K
Taille de l'image d'entrée: 224×224
Dimension de sortie: 768
Modèle de base help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
Langues enseignées help_outline
1 langues
Modèles associés
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
Disponible via
API Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Graphique d'E/S 1

Texte

jina-clip-v1

Vecteur

Graphique d'E/S 2

Image

jina-clip-v1

Vecteur

Frontière de Paretohelp_outline
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14jina-clip-v2MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v1Paramètres (log)i2t-recall@5
Ce modèle
Sur la frontière
Jina AI
Autres
CLIP Benchmark
87.65
Paramètres
223M
Rang par score
44 / 56
Frontière de Pareto
Derrière
Distribution des valeurshelp_outline
AUC 0.8440
Corpus
Paires de traduction
Recherche documentaire
Image / bannière
0.6750.000.200.400.600.80
Liées20.2%
Négatif difficile3.2%
Non liées1.2%
Seuils recommandés
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
équilibré · 0.376
AUC
0.8440
Plafond de bruit
0.779
Décrochage du rappel
0.123
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.18-0.010.15
σ 0.0361 · 183k valeurs
Géométrie des embeddingshelp_outline
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.283
Dim. effectives
55 / 768
Choisissez les modèles à comparer
Publications (1)
ICML 2024
mai 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

Aperçu

Jina CLIP v1 révolutionne l'IA multimodale en étant le premier modèle à exceller aussi bien dans les tâches de récupération de texte à texte que de texte à image. Contrairement aux modèles CLIP traditionnels qui peinent à gérer les scénarios uniquement textuels, ce modèle atteint des performances de pointe dans toutes les combinaisons de récupération tout en conservant une taille de paramètre remarquablement compacte de 223 M. Le modèle répond à un défi industriel critique en éliminant le besoin de modèles distincts pour le traitement de texte et d'image, réduisant ainsi la complexité du système et la surcharge de calcul. Pour les équipes qui créent des systèmes de recherche, des moteurs de recommandation ou des outils d'analyse de contenu, Jina CLIP v1 offre une solution unique et efficace qui gère à la fois le texte et le contenu visuel avec une précision exceptionnelle.

Méthodes

L'architecture du modèle représente une innovation significative dans la conception de l'IA multimodale, combinant un encodeur de texte Jina BERT v2 adapté avec l'encodeur d'image de pointe EVA-02 de l'Académie d'intelligence artificielle de Pékin. L'encodeur de texte prend en charge des séquences allant jusqu'à 12 288 tokens - plus de 100 fois plus longues que la limite de 77 tokens du CLIP d'origine - tandis que l'encodeur d'image traite efficacement 16 tokens de patch. Le processus d'entraînement suit une nouvelle approche en trois étapes : premièrement, aligner les paires image-légende tout en maintenant la compréhension du texte grâce à un entraînement par paires de textes entrelacés ; deuxièmement, incorporer des descriptions textuelles plus longues des images générées par l'IA ; et enfin, utiliser des triplets de texte négatifs durs pour améliorer les capacités de distinction sémantique. Cette méthodologie d'entraînement unique permet au modèle de maintenir des performances élevées à la fois pour les légendes courtes et les descriptions textuelles détaillées tout en préservant une forte compréhension visuelle.

Performance

Jina CLIP v1 démontre des améliorations remarquables par rapport au CLIP original d'OpenAI dans tous les benchmarks. En recherche texte seul, il atteint une augmentation de performance de 165 % avec un score de 0,429 contre 0,162 pour CLIP. Pour les tâches liées aux images, il montre des améliorations constantes : 2 % de mieux en recherche texte-vers-image (0,899), 6 % en recherche image-vers-texte (0,803) et 12 % en recherche image-vers-image (0,916). Le modèle brille particulièrement dans les tâches de classification visuelle zero-shot, en catégorisant avec succès les images sans entraînement préalable sur des domaines spécifiques. Lorsqu'il est évalué sur des benchmarks standard comme MTEB pour la recherche de texte, CIFAR-100 pour les tâches d'image et Flickr8k/30k et MSCOCO Captions pour les performances intermodales, il surpasse systématiquement les modèles spécialisés à modalité unique tout en maintenant des performances compétitives dans les tâches intermodales.

Conseils

Pour déployer efficacement Jina CLIP v1, les équipes doivent tenir compte à la fois de ses capacités et de ses besoins en ressources. Le modèle traite les images en mosaïques de 224 x 224 pixels, chaque mosaïque consommant 1 000 tokens de capacité de traitement. Pour des performances optimales, implémentez un prétraitement d'image efficace pour correspondre à ces dimensions. Bien que le modèle excelle dans le traitement de texte court et long, il ne prend actuellement en charge que la saisie en anglais. Les équipes doivent soigneusement réfléchir à l'utilisation des tokens : le texte nécessite environ 1,1 token par mot, tandis que les images sont traitées en mosaïques (par exemple, une image de 750 x 500 pixels nécessite 12 mosaïques, consommant 12 000 tokens). Le modèle est disponible via l'API Jina Embeddings et en tant que version open source sur Hugging Face sous la licence Apache 2.0, offrant une flexibilité dans les options de déploiement. Pour les environnements de production, envisagez d'utiliser les options de déploiement AWS Marketplace ou Azure, qui fournissent des configurations d'infrastructure optimisées.
Blogs qui mentionnent ce modèle
juin 25, 2025 • 12 minutes lues
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
avril 08, 2025 • 21 minutes lues
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
décembre 12, 2024 • 12 minutes lues
Scaling Test-Time Compute For Embedding Models
Better results scale with compute—more on learning, more on search. A good pretrained model takes you far, but test-time compute takes you further. It's time to recognize this paradigm of test-time compute, even for embedding models.
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
décembre 04, 2024 • 13 minutes lues
Still Need Chunking When Long-Context Models Can Do It All?
Comparing how long-context embedding models perform with different chunking strategies to find the optimal approach for your needs.
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
novembre 21, 2024 • 9 minutes lues
Jina CLIP v2: Multilingual Multimodal Embeddings for Text and Images
Jina-CLIP v2, a 0.9B multimodal embedding model with multilingual support of 89 languages, high image resolution at 512x512, and Matryoshka representations.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reclasseur
Obtenir la clé API Jina
Limite de débit
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.