Graphique d'E/S 1
Graphique d'E/S 2
Frontière de Paretohelp_outline
chevron_leftchevron_right
Ce modèle
Sur la frontière
Jina AI
Autres
CLIP Benchmark
87.65
Paramètres
223M
Rang par score
44 / 56
Frontière de Pareto
Derrière
Distribution des valeurshelp_outlineAUC 0.8440
Corpus
Paires de traduction
Recherche documentaire
Image / bannière
Liées20.2%
Négatif difficile3.2%
Non liées1.2%
Seuils recommandés
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
équilibré · 0.376
AUC
0.8440
Plafond de bruit
0.779
Décrochage du rappel
0.123
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
σ 0.0361 · 183k valeurs
Géométrie des embeddingshelp_outline
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.283
Dim. effectives
55 / 768
Choisissez les modèles à comparer
Publications (1)
Aperçu
Jina CLIP v1 révolutionne l'IA multimodale en étant le premier modèle à exceller aussi bien dans les tâches de récupération de texte à texte que de texte à image. Contrairement aux modèles CLIP traditionnels qui peinent à gérer les scénarios uniquement textuels, ce modèle atteint des performances de pointe dans toutes les combinaisons de récupération tout en conservant une taille de paramètre remarquablement compacte de 223 M. Le modèle répond à un défi industriel critique en éliminant le besoin de modèles distincts pour le traitement de texte et d'image, réduisant ainsi la complexité du système et la surcharge de calcul. Pour les équipes qui créent des systèmes de recherche, des moteurs de recommandation ou des outils d'analyse de contenu, Jina CLIP v1 offre une solution unique et efficace qui gère à la fois le texte et le contenu visuel avec une précision exceptionnelle.
Méthodes
L'architecture du modèle représente une innovation significative dans la conception de l'IA multimodale, combinant un encodeur de texte Jina BERT v2 adapté avec l'encodeur d'image de pointe EVA-02 de l'Académie d'intelligence artificielle de Pékin. L'encodeur de texte prend en charge des séquences allant jusqu'à 12 288 tokens - plus de 100 fois plus longues que la limite de 77 tokens du CLIP d'origine - tandis que l'encodeur d'image traite efficacement 16 tokens de patch. Le processus d'entraînement suit une nouvelle approche en trois étapes : premièrement, aligner les paires image-légende tout en maintenant la compréhension du texte grâce à un entraînement par paires de textes entrelacés ; deuxièmement, incorporer des descriptions textuelles plus longues des images générées par l'IA ; et enfin, utiliser des triplets de texte négatifs durs pour améliorer les capacités de distinction sémantique. Cette méthodologie d'entraînement unique permet au modèle de maintenir des performances élevées à la fois pour les légendes courtes et les descriptions textuelles détaillées tout en préservant une forte compréhension visuelle.
Performance
Jina CLIP v1 démontre des améliorations remarquables par rapport au CLIP original d'OpenAI dans tous les benchmarks. En recherche texte seul, il atteint une augmentation de performance de 165 % avec un score de 0,429 contre 0,162 pour CLIP. Pour les tâches liées aux images, il montre des améliorations constantes : 2 % de mieux en recherche texte-vers-image (0,899), 6 % en recherche image-vers-texte (0,803) et 12 % en recherche image-vers-image (0,916). Le modèle brille particulièrement dans les tâches de classification visuelle zero-shot, en catégorisant avec succès les images sans entraînement préalable sur des domaines spécifiques. Lorsqu'il est évalué sur des benchmarks standard comme MTEB pour la recherche de texte, CIFAR-100 pour les tâches d'image et Flickr8k/30k et MSCOCO Captions pour les performances intermodales, il surpasse systématiquement les modèles spécialisés à modalité unique tout en maintenant des performances compétitives dans les tâches intermodales.
Conseils
Pour déployer efficacement Jina CLIP v1, les équipes doivent tenir compte à la fois de ses capacités et de ses besoins en ressources. Le modèle traite les images en mosaïques de 224 x 224 pixels, chaque mosaïque consommant 1 000 tokens de capacité de traitement. Pour des performances optimales, implémentez un prétraitement d'image efficace pour correspondre à ces dimensions. Bien que le modèle excelle dans le traitement de texte court et long, il ne prend actuellement en charge que la saisie en anglais. Les équipes doivent soigneusement réfléchir à l'utilisation des tokens : le texte nécessite environ 1,1 token par mot, tandis que les images sont traitées en mosaïques (par exemple, une image de 750 x 500 pixels nécessite 12 mosaïques, consommant 12 000 tokens). Le modèle est disponible via l'API Jina Embeddings et en tant que version open source sur Hugging Face sous la licence Apache 2.0, offrant une flexibilité dans les options de déploiement. Pour les environnements de production, envisagez d'utiliser les options de déploiement AWS Marketplace ou Azure, qui fournissent des configurations d'infrastructure optimisées.
Blogs qui mentionnent ce modèle









