Aperçu
jina-clip-v1 est un modèle d'embedding multimodal de 223M paramètres qui atteint des performances state-of-the-art à la fois en recherche texte-vers-texte et texte-vers-image : une première pour la famille CLIP. Contrairement aux modèles CLIP standards qui sacrifient la recherche texte uniquement pour l'alignement multimodal, jina-clip-v1 utilise un entraînement contrastif multi-tâches pour maintenir de bonnes performances sur toutes les combinaisons de recherche. Il prend en charge un contexte texte de 12 288 tokens — 100× la limite de 77 tokens du CLIP d'origine.
Méthodes
L'architecture combine un encodeur de texte Jina BERT v2 adapté (12 288 tokens grâce à ALiBi) avec l'encodeur d'images EVA-02 de la Beijing Academy for AI. L'innovation clé est la méthode d'entraînement contrastif multi-tâches : le modèle est entraîné simultanément sur (1) des paires image-légende pour l'alignement multimodal, (2) des paires texte-texte pour préserver la qualité de la recherche texte uniquement et (3) des descriptions d'images plus longues générées par IA pour améliorer la robustesse face aux longueurs de texte variées. Une étape finale utilise des triplets de texte avec négatifs difficiles pour affiner la distinction sémantique. Cette approche multi-tâches empêche l'oubli catastrophique de la recherche texte uniquement qui affecte l'entraînement CLIP standard. L'encodeur d'images traite des tuiles de 224×224 pixels, chaque tuile consommant 1 000 tokens de capacité de traitement.
Performance
En recherche texte uniquement, le modèle atteint une augmentation de 165 % par rapport à OpenAI CLIP (0,429 contre 0,162 sur MTEB). Pour les tâches d'images : 2 % de mieux en texte-vers-image (0,899), 6 % en image-vers-texte (0,803) et 12 % en image-vers-image (0,916). En classification visuelle zero-shot (CIFAR-100), il surpasse le CLIP standard. Les performances multimodales sur Flickr8k/30k et MSCOCO Captions sont compétitives face aux modèles mono-modalité spécialisés. Le contexte texte de 12 288 tokens est un avantage majeur pour la récupération de documents texte longs aux côtés d'images. En 2026, jina-clip-v2 remplace ce modèle avec le support de 89 langues et le traitement d'images 512×512.
Conseils
Le modèle traite les images en tuiles de 224×224 pixels ; chaque tuile consomme 1 000 tokens. Une image de 750×500 pixels nécessite 12 tuiles (12 000 tokens). Le texte nécessite environ 1,1 tokens par mot. Planifiez les budgets de tokens en conséquence pour les requêtes multimodales. Le modèle ne prend actuellement en charge que l'anglais — pour les applications multilingues, utilisez jina-clip-v2. Disponible via l'API Jina Embeddings et en version open source sur Hugging Face sous la licence Apache 2.0. Pour les environnements de production, les options de déploiement AWS Marketplace et Azure offrent une infrastructure optimisée. Utilisez la similarité cosinus pour les comparaisons multimodales. Pour les nouveaux projets multimodaux, préférez jina-clip-v2 (89 langues, images 512×512, support MRL) ou jina-embeddings-v4 (contexte 32K, mode multi-vecteurs, support de code).









