Elastic
Jina AI
Nouvelles
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP terminalCLIarticlellms.txtsmart_toyAgentsdata_objectSchémamenu_bookDocuments



Se connecter
login
Intégrations
copyright CC BY-NC 4.0
open_in_new Publication de publication

jina-clip-v2

Incorporations multilingues multimodales pour textes et images
Licence
copyright CC-BY-NC-4.0
Date de sortie
calendar_month
2024-11-05
Saisir
image
Image
abc
Texte
arrow_forward
Sortir
more_horiz
Vecteur
Dimensions Matryoshka help_outline
64
128
256
512
768
1024
Détails du modèle
Paramètres: 865M
Longueur du jeton d'entrée: 8K
Taille de l'image d'entrée: 512×512
Dimension de sortie: 1024
Modèle de base help_outline
open_in_new
XLM-RoBERTa Large
Langues enseignées help_outline
32 langues
Langues prises en charge help_outline
108 langues
Modèles associés
link
jina-clip-v1
Disponible via
Elastic Inference Service
API Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Graphique d'E/S 1

Texte

jina-clip-v2

Vecteur

Graphique d'E/S 2

Image

jina-clip-v2

Vecteur

Distribution des valeurshelp_outline
AUC 0.8383
Corpus
Paires de traduction
Recherche documentaire
Image / bannière
Image / logo
Tâche
default
retrieval.query
0.6040.000.200.400.60
Liées20.2%
Négatif difficile3.6%
Non liées0.8%
Survolez ou cliquez le graphique pour déplacer le seuil
Seuils recommandés
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
équilibré · 0.403
AUC
0.8383
Plafond de bruit
0.666
Décrochage du rappel
0.224
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.43-0.070.29
σ 0.0313 · 244k valeurs
Géométrie des embeddingshelp_outline
01024
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.420
Dim. effectives
52 / 1024
Paires de langueshelp_outline
de-ruen-deen-koen-zhja-ko
Écart du seuil entre les paires : 0.064
Choisissez les modèles à comparer
Publications (2)
ICLR 2026
janvier 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
décembre 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

Aperçu

Jina CLIP v2 révolutionne l'IA multimodale en comblant le fossé entre la compréhension visuelle et textuelle dans 89 langues. Ce modèle résout les défis critiques du commerce électronique mondial, de la gestion de contenu et de la communication interculturelle en permettant une correspondance précise entre image et texte, quelles que soient les barrières linguistiques. Pour les entreprises en expansion internationale ou gérant du contenu multilingue, il élimine le besoin de modèles distincts par langue ou de pipelines de traduction complexes. Le modèle est particulièrement efficace dans les scénarios nécessitant une recherche visuelle précise au-delà des frontières linguistiques, comme la découverte de produits sur le marché mondial ou la gestion d'actifs numériques multilingues.

Méthodes

Jina CLIP v2 utilise une architecture sophistiquée à double encodeur qui combine un encodeur de texte Jina XLM-RoBERTa (561 millions de paramètres) avec un encodeur de vision EVA02-L14 (304 millions de paramètres). L'encodeur de texte traite le contenu dans 89 langues avec une fenêtre de contexte massive de 696 320 jetons, tandis que l'encodeur de vision gère les images haute résolution jusqu'à 512 x 512 pixels. Le modèle introduit un apprentissage de représentation Matryoshka innovant, qui permet un ajustement dynamique des dimensions d'intégration de 1024 à 64 dimensions tout en préservant les performances. Cette architecture traite à la fois le texte et les images via leurs encodeurs respectifs, les projetant dans un espace sémantique partagé où les concepts similaires s'alignent indépendamment de leur modalité ou de leur langue d'origine.

Performance

Le modèle atteint des performances de pointe avec une précision de 98,0 % sur les tâches de récupération d'image en texte Flickr30k, surpassant à la fois son prédécesseur et NLLB-CLIP-SigLIP. Dans les scénarios multilingues, il démontre jusqu'à 4 % d'amélioration par rapport à NLLB-CLIP-SigLIP dans les tâches de récupération d'images multilingues, bien qu'il ait moins de paramètres que son plus grand concurrent. Le modèle conserve de solides performances même lorsque les intégrations sont compressées - la réduction des dimensions de 75 % préserve toujours plus de 99 % des performances sur les tâches de texte, d'image et intermodales. Sur les benchmarks MTEB multilingues complets, il atteint 69,86 % sur la récupération et 67,77 % sur les tâches de similarité sémantique, ce qui le place en compétition avec les modèles d'intégration de texte spécialisés.

Conseils

Pour un déploiement optimal, les utilisateurs doivent prendre en compte plusieurs facteurs clés. Le modèle nécessite un matériel compatible CUDA pour un traitement efficace, avec des besoins en mémoire évolutifs en fonction de la taille du lot et de la résolution de l'image. Pour optimiser les coûts et les performances de l'API, redimensionnez les images à 512 x 512 pixels avant le traitement. Les images plus grandes sont automatiquement mises en mosaïque, ce qui augmente l'utilisation des jetons et le temps de traitement. Le modèle excelle dans la mise en correspondance des images avec du texte descriptif dans différentes langues, mais peut avoir des difficultés avec des concepts abstraits ou du contenu hautement spécialisé dans un domaine. Il est particulièrement efficace pour la recherche de produits de commerce électronique, les systèmes de recommandation de contenu et les applications de recherche visuelle, mais peut ne pas convenir aux tâches nécessitant une analyse détaillée visuelle fine ou une expertise de domaine hautement spécialisée. Lorsque vous utilisez la fonction de représentation Matryoshka, tenez compte du compromis entre la réduction des dimensions et les performances. Si les intégrations à 64 dimensions maintiennent de bonnes performances, les applications critiques peuvent bénéficier de dimensions plus élevées.
Blogs qui mentionnent ce modèle
novembre 21, 2024 • 9 minutes lues
Jina CLIP v2 : Embeddings multilingues et multimodales pour le texte et les images
Jina-CLIP v2, un modèle d'embedding multimodal de 0,9B avec un support multilingue de 89 langues, une haute résolution d'image à 512x512, et des représentations Matryoshka.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
octobre 29, 2024 • 11 minutes lues
Au-delà de CLIP : Comment Jina-CLIP fait progresser la recherche multimodale
Découvrez comment Jina-CLIP améliore le modèle CLIP d'OpenAI avec une meilleure précision de recherche et des résultats plus diversifiés grâce à des embeddings texte-image unifiés.
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
juin 05, 2024 • 9 minutes lues
Jina CLIP v1 : Un véritable modèle d'embeddings multimodal pour texte et image
Le nouveau modèle d'embedding multimodal de Jina AI surpasse non seulement OpenAI CLIP dans la recherche texte-image, mais il constitue également un solide modèle d'embedding d'images et un modèle d'embedding de texte à la pointe de la technologie, le tout simultanément. Vous n'avez plus besoin de différents modèles pour différentes modalités.
Sofia Vasileva
Scott Martens
Susana Guzmán
Abstract 3D render of a neon blue and green grid pattern on a black background, creating a sense of depth.
septembre 27, 2024 • 15 minutes lues
Migration des embeddings Jina v2 vers v3
Nous avons rassemblé quelques conseils pour vous aider à migrer de Jina Embeddings v2 vers v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
août 30, 2024 • 10 minutes lues
Jina ColBERT v2 : Système de recherche par interaction tardive multilingue pour l'embedding et le reranking
Jina ColBERT v2 prend en charge 89 langues avec des performances de recherche supérieures, des dimensions de sortie contrôlées par l'utilisateur et une longueur de token de 8192.
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
Search Foundation
Lecteur
Intégrations
Reclasseur
Elastic Inference Service
open_in_new
Obtenir la clé API Jina
Limite de taux
Statut de l'API
Termes
Sécurité
termes et conditions
Confidentialité
Gérer les cookies
Ne vendez ni ne partagez mes informations personnelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Elastic © 2020-2026.
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.