Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
warning
Ce modèle est obsolète pour les modèles plus récents.
Intégrations
Licence Apache 2.0
open_in_new Publication de publication

jina-embeddings-v2-base-es

Intégrations bilingues espagnol-anglais avec performances SOTA
Licence
Apache-2.0
Date de sortie
calendar_month
2024-02-14
Saisir
abc
Texte
arrow_forward
Sortir
more_horiz
Vecteur
Chunkage tardif help_outline
check_circle
Yes
Détails du modèle
Paramètres: 161M
Longueur du jeton d'entrée: 8K
Dimension de sortie: 768
Modèle de base help_outline
open_in_new
jina-embeddings-v2-base-en
Langues enseignées help_outline
2 langues
Modèles associés
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
Disponible via
API Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Graphique d'E/S

Texte

jina-embeddings-v2-base-es

Vecteur

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
Distribution des valeurshelp_outline
AUC 0.8383
Corpus
Paires de traduction
Recherche documentaire
0.6830.000.200.400.600.80
Liées17.6%
Négatif difficile3.0%
Non liées0.8%
Seuils recommandés
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
équilibré · 0.365
AUC
0.8383
Plafond de bruit
0.774
Décrochage du rappel
0.163
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.160.000.17
σ 0.0361 · 183k valeurs
Géométrie des embeddingshelp_outline
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.326
Dim. effectives
51 / 768
Paires de langueshelp_outline
de-ruen-deen-koen-zhja-ko
Écart du seuil entre les paires : 0.315
Choisissez les modèles à comparer
Publications (1)
arXiv
février 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Aperçu

Jina Embeddings v2 Base Spanish est un modèle d'intégration de texte bilingue révolutionnaire qui répond au défi crucial de la recherche et de l'analyse d'informations multilingues entre le contenu espagnol et anglais. Contrairement aux modèles multilingues traditionnels qui ont souvent tendance à privilégier des langues spécifiques, ce modèle offre des performances véritablement équilibrées en espagnol et en anglais, ce qui le rend indispensable pour les organisations opérant sur les marchés hispanophones ou gérant du contenu bilingue. La caractéristique la plus remarquable du modèle est sa capacité à générer des intégrations alignées géométriquement : lorsque des textes en espagnol et en anglais expriment la même signification, leurs représentations vectorielles se regroupent naturellement dans l'espace d'intégration, ce qui permet une recherche et une analyse interlingues transparentes.

Méthodes

Au cœur de ce modèle se trouve une architecture innovante basée sur l'ALiBi (Attention with Linear Biases) bidirectionnel symétrique, une approche sophistiquée qui permet de traiter des séquences allant jusqu'à 8 192 jetons sans intégrations positionnelles traditionnelles. Le modèle utilise une architecture BERT modifiée avec 161 millions de paramètres, incorporant des unités linéaires fermées (GLU) et des techniques de normalisation de couche spécialisées. L'entraînement suit un processus en trois étapes : pré-entraînement initial sur un corpus de texte massif, suivi d'un réglage fin avec des paires de textes soigneusement sélectionnées, et enfin, un entraînement négatif dur pour améliorer la discrimination entre des contenus similaires mais sémantiquement distincts. Cette approche, combinée à des intégrations en 768 dimensions, permet au modèle de capturer des relations sémantiques nuancées tout en maintenant l'efficacité informatique.

Performance

Dans des évaluations comparatives complètes, le modèle démontre des capacités exceptionnelles, notamment dans les tâches de recherche interlinguistiques où il surpasse des modèles multilingues nettement plus volumineux comme E5 et BGE-M3, bien qu'il ne représente que 15 à 30 % de leur taille. Le modèle atteint des performances supérieures dans les tâches de recherche et de clustering, montrant une force particulière dans la mise en correspondance de contenus sémantiquement équivalents entre les langues. Lorsqu'il est testé sur le benchmark MTEB, il présente des performances robustes dans diverses tâches, notamment la classification, le clustering et la similarité sémantique. La fenêtre de contexte étendue de 8 192 jetons s'avère particulièrement précieuse pour le traitement de documents longs, affichant des performances constantes même avec des documents couvrant plusieurs pages - une capacité qui manque à la plupart des modèles concurrents.

Conseils

Pour utiliser efficacement ce modèle, les organisations doivent garantir l'accès à une infrastructure GPU compatible CUDA pour des performances optimales. Le modèle s'intègre parfaitement aux principales bases de données vectorielles et aux frameworks RAG, notamment MongoDB, Qdrant, Weaviate et Haystack, ce qui le rend facilement déployable dans les environnements de production. Il excelle dans des applications telles que la recherche de documents bilingues, les systèmes de recommandation de contenu et l'analyse de documents multilingues. Bien que le modèle fasse preuve d'une polyvalence impressionnante, il est particulièrement optimisé pour les scénarios bilingues espagnol-anglais et peut ne pas être le meilleur choix pour les applications monolingues ou les scénarios impliquant d'autres paires de langues. Pour des résultats optimaux, les textes d'entrée doivent être correctement formatés en espagnol ou en anglais, bien que le modèle gère efficacement le contenu multilingue. Le modèle prend en charge le réglage fin pour les applications spécifiques à un domaine, mais cela doit être abordé en tenant soigneusement compte de la qualité et de la distribution des données de formation.
Blogs qui mentionnent ce modèle
avril 29, 2024 • 7 minutes lues
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
février 14, 2024 • 4 minutes lues
Aquí Se Habla Español: Top-Quality Spanish-English Embeddings and 8k Context
Jina AI's new bilingual Spanish-English embedding model brings the state-of-the-art in AI to half a billion Spanish speakers.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.