Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reranker
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
warning
Ce modèle est obsolète pour les modèles plus récents.
Embeddings
Licence Apache 2.0
open_in_new Article de lancement

jina-embeddings-v2-base-es

Embeddings bilingues espagnol-anglais avec performances SOTA
Licence
Apache-2.0
Date de sortie
calendar_month
2024-02-14
Saisie
abc
Texte
arrow_forward
Sortir
more_horiz
Vecteur
Chunking tardif help_outline
check_circle
Yes
Détails du modèle
Paramètres: 161M
Longueur du token d'entrée: 8K
Dimension de sortie: 768
Modèle de base help_outline
jina-bert-v2-base-es
Langues enseignées help_outline
2 langues
Modèles associés
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
Disponible via
API Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Graphique d'E/S

Texte

jina-embeddings-v2-base-es

Vecteur

Frontière de Pareto help_outline
workspace_premium
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Paramètres (log)Spearman
Ce modèle
Sur la frontière
Jina AI
Autres
MTEB English · sts
83.50
Paramètres
161M
Rang par score
11 / 39
Frontière de Pareto
Sur elle
Distribution des valeurshelp_outline
AUC 0.8383
Corpus
Paires de traduction
Recherche documentaire
0.6830.000.200.400.600.80
Liées17.6%
Négatif difficile3.0%
Non liées0.8%
Seuils recommandés
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
équilibré · 0.365
AUC
0.8383
Plafond de bruit
0.774
Décrochage du rappel
0.163
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.160.000.17
σ 0.0361 · 183k valeurs
Géométrie des embeddingshelp_outline
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.326
Dim. effectives
51 / 768
Paires de langueshelp_outline
de-ruen-deen-koen-zhja-ko
Écart du seuil entre les paires : 0.315
Choisissez les modèles à comparer
Publications (1)
arXiv
février 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Aperçu

jina-embeddings-v2-base-es est un modèle d'embedding de texte bilingue de 161M paramètres pour l'espagnol et l'anglais, doté d'une fenêtre de contexte de 8 192 tokens et d'une sortie de 768 dimensions. Conçu pour la recherche interlingue sur les marchés hispanophones, il mappe le contenu sémantiquement équivalent en espagnol et en anglais vers un espace d'embedding partagé. Le modèle comble un manque critique : la plupart des modèles d'embedding de l'époque étaient centrés sur l'anglais, avec des performances en espagnol nettement dégradées.

Méthodes

Le modèle utilise un backbone basé sur BERT avec des encodings positionnels ALiBi bidirectionnels symétriques, 161M paramètres et un espace de sortie de 768 dimensions. L'entraînement a suivi un processus en trois étapes : (1) pré-entraînement sur des corpus parallèles espagnol-anglais, (2) ajustement fin contrastif avec minage de négatifs difficiles sur des paires de phrases curées, et (3) alignement interlingue pour garantir que les représentations en espagnol et en anglais du même concept se regroupent ensemble. Le mécanisme ALiBi permet la fenêtre de contexte de 8 192 tokens sans embeddings positionnels appris, permettant au modèle d'extrapoler au-delà de sa longueur d'entraînement de 512 tokens. Le pooling moyen produit le vecteur d'embedding final.

Performance

Le modèle a surpassé des modèles multilingues nettement plus volumineux (E5, BGE-M3) sur les tâches de recherche espagnol-anglais, ne représentant que 15 à 30 % de leur taille. Il a montré une performance solide sur les sous-tâches MTEB en espagnol, notamment en recherche et en regroupement. La fenêtre de contexte de 8 192 tokens a offert une performance constante sur des documents de plusieurs pages où la plupart des modèles concurrents requéraient du découpage. En 2026, jina-embeddings-v5-text-small remplace ce modèle, offrant 89 langues, un contexte de 32K et des adaptateurs LoRA spécifiques aux tâches. Le modèle v2-base-es reste une option économique pour les pipelines dédiés espagnol-anglais.

Conseils

Idéal pour la recherche bilingue espagnol-anglais, la recommandation de contenu et l'analyse interlingue de documents. Pour les documents dépassant 8 192 tokens, utilisez le découpage sémantique ou le paramètre `late_chunking via l'API Jina. Le modèle s'intègre avec les principales bases de données vectorielles et les frameworks RAG. Pour les nouveaux projets exigeant une couverture multilingue au-delà de l'espagnol-anglais, un contexte de 32K ou une optimisation spécifique aux tâches, préférez jina-embeddings-v5-text-small`. Une GPU compatible CUDA est recommandée pour la production. Le texte d'entrée doit être en espagnol ou en anglais ; une entrée de langues mélangées est prise en charge mais la performance est optimisée pour les deux langues entraînées.

Blogs qui mentionnent ce modèle
avril 29, 2024 • 7 minutes lues
Jina Embeddings et Reranker sur Azure : Solutions d'IA évolutives et prêtes pour l'entreprise
Les Embeddings et Rerankers de Jina sont désormais disponibles sur Azure Marketplace. Les entreprises qui privilégient la confidentialité et la sécurité peuvent maintenant facilement intégrer les modèles de pointe de Jina AI directement dans leur écosystème Azure existant.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
février 14, 2024 • 4 minutes lues
On Parle Espagnol Ici : Embeddings Espagnol-Anglais de Haute Qualité et Contexte de 8k
Le nouveau modèle d'embeddings bilingue espagnol-anglais de Jina AI apporte l'état de l'art en matière d'IA à un demi-milliard d'hispanophones.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reranker
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.