Aperçu
jina-embeddings-v2-base-es est un modèle d'embedding de texte bilingue de 161M paramètres pour l'espagnol et l'anglais, doté d'une fenêtre de contexte de 8 192 tokens et d'une sortie de 768 dimensions. Conçu pour la recherche interlingue sur les marchés hispanophones, il mappe le contenu sémantiquement équivalent en espagnol et en anglais vers un espace d'embedding partagé. Le modèle comble un manque critique : la plupart des modèles d'embedding de l'époque étaient centrés sur l'anglais, avec des performances en espagnol nettement dégradées.
Méthodes
Le modèle utilise un backbone basé sur BERT avec des encodings positionnels ALiBi bidirectionnels symétriques, 161M paramètres et un espace de sortie de 768 dimensions. L'entraînement a suivi un processus en trois étapes : (1) pré-entraînement sur des corpus parallèles espagnol-anglais, (2) ajustement fin contrastif avec minage de négatifs difficiles sur des paires de phrases curées, et (3) alignement interlingue pour garantir que les représentations en espagnol et en anglais du même concept se regroupent ensemble. Le mécanisme ALiBi permet la fenêtre de contexte de 8 192 tokens sans embeddings positionnels appris, permettant au modèle d'extrapoler au-delà de sa longueur d'entraînement de 512 tokens. Le pooling moyen produit le vecteur d'embedding final.
Performance
Le modèle a surpassé des modèles multilingues nettement plus volumineux (E5, BGE-M3) sur les tâches de recherche espagnol-anglais, ne représentant que 15 à 30 % de leur taille. Il a montré une performance solide sur les sous-tâches MTEB en espagnol, notamment en recherche et en regroupement. La fenêtre de contexte de 8 192 tokens a offert une performance constante sur des documents de plusieurs pages où la plupart des modèles concurrents requéraient du découpage. En 2026, jina-embeddings-v5-text-small remplace ce modèle, offrant 89 langues, un contexte de 32K et des adaptateurs LoRA spécifiques aux tâches. Le modèle v2-base-es reste une option économique pour les pipelines dédiés espagnol-anglais.
Conseils
Idéal pour la recherche bilingue espagnol-anglais, la recommandation de contenu et l'analyse interlingue de documents. Pour les documents dépassant 8 192 tokens, utilisez le découpage sémantique ou le paramètre `late_chunking via l'API Jina. Le modèle s'intègre avec les principales bases de données vectorielles et les frameworks RAG. Pour les nouveaux projets exigeant une couverture multilingue au-delà de l'espagnol-anglais, un contexte de 32K ou une optimisation spécifique aux tâches, préférez jina-embeddings-v5-text-small`. Une GPU compatible CUDA est recommandée pour la production. Le texte d'entrée doit être en espagnol ou en anglais ; une entrée de langues mélangées est prise en charge mais la performance est optimisée pour les deux langues entraînées.




