Graphique d'E/S

Texte

jina-embedding-b-en-v1

Vecteur

Frontière de Pareto
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Paramètres (log)Spearman
Ce modèle
Sur la frontière
Jina AI
Autres
MTEB English · sts
79.93
Paramètres
110M
Rang par score
28 / 39
Frontière de Pareto
Derrière
Choisissez les modèles à comparer
Publications (1)

Aperçu

jina-embedding-b-en-v1 fut le premier modèle d'embedding de texte publié par Jina AI : un encodeur bidirectionnel de 110M paramètres qui mappe le texte anglais dans des vecteurs de 768 dimensions. Conçu pour la recherche sémantique, la comparaison de similarité et la recommandation de contenu à une époque où le contexte de 512 tokens était le standard de l'industrie, il a établi l'entrée de Jina dans l'espace des embeddings open source. Le modèle est aujourd'hui legacy et a été surpassé par les familles v2 et v3, qui prennent en charge des contextes de 8K+ tokens et une entrée multilingue.

Méthodes

Le modèle utilise une architecture T5-encoder avec un pooling moyen pour produire des représentations de longueur fixe de 768 dimensions. L'entraînement a suivi une recette contrastive en deux phases sur le jeu de données Linnaeus-Clean (385M paires de phrases filtrées parmi 1,6B candidats) : d'abord, une perte InfoNCE sur des paires de texte positives pour apprendre l'alignement sémantique ; ensuite, une perte de triplets pour affiner la discrimination entre des textes similaires mais sémantiquement distincts. Une décision de conception clé fut la stratégie de pooling moyen, qui moyenne les représentations au niveau des tokens pour produire un unique vecteur captant le sens global de la phrase. La fenêtre de contexte de 512 tokens était standard pour son époque mais limite l'utilité du modèle pour les applications à documents longs.

Performance

Sur STS12, le modèle a atteint un score de corrélation de 0,751, dépassant all-mpnet-base-v2 et all-minilm-l6-v2 au moment de sa publication. Il a montré une performance solide sur les tâches standards d'embedding de phrases en anglais tout en maintenant des temps d'inférence rapides adaptés à la production. Sa fenêtre de contexte de 512 tokens et son focus uniquement en anglais l'ont rendu inadéquat pour les charges de travail à documents longs et multilingues devenues standard d'ici 2025. Le modèle a été surpassé par jina-embeddings-v2-base-en (contexte de 8K, ALiBi bidirectionnel) et jina-embeddings-v3 (570M paramètres, 89 langues, adaptateurs LoRA spécifiques aux tâches).

Conseils

Ce modèle est legacy et ne doit pas être utilisé pour de nouveaux projets. En cas de migration depuis jina-embedding-b-en-v1, passez à jina-embeddings-v5-text-small pour les charges de travail actuelles — il prend en charge un contexte de 32K tokens, 89 langues et des adaptateurs LoRA spécifiques aux tâches. Pour les besoins d'embedding spécifiques au code, utilisez jina-code-embeddings-1.5b. Le modèle requiert du matériel compatible CUDA pour une performance optimale et accepte des entrées jusqu'à 512 tokens. Il n'est pas adapté au contenu multilingue, aux longs documents ou aux applications centrées sur le code.