Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
warning
Ce modèle est obsolète pour les modèles plus récents.
Intégrations
Licence Apache 2.0

jina-embedding-b-en-v1

La première version du modèle Jina Embedding, l'OG.
Licence
Apache-2.0
Date de sortie
calendar_month
2023-06-17
Saisir
abc
Texte
arrow_forward
Sortir
more_horiz
Vecteur
Détails du modèle
Paramètres: 110M
Longueur du jeton d'entrée: 512
Dimension de sortie: 768
Modèle de base help_outline
open_in_new
T5-Base Encoder
Langues enseignées help_outline
1 langues
Modèles associés
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
Disponible via
Hugging Face
Air-gapped
Graphique d'E/S

Texte

jina-embedding-b-en-v1

Vecteur

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
44.03
Parameters
110M
Rank by score
28 / 39
Pareto front
Behind it
Choisissez les modèles à comparer
Publications (1)
EMNLP 2023
juillet 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models

Aperçu

Jina Embedding B v1 est un modèle d'intégration de texte spécialisé conçu pour transformer le texte anglais en représentations numériques de grande dimension tout en préservant le sens sémantique. Le modèle répond au besoin critique d'intégrations de texte efficaces et précises dans les environnements de production, particulièrement utile pour les organisations nécessitant un équilibre entre efficacité de calcul et qualité d'intégration. Avec ses 110 millions de paramètres générant des intégrations de 768 dimensions, il constitue une solution pratique pour les équipes mettant en œuvre des systèmes de recherche sémantique, de regroupement de documents ou de recommandation de contenu sans nécessiter de ressources de calcul importantes.

Méthodes

Le modèle utilise une architecture basée sur un encodeur T5 améliorée avec un pooling moyen pour générer des représentations de longueur fixe. Formé sur l'ensemble de données Linnaeus-Clean soigneusement organisé, qui contient 385 millions de paires de phrases de haute qualité filtrées à partir de 1,6 milliard de paires initiales, le modèle a subi un processus de formation en deux phases. La première phase a utilisé l'apprentissage contrastif avec perte InfoNCE sur les paires de textes, tandis que la deuxième phase a incorporé la formation de triplets pour affiner la capacité du modèle à distinguer les contenus similaires des contenus différents. Cette approche de formation innovante, combinée à un filtrage rigoureux des données, y compris la détection de la langue et la vérification de la cohérence, permet au modèle de capturer efficacement des relations sémantiques nuancées.

Performance

Lors d'évaluations en conditions réelles, Jina Embedding B v1 démontre des capacités impressionnantes, notamment dans les tâches de similarité textuelle sémantique. Le modèle atteint des performances de pointe sur STS12 avec un score de 0,751, surpassant les modèles établis comme all-mpnet-base-v2 et all-minilm-l6-v2. Il affiche de solides performances dans divers tests tout en maintenant des temps d'inférence efficaces. Cependant, les utilisateurs doivent noter que le modèle est spécifiquement optimisé pour le contenu en anglais et peut ne pas fonctionner de manière optimale sur des tâches multilingues ou spécifiques au code. Le modèle a depuis été remplacé par jina-embeddings-v2-base-en et jina-embeddings-v3, qui offrent des performances améliorées dans une gamme plus large de cas d'utilisation.

Conseils

Pour un déploiement optimal, le modèle nécessite un GPU compatible CUDA, bien que sa taille modérée permette une inférence efficace sur du matériel standard. Le modèle accepte des séquences d'entrée d'une longueur maximale de 512 jetons et est particulièrement adapté aux environnements de production où une génération d'intégration cohérente et fiable est cruciale. Il fonctionne mieux sur le contenu en anglais et est idéal pour des applications telles que la recherche sémantique, la comparaison de similarité de documents et les systèmes de recommandation de contenu. Les équipes doivent envisager d'utiliser les nouvelles versions v2 ou v3 pour les nouveaux projets, car elles offrent des performances améliorées et une prise en charge linguistique plus large. Le modèle n'est pas recommandé pour les tâches nécessitant une compréhension multilingue ou des connaissances spécialisées dans un domaine en dehors du texte anglais général.
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.