Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
warning
Ce modèle est obsolète pour les modèles plus récents.
Embeddings
Licence Apache 2.0
open_in_new Article de lancement

jina-embeddings-v2-base-en

À égalité avec text-embedding-ada002 d'OpenAI
Licence
Apache-2.0
Date de sortie
calendar_month
2023-10-28
Saisie
abc
Texte
arrow_forward
Sortir
more_horiz
Vecteur
Chunking tardif help_outline
check_circle
Yes
Détails du modèle
Paramètres: 137M
Longueur du token d'entrée: 8K
Dimension de sortie: 768
Langues enseignées help_outline
1 langues
Modèles associés
link
jina-embedding-b-en-v1
link
jina-embeddings-v3
Disponible via
API Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Graphique d'E/S

Texte

jina-embeddings-v2-base-en

Vecteur

Frontière de Paretohelp_outline
MTEB English
RTEB public
LongEmbed
LoCo
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v2-base…Paramètres (log)nDCG@10
Ce modèle
Sur la frontière
Jina AI
Autres
LongEmbed
58.12
Paramètres
137M
Rang par score
18 / 69
Frontière de Pareto
Derrière
Distribution des valeurshelp_outline
AUC 0.8376
Corpus
Paires de traduction
Recherche documentaire
0.8500.600.700.800.90
Liées26.9%
Négatif difficile2.7%
Non liées1.1%
Seuils recommandés
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
équilibré · 0.762
AUC
0.8376
Plafond de bruit
0.893
Décrochage du rappel
0.691
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.14-0.000.14
σ 0.0361 · 183k valeurs
Géométrie des embeddingshelp_outline
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.751
Dim. effectives
59 / 768
Choisissez les modèles à comparer
Publications (1)
arXiv
octobre 30, 2023
Jina Embeddings 2: 8192-Token General-Purpose Text Embeddings for Long Documents

Aperçu

jina-embeddings-v2-base-en est un modèle d'embedding de texte anglais de 137M paramètres avec une fenêtre de contexte de 8 192 tokens — 16 fois la limite standard de 512 tokens de son époque. Construit sur un backbone BERT-small avec ALiBi bidirectionnelle symétrique (Attention with Linear Biases), c'était le premier embedding Jina open source à traiter nativement des documents longs sans troncature ni découpage. Il produit des vecteurs de 768 dimensions et reste un choix solide pour la recherche uniquement en anglais lorsque les fonctions multilingues ou de long contexte de v3/v5 ne sont pas nécessaires.

Méthodes

L'architecture associe un transformeur BERT-small (12 couches, 12 têtes d'attention, 768 dimensions cachées) à des encodings positionnels ALiBi bidirectionnels symétriques. ALiBi remplace les embeddings positionnels appris par un biais d'attention décroissant linéairement, permettant au modèle d'extrapoler bien au-delà de sa longueur d'entraînement de 512 tokens jusqu'à 8 192 tokens sans dégradation des performances. L'entraînement a suivi un pipeline en deux étapes : pré-entraînement sur C4, puis ajustement fin sur la collection curée de Jina de 40+ jeux de données de paires de phrases spécialisées, avec minage de négatifs difficiles. L'attention bidirectionnelle symétrique garantit que chaque token prête attention à la fois au contexte précédent et suivant, produisant des représentations capturant le sens global de la phrase. Le pooling moyen sur toutes les représentations de tokens produit l'embedding final de 768 dimensions.

Performance

Au moment de sa publication, le modèle a surpassé text-embedding-ada-002 d'OpenAI sur plusieurs sous-tâches MTEB en anglais : classification (73,45 % vs 70,93 %), réordonnancement (85,38 % vs 84,89 %), recherche (56,98 % vs 56,32 %) et résumé (31,6 % vs 30,8 %). Son contexte de 8 192 tokens fut un avantage considérable face aux modèles concurrents limités à 512–2 048 tokens, permettant la recherche au niveau document sans découpage. L'empreinte compacte de 307Mo le rendit déployable sur des GPU de grand public. En 2026, jina-embeddings-v5-text-small (677M paramètres, contexte de 32K, adaptateurs LoRA spécifiques aux tâches) le surpasse pour la plupart des charges de travail de production, mais il reste pertinent pour les pipelines légers uniquement en anglais.

Conseils

Utilisez ce modèle pour la recherche uniquement en anglais lorsque la fenêtre de contexte de 8K est suffisante et que des adaptateurs multilingues ou spécifiques aux tâches ne sont pas requis. Pour les documents dépassant 8 192 tokens, appliquez le découpage sémantique avant l'embedding. Le modèle s'intègre avec les principales bases de données vectorielles (Qdrant, Weaviate, MongoDB Atlas, Milvus) et les frameworks RAG (LangChain, LlamaIndex, Haystack). Pour les nouveaux projets nécessitant un support multilingue, un contexte de 32K ou une optimisation spécifique aux tâches, préférez jina-embeddings-v5-text-small. Une GPU compatible CUDA est recommandée pour le débit en production ; l'inférence CPU est possible mais nettement plus lente.

Blogs qui mentionnent ce modèle
décembre 17, 2024 • 12 minutes lues
Text Embeddings Fail to Capture Word Order and How to Fix It
Text embedding models struggle with capturing subtle linguistic nuances like word order, directional relationships, temporal sequences, causal connections, comparisons, and negation. Understanding these challenges is key to improving model performance.
Bo Wang
Alex C-G
Three abstract figures in white, gray, and pink on matching cubes placed on a colorful checkered surface against a green back
octobre 25, 2024 • 19 minutes lues
Finding Optimal Breakpoints in Long Documents Using Small Language Models
We trained three small language models to better segment long documents into chunks, and here are the key lessons we learned.
Andrei Ungureanu
Alex C-G
A pattern of yellow file icons on a blue background with one icon displaying a smiley face creating an emotive contrast.
octobre 15, 2024 • 9 minutes lues
Fact-Checking with New Grounding API in Jina Reader
With the new g.jina.ai, you can easily ground statements to reduce LLM hallucinations or improve the integrity of human-written content.
Jina AI
Jina developer interface showing "Jina AI was founded in 2020" with controls labeled true and false, and web address on top.
septembre 27, 2024 • 15 minutes lues
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
septembre 18, 2024 • 10 minutes lues
Jina Embeddings v3: A Frontier Multilingual Embedding Model
jina-embeddings-v3 is a frontier multilingual text embedding model with 570M parameters and 8192 token-length, outperforming the latest proprietary embeddings from OpenAI and Cohere on MTEB.
Jina AI
Dynamic image showing the characters "V3" formed by bright green dots varying in size on a black background.
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reclasseur
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.