Graphique d'E/S

Code

jina-embeddings-v2-base-code

Tâche

Vecteur

Frontière de Pareto
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderParamètres (log)nDCG@10
Ce modèle
Sur la frontière
Jina AI
Autres
CoIR
52.24
Paramètres
161M
Rang par score
19 / 31
Frontière de Pareto
Derrière
Distribution des valeurs
AUC 0.8156
Corpus
Paires de traduction
Recherche documentaire
Code
0.7500.000.200.400.600.80
Liées10.9%
Négatif difficile1.5%
Non liées1.0%
Seuils recommandés
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
équilibré · 0.369
AUC
0.8156
Plafond de bruit
0.805
Décrochage du rappel
0.204
Paires mesurées
119 / 11k
Composantes des vecteurs
-0.160.040.25
σ 0.0361 · 183k valeurs
Géométrie des embeddings
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.404
Dim. effectives
43 / 768
Choisissez les modèles à comparer

Aperçu

jina-embeddings-v2-base-code est un modèle d'embedding de code de 161M paramètres qui mappe le code de programmation dans 30 langues vers un espace sémantique partagé de 768 dimensions. Avec une fenêtre de contexte de 8 192 tokens, il fut le premier modèle d'embedding Jina à prendre en charge la recherche de fonctions entières et de multi-fichiers sans troncature. Au moment de sa publication, il dominait neuf benchmarks CodeNetSearch sur quinze.

Méthodes

Le modèle utilise un encodeur basé sur le transformeur de 161M paramètres, entraîné sur des jeux de données de langages de programmation variés, avec un accent sur Python, JavaScript, Java, PHP, Go et Ruby. La fenêtre de contexte de 8 192 tokens (via des encodings positionnels ALiBi) permet de traiter des fonctions entières et de petits fichiers en une seule passe. L'entraînement a inclus un pré-entraînement contrastif sur des paires de code et de texte (descriptions en langage naturel appairées avec des implémentations de code), suivi d'un ajustement fin supervisé sur des jeux de données de recherche de code avec minage de négatifs difficiles. Les embeddings de 768 dimensions capturent à la fois la structure syntaxique et le sens sémantique, permettant l'appariement de code interlangues où le code fonctionnellement équivalent dans différentes langues mappe vers des régions voisines de l'espace d'embedding.

Performance

Au moment de sa publication, le modèle dominait neuf des quinze benchmarks CodeNetSearch, surpassant les modèles d'embedding de code de Microsoft et de Salesforce tout en maintenant une empreinte plus efficace de 307Mo. Son contexte de 8 192 tokens était 4 à 16 fois plus grand que celui des modèles d'embedding de code concurrents, permettant la recherche sur des fichiers entiers et des blocs de code complexes. La compréhension interlangues du code était une force particulière, rapprochant des extraits fonctionnellement équivalents à travers différents langages de programmation. En 2026, jina-code-embeddings-0.5b et jina-code-embeddings-1.5b remplacent ce modèle avec des backbones autoregressifs, un contexte de 32K et une précision de recherche nettement supérieure.

Conseils

Utilisez pour la recherche de code, la recherche de documentation et la réutilisation de code dans des bases de code monolingues ou interlangues. Pour les documents dépassant 8 192 tokens, implémentez le découpage (chunking) aux limites de fonction ou de classe. Le modèle s'intègre avec des bases de données vectorielles (Qdrant, Weaviate, MongoDB) et des frameworks RAG. Pour les nouveaux projets de recherche de code, préférez jina-code-embeddings-1.5b (1,5B paramètres, contexte de 32K, précision SOTA) ou jina-code-embeddings-0.5b (494M paramètres, adapté à l’edge). Une GPU compatible CUDA est recommandée pour la production. Meilleure performance sur Python, JavaScript, Java, PHP, Go et Ruby ; prend en charge 30+ langues avec une dégradation progressive.

Blogs qui mentionnent ce modèle
avril 08, 2025 • 21 minutes lues
jina-reranker-m0 : Reclasseur multilingue et multimodal de documents
Présentation de jina-reranker-m0, notre nouveau réordonnanceur multimodal multilingue pour la recherche de documents visuels, offrant des performances à l'état de l'art sur la recherche de longs documents multilingues et de code source.
septembre 27, 2024 • 15 minutes lues
Migration des embeddings Jina v2 vers v3
Nous avons rassemblé quelques conseils pour vous aider à migrer de Jina Embeddings v2 vers v3.
avril 29, 2024 • 7 minutes lues
Jina Embeddings et Reranker sur Azure : Solutions d'IA évolutives et prêtes pour l'entreprise
Les Embeddings et Rerankers de Jina sont désormais disponibles sur Azure Marketplace. Les entreprises qui privilégient la confidentialité et la sécurité peuvent maintenant facilement intégrer les modèles de pointe de Jina AI directement dans leur écosystème Azure existant.
mars 25, 2024 • 21 minutes lues
IA cloud de nouvelle génération : Jina Embeddings et Rerankers sur Amazon SageMaker
Apprenez à utiliser les modèles Jina Embeddings et Reranking dans une application IA full-stack sur AWS, en utilisant uniquement des composants disponibles dans Amazon SageMaker et l'AWS Marketplace.
février 05, 2024 • 4 minutes lues
Optimisez vos recherches de code avec les nouveaux embeddings Jina Code
Le nouveau 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲 est optimisé pour la recherche de code et de docstring. Ce modèle puissant prend en charge les recherches entre l'anglais et 30 langages de programmation largement utilisés, tous avec une longueur de contexte de 8192 et des performances SOTA.