Aperçu
jina-embeddings-v2-base-code est un modèle d'embedding de code de 161M paramètres qui mappe le code de programmation dans 30 langues vers un espace sémantique partagé de 768 dimensions. Avec une fenêtre de contexte de 8 192 tokens, il fut le premier modèle d'embedding Jina à prendre en charge la recherche de fonctions entières et de multi-fichiers sans troncature. Au moment de sa publication, il dominait neuf benchmarks CodeNetSearch sur quinze.
Méthodes
Le modèle utilise un encodeur basé sur le transformeur de 161M paramètres, entraîné sur des jeux de données de langages de programmation variés, avec un accent sur Python, JavaScript, Java, PHP, Go et Ruby. La fenêtre de contexte de 8 192 tokens (via des encodings positionnels ALiBi) permet de traiter des fonctions entières et de petits fichiers en une seule passe. L'entraînement a inclus un pré-entraînement contrastif sur des paires de code et de texte (descriptions en langage naturel appairées avec des implémentations de code), suivi d'un ajustement fin supervisé sur des jeux de données de recherche de code avec minage de négatifs difficiles. Les embeddings de 768 dimensions capturent à la fois la structure syntaxique et le sens sémantique, permettant l'appariement de code interlangues où le code fonctionnellement équivalent dans différentes langues mappe vers des régions voisines de l'espace d'embedding.
Performance
Au moment de sa publication, le modèle dominait neuf des quinze benchmarks CodeNetSearch, surpassant les modèles d'embedding de code de Microsoft et de Salesforce tout en maintenant une empreinte plus efficace de 307Mo. Son contexte de 8 192 tokens était 4 à 16 fois plus grand que celui des modèles d'embedding de code concurrents, permettant la recherche sur des fichiers entiers et des blocs de code complexes. La compréhension interlangues du code était une force particulière, rapprochant des extraits fonctionnellement équivalents à travers différents langages de programmation. En 2026, jina-code-embeddings-0.5b et jina-code-embeddings-1.5b remplacent ce modèle avec des backbones autoregressifs, un contexte de 32K et une précision de recherche nettement supérieure.
Conseils
Utilisez pour la recherche de code, la recherche de documentation et la réutilisation de code dans des bases de code monolingues ou interlangues. Pour les documents dépassant 8 192 tokens, implémentez le découpage (chunking) aux limites de fonction ou de classe. Le modèle s'intègre avec des bases de données vectorielles (Qdrant, Weaviate, MongoDB) et des frameworks RAG. Pour les nouveaux projets de recherche de code, préférez jina-code-embeddings-1.5b (1,5B paramètres, contexte de 32K, précision SOTA) ou jina-code-embeddings-0.5b (494M paramètres, adapté à l’edge). Une GPU compatible CUDA est recommandée pour la production. Meilleure performance sur Python, JavaScript, Java, PHP, Go et Ruby ; prend en charge 30+ langues avec une dégradation progressive.









