Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
warning
Ce modèle est obsolète pour les modèles plus récents.
Intégrations
Licence Apache 2.0
open_in_new Publication de publication

jina-embeddings-v2-base-code

Optimisé pour la recherche de code et de docstring
Licence
Apache-2.0
Date de sortie
calendar_month
2024-02-05
Saisir
abc
Texte (code)
arrow_forward
Sortir
more_horiz
Vecteur
Chunkage tardif help_outline
check_circle
Yes
Détails du modèle
Paramètres: 137M
Longueur du jeton d'entrée: 8K
Dimension de sortie: 768
Modèle de base help_outline
open_in_new
jina-embeddings-v2-base-en
Langues enseignées help_outline
1 langues
Modèles associés
link
jina-embeddings-v2-base-en
Disponible via
API Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Graphique d'E/S

Code

jina-embeddings-v2-base-code

Tâche

Vecteur

Pareto fronthelp_outline
CoIR
CoIR · appsretrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderParameters (log)nDCG@10
This model
On the front
Jina AI
Other
CoIR
52.24
Parameters
161M
Rank by score
19 / 31
Pareto front
Behind it
Distribution des valeurshelp_outline
AUC 0.8156
Corpus
Paires de traduction
Recherche documentaire
Code
0.7500.000.200.400.600.80
Liées10.9%
Négatif difficile1.5%
Non liées1.0%
Seuils recommandés
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
équilibré · 0.369
AUC
0.8156
Plafond de bruit
0.805
Décrochage du rappel
0.204
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.160.040.25
σ 0.0361 · 183k valeurs
Géométrie des embeddingshelp_outline
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.404
Dim. effectives
43 / 768
Choisissez les modèles à comparer

Aperçu

Jina Embeddings v2 Base Code relève un défi crucial dans le développement de logiciels modernes : naviguer et comprendre efficacement de grandes bases de code. Pour les équipes de développement qui ont du mal à découvrir et à documenter le code, ce modèle transforme la façon dont les développeurs interagissent avec le code en permettant la recherche en langage naturel dans 30 langages de programmation. Contrairement aux outils de recherche de code traditionnels qui s'appuient sur une correspondance de modèles exacte, ce modèle comprend la signification sémantique derrière le code, permettant aux développeurs de trouver des extraits de code pertinents à l'aide de descriptions en anglais simple. Cette capacité est particulièrement précieuse pour les équipes qui gèrent de grandes bases de code héritées, les développeurs qui intègrent de nouveaux projets ou les organisations qui cherchent à améliorer les pratiques de réutilisation et de documentation du code.

Méthodes

Le modèle atteint ses performances impressionnantes grâce à une architecture spécialisée conçue spécifiquement pour la compréhension du code. À la base, il utilise un réseau neuronal basé sur un transformateur avec 161 millions de paramètres, formés sur divers ensembles de données de langage de programmation mettant l'accent sur six langages principaux : Python, JavaScript, Java, PHP, Go et Ruby. Ce qui rend cette architecture unique est sa fenêtre de contexte étendue de 8 192 jetons, lui permettant de traiter des fonctions entières ou plusieurs fichiers à la fois tout en conservant la compréhension sémantique. Le modèle génère des intégrations denses de 768 dimensions qui capturent à la fois la structure syntaxique et la signification sémantique du code, lui permettant de comprendre les relations entre différents segments de code même lorsqu'ils utilisent des modèles de programmation ou une syntaxe différents pour atteindre le même objectif.

Performance

Lors de tests en conditions réelles, Jina Embeddings v2 Base Code démontre des capacités exceptionnelles, en tête du peloton dans neuf des quinze tests cruciaux de CodeNetSearch. Comparé aux modèles de géants du secteur comme Microsoft et Salesforce, il atteint des performances supérieures tout en conservant une empreinte plus efficace. Le modèle excelle particulièrement dans la compréhension de code interlinguistique, en faisant correspondre avec succès des extraits de code fonctionnellement équivalents dans différents langages de programmation. Sa fenêtre de contexte de 8 192 jetons s'avère particulièrement précieuse pour les fonctions volumineuses et les fichiers de code complexes, surpassant considérablement les modèles traditionnels qui ne gèrent généralement que quelques centaines de jetons. L'efficacité du modèle est évidente dans sa taille compacte de 307 Mo (non quantifiée), permettant une inférence rapide tout en maintenant une grande précision dans les tâches de recherche et de similarité de code.

Conseils

Pour déployer efficacement Jina Embeddings v2 Base Code, les équipes doivent prendre en compte plusieurs aspects pratiques. Le modèle s'intègre parfaitement aux bases de données vectorielles populaires telles que MongoDB, Qdrant et Weaviate, ce qui facilite la création de systèmes de recherche de code évolutifs. Pour des performances optimales, implémentez un prétraitement de code approprié pour gérer la limite de 8 192 tokens, qui s'adapte généralement à la plupart des définitions de fonctions et de classes. Bien que le modèle prenne en charge 30 langages de programmation, il affiche les meilleures performances dans les six langages principaux : Python, JavaScript, Java, PHP, Go et Ruby. Les équipes doivent envisager d'utiliser le traitement par lots pour l'indexation de code à grande échelle afin d'optimiser les performances. La compatibilité RAG du modèle le rend particulièrement efficace pour les tâches automatisées de génération de documentation et de compréhension de code, bien que les équipes doivent mettre en œuvre des stratégies de segmentation appropriées pour les bases de code très volumineuses. Pour les déploiements en production, envisagez d'utiliser le point de terminaison AWS SageMaker pour l'inférence gérée et implémentez des stratégies de mise en cache appropriées pour optimiser les performances des requêtes.
Blogs qui mentionnent ce modèle
avril 08, 2025 • 21 minutes lues
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
septembre 27, 2024 • 15 minutes lues
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
avril 29, 2024 • 7 minutes lues
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
mars 25, 2024 • 21 minutes lues
Next-Level Cloud AI: Jina Embeddings and Rerankers on Amazon SageMaker
Learn to use Jina Embeddings and Reranking models in a full-stack AI application on AWS, using only components available in Amazon SageMaker and the AWS Marketplace.
Scott Martens
Saahil Ognawala
Abstract image with colorful wavy background featuring AWS, Embeddings, and Reranker logos.
février 05, 2024 • 4 minutes lues
Elevate Your Code Search with New Jina Code Embeddings
New 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲 is optimized for code & docstring search. This powerful model supports searches between English and 30 widely-used programming languages, all with 8192 context length and SOTA performance.
Jina AI
Abstract image with concentric circles in purple and green, featuring "jina" logo and repeated "code embeddings" text around
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.