E/A-Diagramm

Code

jina-embeddings-v2-base-code

Aufgabe

Vektor

Pareto-Front
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderParameter (log)nDCG@10
Dieses Modell
Auf der Front
Jina AI
Andere
CoIR
52.24
Parameter
161M
Rang nach Score
19 / 31
Pareto-Front
Dahinter
Werteverteilung
AUC 0.8156
Korpus
Übersetzungspaare
Dokumentensuche
Code
0.7500.000.200.400.600.80
Verwandt10.9%
Hartes Negativ1.5%
Unverwandt1.0%
Empfohlene Schwellenwerte
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
ausgewogen · 0.369
AUC
0.8156
Rauschgrenze
0.805
Recall-Kante
0.204
Gemessene Paare
119 / 11k
Vektorkomponenten
-0.160.040.25
σ 0.0361 · 183k Werte
Einbettungsgeometrie
0768
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.404
Effektive Dim.
43 / 768
Wählen Sie Modelle zum Vergleichen aus

Überblick

jina-embeddings-v2-base-code ist ein 161M-Parameter Code-Embedding-Modell, das Programmcode aus 30 Sprachen in einen gemeinsamen 768-dimensionalen semantischen Raum abbildet. Mit einem 8.192-Token-Kontextfenster war es das erste Jina-Embedding-Modell, das Code-Retrieval ganzer Funktionen und mehrerer Dateien ohne Trunkierung unterstützte. Bei der Veröffentlichung führte es neun von fünfzehn CodeNetSearch-Benchmarks.

Methoden

Das Modell verwendet einen transformer-basierten Encoder mit 161M Parametern, trainiert auf vielfältigen Programmiersprachen-Datensätzen mit Schwerpunkt auf Python, JavaScript, Java, PHP, Go und Ruby. Das 8.192-Token-Kontextfenster (via ALiBi-Position-Encodings) ermöglicht die Verarbeitung ganzer Funktionen und kleiner Dateien in einem einzelnen Forward-Pass. Das Training umfasste kontrastives Pretraining auf Code-Text-Paaren (Natural-Language-Beschreibungen gepaart mit Code-Implementierungen), gefolgt von supervidiertem Feintuning auf Code-Retrieval-Datensätzen mit Hard-Negative-Mining. Die 768-dimensionalen Embeddings erfassen sowohl syntaktische Struktur als auch semantische Bedeutung und ermöglichen cross-sprachliches Code-Matching, bei dem funktional äquivalenter Code in verschiedenen Sprachen auf nahe Regionen des Embedding-Raums abgebildet wird.

Leistung

Bei der Veröffentlichung führte das Modell neun von fünfzehn CodeNetSearch-Benchmarks, übertraf dabei die Code-Embedding-Modelle von Microsoft und Salesforce und behielt einen effizienteren 307MB-Fußabdruck. Sein 8.192-Token-Kontext war 4–16-mal größer als der konkurrierender Code-Embedding-Modelle und ermöglichte Retrieval über ganze Dateien und komplexe Code-Blöcke. Cross-sprachliches Code-Verständnis war eine besondere Stärke und matchte funktional äquivalente Snippets über verschiedene Programmiersprachen hinweg. Im Jahr 2026 werden jina-code-embeddings-0.5b und jina-code-embeddings-1.5b dieses Modell mit autoregressiven Backbones, 32K-Kontext und deutlich höherer Retrieval-Genauigkeit ersetzen.

Anleitung

Für Code-Suche, Dokumentations-Retrieval und Code-Wiederverwendung in ein- oder mehrsprachigen Codebasen verwenden. Für Dokumente über 8.192 Tokens Chunking an Funktions- oder Klassen-Grenzen implementieren. Das Modell integriert sich mit Vektor-Datenbanken (Qdrant, Weaviate, MongoDB) und RAG-Frameworks. Für neue Code-Such-Projekte jina-code-embeddings-1.5b (1,5B Parameter, 32K-Kontext, SOTA-Genauigkeit) oder jina-code-embeddings-0.5b (494M Parameter, Edge-freundlich) bevorzugen. CUDA-fähige GPU für Produktion empfohlen. Stärkste Performance auf Python, JavaScript, Java, PHP, Go und Ruby; unterstützt 30+ Sprachen mit sanfter Degradation.

Blogs, die dieses Modell erwähnen
April 08, 2025 • 21 Minuten gelesen
jina-reranker-m0: Mehrsprachiger multimodaler Dokument-Reranker
Wir stellen jina-reranker-m0 vor, unseren neuen mehrsprachigen multimodalen Reranker für das Abrufen visueller Dokumente, mit SOTA-Performance bei mehrsprachigen langen Dokumenten und Code-Suchaufgaben.
September 27, 2024 • 15 Minuten gelesen
Migration von Jina Embeddings v2 zu v3
Wir haben einige Tipps zusammengestellt, die Ihnen bei der Migration von Jina Embeddings v2 auf v3 helfen.
April 29, 2024 • 7 Minuten gelesen
Jina Embeddings und Reranker auf Azure: Skalierbare KI-Lösungen für Unternehmensanwendungen
Jina Embeddings und Reranker sind jetzt im Azure Marketplace verfügbar. Unternehmen, die Datenschutz und Sicherheit priorisieren, können Jina AIs hochmoderne Modelle nun problemlos direkt in ihr bestehendes Azure-Ökosystem integrieren.
März 25, 2024 • 21 Minuten gelesen
Cloud AI der nächsten Generation: Jina Embeddings und Reranker auf Amazon SageMaker
Lernen Sie, wie Sie Jina Embeddings und Reranking-Modelle in einer Full-Stack KI-Anwendung auf AWS einsetzen können, unter ausschließlicher Verwendung von Komponenten aus Amazon SageMaker und dem AWS Marketplace.
Februar 05, 2024 • 4 Minuten gelesen
Optimieren Sie Ihre Code-Suche mit den neuen Jina Code Embeddings
Das neue 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲 ist für die Suche nach Code und Docstrings optimiert. Dieses leistungsstarke Modell unterstützt Suchen zwischen Englisch und 30 häufig verwendeten Programmiersprachen, alle mit einer Kontextlänge von 8192 und SOTA-Performance.