Überblick
jina-embeddings-v2-base-code ist ein 161M-Parameter Code-Embedding-Modell, das Programmcode aus 30 Sprachen in einen gemeinsamen 768-dimensionalen semantischen Raum abbildet. Mit einem 8.192-Token-Kontextfenster war es das erste Jina-Embedding-Modell, das Code-Retrieval ganzer Funktionen und mehrerer Dateien ohne Trunkierung unterstützte. Bei der Veröffentlichung führte es neun von fünfzehn CodeNetSearch-Benchmarks.
Methoden
Das Modell verwendet einen transformer-basierten Encoder mit 161M Parametern, trainiert auf vielfältigen Programmiersprachen-Datensätzen mit Schwerpunkt auf Python, JavaScript, Java, PHP, Go und Ruby. Das 8.192-Token-Kontextfenster (via ALiBi-Position-Encodings) ermöglicht die Verarbeitung ganzer Funktionen und kleiner Dateien in einem einzelnen Forward-Pass. Das Training umfasste kontrastives Pretraining auf Code-Text-Paaren (Natural-Language-Beschreibungen gepaart mit Code-Implementierungen), gefolgt von supervidiertem Feintuning auf Code-Retrieval-Datensätzen mit Hard-Negative-Mining. Die 768-dimensionalen Embeddings erfassen sowohl syntaktische Struktur als auch semantische Bedeutung und ermöglichen cross-sprachliches Code-Matching, bei dem funktional äquivalenter Code in verschiedenen Sprachen auf nahe Regionen des Embedding-Raums abgebildet wird.
Leistung
Bei der Veröffentlichung führte das Modell neun von fünfzehn CodeNetSearch-Benchmarks, übertraf dabei die Code-Embedding-Modelle von Microsoft und Salesforce und behielt einen effizienteren 307MB-Fußabdruck. Sein 8.192-Token-Kontext war 4–16-mal größer als der konkurrierender Code-Embedding-Modelle und ermöglichte Retrieval über ganze Dateien und komplexe Code-Blöcke. Cross-sprachliches Code-Verständnis war eine besondere Stärke und matchte funktional äquivalente Snippets über verschiedene Programmiersprachen hinweg. Im Jahr 2026 werden jina-code-embeddings-0.5b und jina-code-embeddings-1.5b dieses Modell mit autoregressiven Backbones, 32K-Kontext und deutlich höherer Retrieval-Genauigkeit ersetzen.
Anleitung
Für Code-Suche, Dokumentations-Retrieval und Code-Wiederverwendung in ein- oder mehrsprachigen Codebasen verwenden. Für Dokumente über 8.192 Tokens Chunking an Funktions- oder Klassen-Grenzen implementieren. Das Modell integriert sich mit Vektor-Datenbanken (Qdrant, Weaviate, MongoDB) und RAG-Frameworks. Für neue Code-Such-Projekte jina-code-embeddings-1.5b (1,5B Parameter, 32K-Kontext, SOTA-Genauigkeit) oder jina-code-embeddings-0.5b (494M Parameter, Edge-freundlich) bevorzugen. CUDA-fähige GPU für Produktion empfohlen. Stärkste Performance auf Python, JavaScript, Java, PHP, Go und Ruby; unterstützt 30+ Sprachen mit sanfter Degradation.









