Überblick
jina-code-embeddings-1.5b ist ein Code-Embedding-Modell mit 1,5B Parametern, das Programmcode und Natural-Language-Queries in einen gemeinsamen 1536-dimensionalen semantischen Raum abbildet. Es unterstützt 32K-Token-Kontextfenster und ermöglicht Retrieval über ganze Dateien und mehrdateiige Code-Kontexte. Es erreicht state-of-the-art Code-Retrieval-Performance, übertrifft sein 0,5B-Geschwistermodell erheblich und deutlich größere dedizierte Code-Retrieval-Modelle.
Methoden
Das Modell basiert auf einem autoregressiven Transformer-Backbone, der auf Natural-Language- und Code-Korpora vortrainiert wurde und das Code-Generierungs-Pretraining-Ziel nutzt, um reichhaltige semantische Repräsentationen zu erzeugen. Es extrahiert Embeddings via Last-Token-Pooling von der finalen Position der Sequenz — die kausale Attention des autoregressiven Modells achtet natürlicherweise auf den gesamten Eingabe-Kontext, und das Code-Generierungs-Ziel erzeugt Repräsentationen, die sowohl syntaktische Struktur als auch funktionale Semantik erfassen. Das Training verwendet ein zwei-stufiges Rezept: (1) kontrastives Pretraining auf großskaligen Code-Text-Paaren, (2) supervidiertes Feintuning auf kuratierten Code-Retrieval-Datensätzen mit Hard-Negative-Mining. Die 32K-Kontextlänge wird über rotary position embeddings mit abgestimmter Basisfrequenz ermöglicht. Matryoshka-Repräsentationslernen erlaubt die Dimensions-Trunkierung von 1536 auf 128.
Leistung
Das Modell erreicht einen Gesamt-Durchschnitt von 79,04 % und einen MTEB-Code-Durchschnitt von 78,94 % und setzt damit neue Benchmarks für seine Parameterklasse. Hervorzuhebende Werte: 98,41 % auf HumanEval, 90,13 % auf MBPP, 98,02 % auf WikiSQL, 99,44 % auf CodeChefXLang, 92,54 % auf CodeTransOceanContest (code-zu-code), 86,45 % auf COIR-CodeSearchNet (NL2Code), 96,34 % auf Doc2Code, 92,37 % auf StackOverflowQA und 86,33 % auf SWE-Bench (gegenüber 83,00 % für die 0,5B-Variante). Es übertrifft größere Alternativen und zeigt konsistente Verbesserungen gegenüber der 0,5B-Variante, insbesondere bei komplexen Multi-Datei- und Cross-Repository-Aufgaben.
Anleitung
Setzen Sie Instruktion-Präfixe strategisch je nach Retrieval-Anforderung ein: nl2code, code2code, code2nl, techqa, code2completion. Halten Sie Konsistenz über Ihre Pipeline aufrecht — verwenden Sie für Queries und Dokumente in einem gegebenen Retrieval-Szenario denselben Präfix-Typ. Die erhöhte 1,5B-Kapazität eignet sich ideal für komplexe Szenarien mit mehreren Programmier-Paradigmen und großen Codebasen. Profilier Use-Cases, um das optimale Matryoshka-Dimensionsverhältnis zwischen Qualität und Ressourcen zu bestimmen; 256–512 Dimensionen sind ein guter Startpunkt für Indexierung, 1536 für Re-Ranking. Für Produktionsausrichtung mit dem Training Batch-Größe 256 verwenden. Das Modell ist bei 99,44 % CodeChefXLang-Performance ausgezeichnet für Cross-Repository- und Cross-Language-Suchen. Als primäre Retrieval-Komponente in RAG-Systemen implementieren, kombiniert mit jina-reranker-v3.5 für Präzision auf die Top-50-Kandidaten. Cosine-Ähnlichkeit für den Embedding-Vergleich verwenden. Ideal für Enterprise-Deployments, die Performance und Effizienz mit Sub-Second-Latenz erfordern.


