E/A-Diagramm

Code

jina-code-embeddings

Aufgabe

Vektor

Pareto-Front
100M300M1B3.0B10B50607080b1ade-embedbge-m3EmbeddingGemma-300MF2LLM-v2-80Mgranite-embedding-125m-…granite-embedding-278m-…granite-embedding-311m-…granite-embedding-97m-m…granite-embedding-small…gte-multilingual-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructharrier-oss-v1-270mjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…multilingual-e5-basemultilingual-e5-smallNV-Embed-v2Qwen3-Embedding-0.6BQwen3-Embedding-4BQwen3-Embedding-8Bsnowflake-arctic-embed-…jina-code-embeddings-1.…Parameter (log)score
Dieses Modell
Auf der Front
Jina AI
Andere
MTEB Code
78.94
Parameter
1.5B
Rang nach Score
3 / 26
Pareto-Front
Darauf
Werteverteilung
AUC 0.8780
Korpus
Übersetzungspaare
Dokumentensuche
Code
Aufgabe
nl2code.passage
nl2code.query
nl2code.query → nl2code.passage
qa.passage
qa.query
qa.query → qa.passage
0.6810.000.200.400.600.80
Verwandt22.7%
Hartes Negativ2.0%
Unverwandt0.8%
Empfohlene Schwellenwerte
FPR 0.1 · 0.501
FPR 0.01 · 0.681
FPR 0.001 · 0.782
FPR 0.0001 · 0.850
ausgewogen · 0.372
AUC
0.8780
Rauschgrenze
0.782
Recall-Kante
0.244
Gemessene Paare
119 / 11k
Vektorkomponenten
-0.240.000.24
σ 0.0255 · 366k Werte
Einbettungsgeometrie
01536
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.311
Effektive Dim.
60 / 1536
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)

Überblick

jina-code-embeddings-1.5b ist ein Code-Embedding-Modell mit 1,5B Parametern, das Programmcode und Natural-Language-Queries in einen gemeinsamen 1536-dimensionalen semantischen Raum abbildet. Es unterstützt 32K-Token-Kontextfenster und ermöglicht Retrieval über ganze Dateien und mehrdateiige Code-Kontexte. Es erreicht state-of-the-art Code-Retrieval-Performance, übertrifft sein 0,5B-Geschwistermodell erheblich und deutlich größere dedizierte Code-Retrieval-Modelle.

Methoden

Das Modell basiert auf einem autoregressiven Transformer-Backbone, der auf Natural-Language- und Code-Korpora vortrainiert wurde und das Code-Generierungs-Pretraining-Ziel nutzt, um reichhaltige semantische Repräsentationen zu erzeugen. Es extrahiert Embeddings via Last-Token-Pooling von der finalen Position der Sequenz — die kausale Attention des autoregressiven Modells achtet natürlicherweise auf den gesamten Eingabe-Kontext, und das Code-Generierungs-Ziel erzeugt Repräsentationen, die sowohl syntaktische Struktur als auch funktionale Semantik erfassen. Das Training verwendet ein zwei-stufiges Rezept: (1) kontrastives Pretraining auf großskaligen Code-Text-Paaren, (2) supervidiertes Feintuning auf kuratierten Code-Retrieval-Datensätzen mit Hard-Negative-Mining. Die 32K-Kontextlänge wird über rotary position embeddings mit abgestimmter Basisfrequenz ermöglicht. Matryoshka-Repräsentationslernen erlaubt die Dimensions-Trunkierung von 1536 auf 128.

Leistung

Das Modell erreicht einen Gesamt-Durchschnitt von 79,04 % und einen MTEB-Code-Durchschnitt von 78,94 % und setzt damit neue Benchmarks für seine Parameterklasse. Hervorzuhebende Werte: 98,41 % auf HumanEval, 90,13 % auf MBPP, 98,02 % auf WikiSQL, 99,44 % auf CodeChefXLang, 92,54 % auf CodeTransOceanContest (code-zu-code), 86,45 % auf COIR-CodeSearchNet (NL2Code), 96,34 % auf Doc2Code, 92,37 % auf StackOverflowQA und 86,33 % auf SWE-Bench (gegenüber 83,00 % für die 0,5B-Variante). Es übertrifft größere Alternativen und zeigt konsistente Verbesserungen gegenüber der 0,5B-Variante, insbesondere bei komplexen Multi-Datei- und Cross-Repository-Aufgaben.

Anleitung

Setzen Sie Instruktion-Präfixe strategisch je nach Retrieval-Anforderung ein: nl2code, code2code, code2nl, techqa, code2completion. Halten Sie Konsistenz über Ihre Pipeline aufrecht — verwenden Sie für Queries und Dokumente in einem gegebenen Retrieval-Szenario denselben Präfix-Typ. Die erhöhte 1,5B-Kapazität eignet sich ideal für komplexe Szenarien mit mehreren Programmier-Paradigmen und großen Codebasen. Profilier Use-Cases, um das optimale Matryoshka-Dimensionsverhältnis zwischen Qualität und Ressourcen zu bestimmen; 256–512 Dimensionen sind ein guter Startpunkt für Indexierung, 1536 für Re-Ranking. Für Produktionsausrichtung mit dem Training Batch-Größe 256 verwenden. Das Modell ist bei 99,44 % CodeChefXLang-Performance ausgezeichnet für Cross-Repository- und Cross-Language-Suchen. Als primäre Retrieval-Komponente in RAG-Systemen implementieren, kombiniert mit jina-reranker-v3.5 für Präzision auf die Top-50-Kandidaten. Cosine-Ähnlichkeit für den Embedding-Vergleich verwenden. Ideal für Enterprise-Deployments, die Performance und Effizienz mit Sub-Second-Latenz erfordern.

Blogs, die dieses Modell erwähnen