Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumentation
Einloggen
login
Einbettungen
copyright CC BY-NC 4.0
open_in_new Release-Post

jina-code-embeddings-0.5b

Effiziente Code-Einbettungen aus Code-Generierungsmodellen
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2025-09-01
Eingabe
abc
Text (Code)
arrow_forward
Ausgabe
more_horiz
Vektor
Matryoshka-Dimensionen help_outline
64
128
256
512
896
Modelldetails
Parameter: 494M
Länge des Eingabetokens: 32K
Ausgabedimension: 896
Basismodell help_outline
open_in_new
Qwen2.5-Coder-0.5B
Ausgebildete Sprachen help_outline
1 Sprachen
Unterstützte Sprachen help_outline
29 Sprachen
Quantisierungen help_outline
GGUF
Ähnliche Modelle
link
jina-code-embeddings-1.5b
link
jina-embeddings-v2-base-code
Unterstützte Aufgaben
translate NL→Code
help_center Technisches Q&A
sync_alt Code→Code
description Code→NL
auto_fix_high Vervollständigung
Erhältlich über
Jina-API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-Gapped
E/A-Diagramm

Code

jina-code-embeddings

Aufgabe

Vektor

Pareto-Front help_outline
workspace_premium
CoIR
MTEB Code
chevron_leftchevron_right
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderjina-code-embeddings-0.…Parameter (log)nDCG@10
Dieses Modell
Auf der Front
Jina AI
Andere
CoIR
73.94
Parameter
494M
Rang nach Score
1 / 31
Pareto-Front
Darauf
Werteverteilunghelp_outline
AUC 0.8538
Korpus
Übersetzungspaare
Dokumentensuche
Code
Aufgabe
nl2code.passage
nl2code.query
nl2code.query → nl2code.passage
qa.passage
qa.query
qa.query → qa.passage
0.7330.000.200.400.600.80
Verwandt18.5%
Hartes Negativ2.3%
Unverwandt1.1%
Empfohlene Schwellenwerte
FPR 0.1 · 0.544
FPR 0.01 · 0.733
FPR 0.001 · 0.813
FPR 0.0001 · 0.889
ausgewogen · 0.427
AUC
0.8538
Rauschgrenze
0.809
Recall-Kante
0.160
Gemessene Paare
119 / 11k
Vektorkomponentenhelp_outline
-0.210.010.23
σ 0.0334 · 213k Werte
Einbettungsgeometriehelp_outline
0896
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.329
Effektive Dim.
55 / 896
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
NeurIPS 2025
August 31, 2025
Efficient Code Embeddings from Code Generation Models

Überblick

jina-code-embeddings-0.5b ist ein Code-Embedding-Modell mit 494M Parametern, das Programmcode und Natural-Language-Queries in einen gemeinsamen 896-dimensionalen semantischen Raum abbildet. Es unterstützt 32K-Token-Kontextfenster, ermöglicht damit das Retrieval ganzer Funktionen und mehrerer Dateien, und nutzt Matryoshka-Repräsentationslernen für flexible Dimensionalität (64–896). Es erreicht state-of-the-art Code-Retrieval-Performance in seiner Größe und übertrifft Modelle mit der 3-fachen Parameterzahl.

Methoden

Das Modell basiert auf einem autoregressiven Transformer-Backbone, der auf Natural-Language- und Code-Korpora vortrainiert wurde. Anstatt des bidirektionalen Poolings traditioneller Embedding-Modelle extrahiert es Embeddings via Last-Token-Pooling von der finalen Position der Sequenz. Das ist eine wichtige architektonische Erkenntnis: Die kausale Attention des autoregressiven Modells achtet natürlicherweise auf den gesamten Eingabe-Kontext, und das Code-Generierungs-Pretraining-Ziel erzeugt reichhaltige semantische Repräsentationen, die sich gut auf Retrieval übertragen. Das Training verwendet ein zwei-stufiges Rezept: (1) kontrastives Pretraining auf großskaligen Code-Text-Paaren (Natural-Language-Beschreibungen gepaart mit Code-Implementierungen), (2) supervidiertes Feintuning auf kuratierten Code-Retrieval-Datensätzen mit Hard-Negative-Mining. Die 32K-Kontextlänge wird über rotary position embeddings mit abgestimmter Basisfrequenz ermöglicht.

Leistung

Das Modell erreicht einen Gesamt-Durchschnitt von 78,41 % und einen MTEB-Code-Durchschnitt von 78,72 % über die Standard-Code-Retrieval-Benchmarks. Hervorzuhebende Werte: 96,77 % auf HumanEval, 89,01 % auf MBPP, 98,31 % auf WikiSQL, 99,70 % auf CodeChefXLang, 90,37 % auf CodeTransOceanContest (code-zu-code), 85,73 % auf COIR-CodeSearchNet (NL2Code), 95,98 % auf Doc2Code und 91,04 % auf StackOverflowQA. Es übertrifft Qwen3-Embedding-0,6B und größere Modelle, darunter jina-embeddings-v4 (74,11 %) und gemini-embedding-001 (77,38 %), in code-spezifischen Aufgaben. Mit 494M Parametern übertrifft es mehrere Modelle, die 3–5-mal so groß sind, und zeigt, dass der autoregressive-Backbone-Ansatz eine hohe semantische Qualität pro Parameter liefert.

Anleitung

Immer passende task-spezifische Instruktion-Präfixe verwenden: nl2code für Natural-Language-zu-Code-Suche, code2code für Code-zu-Code-Ähnlichkeit, code2nl für Code-zu-Natural-Language, techqa für technische Q&A und code2completion für Code-Vervollständigung. Für große Codebasen Chunking an Funktions- oder Klassen-Grenzen implementieren, um innerhalb der 32K-Token-Grenze zu bleiben. Matryoshka-Trunkierung auf 128 oder 256 Dimensionen eignet sich für hochdurchsatzfähiges Indexieren; für das Re-Ranking der Top-Kandidaten die vollen 896 Dimensionen verwenden. Cosine-Ähnlichkeit für den Embedding-Vergleich verwenden. Optimale Batch-Größe ist 512, Sequenzlänge 512 Tokens. Das Modell ist für Python, JavaScript, Java, PHP, Go und Ruby optimiert, unterstützt aber 30+ Sprachen. Für RAG-Pipelines über Code mit jina-reranker-v3.5 als zweite Stufe kombinieren, um die Präzision auf die Top-50-Kandidaten zu maximieren.

Blogs, die dieses Modell erwähnen
Oktober 03, 2025 • 7 Minuten gelesen
Jina Reranker v3: 0.6B Listwise Reranker für SOTA Multilingual Retrieval
Ein neuer Listwise-Reranker mit 0,6 Milliarden Parametern, der die Anfrage und alle Kandidatendokumente in einem einzigen Kontextfenster berücksichtigt.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
September 04, 2025 • 6 Minuten gelesen
Jina Code Embeddings: SOTA Code Retrieval bei 0.5B und 1.5B
Code generierende LLMs → Code-Vektor-Modelle: 0,5B/1,5B Modelle erzielen SOTA-Performance über 25 Code-Retrieval-Benchmarks hinweg.
Jina AI
Green "Code Embeddings" text displayed in a LED dot style on a black background, evoking a futuristic and technological atmos
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Neuigkeiten
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.