Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
warning
Dieses Modell wird durch neuere Modelle ersetzt.
Einbettungen
Apache 2.0 Lizenz
open_in_new Beitrag veröffentlichen

jina-embeddings-v2-base-code

Optimiert für die Suche nach Code und Dokumentzeichenfolgen
Lizenz
Apache-2.0
Veröffentlichungsdatum
calendar_month
2024-02-05
Eingang
abc
Text (Code)
arrow_forward
Ausgabe
more_horiz
Vektor
Späte Chunking help_outline
check_circle
Yes
Modelldetails
Parameter: 137M
Länge des Eingabetokens: 8K
Ausgabedimension: 768
Basismodell help_outline
open_in_new
jina-embeddings-v2-base-en
Ausgebildete Sprachen help_outline
1 Sprachen
Ähnliche Modelle
link
jina-embeddings-v2-base-en
Erhältlich über
Jina-API
AWS SageMaker
Microsoft Azure
Hugging Face
Air-Gapped
E/A-Diagramm

Code

jina-embeddings-v2-base-code

Aufgabe

Vektor

Pareto fronthelp_outline
CoIR
CoIR · appsretrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderParameters (log)nDCG@10
This model
On the front
Jina AI
Other
CoIR
52.24
Parameters
161M
Rank by score
19 / 31
Pareto front
Behind it
Werteverteilunghelp_outline
AUC 0.8156
Korpus
Übersetzungspaare
Dokumentensuche
Code
0.7500.000.200.400.600.80
Verwandt10.9%
Hartes Negativ1.5%
Unverwandt1.0%
Empfohlene Schwellenwerte
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
ausgewogen · 0.369
AUC
0.8156
Rauschgrenze
0.805
Recall-Kante
0.204
Gemessene Paare
119 / 11k
Vektorkomponentenhelp_outline
-0.160.040.25
σ 0.0361 · 183k Werte
Einbettungsgeometriehelp_outline
0768
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.404
Effektive Dim.
43 / 768
Wählen Sie Modelle zum Vergleichen aus

Überblick

Jina Embeddings v2 Base Code bewältigt eine entscheidende Herausforderung der modernen Softwareentwicklung: die effiziente Navigation und das Verständnis großer Codebasen. Für Entwicklungsteams, die mit der Code-Erkennung und -Dokumentation zu kämpfen haben, verändert dieses Modell die Art und Weise, wie Entwickler mit Code interagieren, indem es die Suche in natürlicher Sprache in 30 Programmiersprachen ermöglicht. Im Gegensatz zu herkömmlichen Code-Suchtools, die auf exakter Musterübereinstimmung basieren, versteht dieses Modell die semantische Bedeutung hinter dem Code und ermöglicht es Entwicklern, relevante Codeausschnitte anhand einfacher englischer Beschreibungen zu finden. Diese Funktion ist besonders wertvoll für Teams, die große Legacy-Codebasen pflegen, Entwickler, die in neue Projekte einsteigen, oder Organisationen, die die Wiederverwendung von Code und die Dokumentationspraktiken verbessern möchten.

Methoden

Das Modell erreicht seine beeindruckende Leistung durch eine spezielle Architektur, die speziell für das Codeverständnis entwickelt wurde. Im Kern verwendet es ein transformatorbasiertes neuronales Netzwerk mit 161 Millionen Parametern, das anhand verschiedener Programmiersprachen-Datensätze trainiert wurde, wobei der Schwerpunkt auf sechs Hauptsprachen liegt: Python, JavaScript, Java, PHP, Go und Ruby. Was diese Architektur einzigartig macht, ist ihr erweitertes Kontextfenster mit 8.192 Token, das es ermöglicht, ganze Funktionen oder mehrere Dateien gleichzeitig zu verarbeiten und gleichzeitig das semantische Verständnis aufrechtzuerhalten. Das Modell generiert dichte 768-dimensionale Einbettungen, die sowohl die syntaktische Struktur als auch die semantische Bedeutung des Codes erfassen und es ihm ermöglichen, Beziehungen zwischen verschiedenen Codesegmenten zu verstehen, selbst wenn sie unterschiedliche Programmiermuster oder Syntax verwenden, um dasselbe Ziel zu erreichen.

Leistung

In Tests unter realen Bedingungen zeigt Jina Embeddings v2 Base Code außergewöhnliche Fähigkeiten und ist in neun von fünfzehn entscheidenden CodeNetSearch-Benchmarks führend. Im Vergleich zu Modellen von Branchenriesen wie Microsoft und Salesforce erreicht es eine überlegene Leistung bei gleichzeitig effizienterem Platzbedarf. Das Modell zeichnet sich insbesondere durch sprachübergreifendes Codeverständnis aus und gleicht erfolgreich funktional gleichwertige Codeausschnitte in verschiedenen Programmiersprachen ab. Sein Kontextfenster mit 8.192 Token erweist sich als besonders wertvoll für große Funktionen und komplexe Codedateien und übertrifft herkömmliche Modelle, die normalerweise nur einige hundert Token verarbeiten, deutlich. Die Effizienz des Modells zeigt sich in seiner kompakten Größe von 307 MB (unquantisiert), die schnelle Inferenz ermöglicht und gleichzeitig eine hohe Genauigkeit bei Codeähnlichkeit und Suchaufgaben beibehält.

Anleitung

Um Jina Embeddings v2 Base Code effektiv einzusetzen, sollten Teams mehrere praktische Aspekte berücksichtigen. Das Modell lässt sich nahtlos in beliebte Vektordatenbanken wie MongoDB, Qdrant und Weaviate integrieren, sodass sich skalierbare Codesuchsysteme leicht erstellen lassen. Für optimale Leistung implementieren Sie eine geeignete Codevorverarbeitung, um das 8.192-Token-Limit zu handhaben, das normalerweise die meisten Funktions- und Klassendefinitionen abdeckt. Obwohl das Modell 30 Programmiersprachen unterstützt, zeigt es die beste Leistung in den sechs Kernsprachen: Python, JavaScript, Java, PHP, Go und Ruby. Teams sollten die Verwendung von Batchverarbeitung für die Indizierung von Code im großen Maßstab in Betracht ziehen, um die Leistung zu optimieren. Die RAG-Kompatibilität des Modells macht es besonders effektiv für die automatische Dokumentationserstellung und das Codeverständnis, obwohl Teams geeignete Chunking-Strategien für sehr große Codebasen implementieren sollten. Erwägen Sie für Produktionsbereitstellungen die Verwendung des AWS SageMaker-Endpunkts für verwaltete Inferenz und implementieren Sie geeignete Caching-Strategien, um die Abfrageleistung zu optimieren.
Blogs, die dieses Modell erwähnen
April 08, 2025 • 21 Minuten gelesen
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
September 27, 2024 • 15 Minuten gelesen
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
April 29, 2024 • 7 Minuten gelesen
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
März 25, 2024 • 21 Minuten gelesen
Next-Level Cloud AI: Jina Embeddings and Rerankers on Amazon SageMaker
Learn to use Jina Embeddings and Reranking models in a full-stack AI application on AWS, using only components available in Amazon SageMaker and the AWS Marketplace.
Scott Martens
Saahil Ognawala
Abstract image with colorful wavy background featuring AWS, Embeddings, and Reranker logos.
Februar 05, 2024 • 4 Minuten gelesen
Elevate Your Code Search with New Jina Code Embeddings
New 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲 is optimized for code & docstring search. This powerful model supports searches between English and 30 widely-used programming languages, all with 8192 context length and SOTA performance.
Jina AI
Abstract image with concentric circles in purple and green, featuring "jina" logo and repeated "code embeddings" text around
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.