Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
warning
Questo modello è obsoleto nei modelli più recenti.
Incorporamenti
Licenza Apache 2.0
open_in_new Pubblicazione post

jina-embeddings-v2-base-code

Ottimizzato per la ricerca di codici e stringhe di documenti
Licenza
Apache-2.0
Data di rilascio
calendar_month
2024-02-05
Ingresso
abc
Testo (codice)
arrow_forward
Produzione
more_horiz
Vettore
Chunking tardivo help_outline
check_circle
Yes
Dettagli del modello
Parametri: 137M
Lunghezza del token di input: 8K
Dimensione di uscita: 768
Modello base help_outline
open_in_new
jina-embeddings-v2-base-en
Lingue addestrate help_outline
1 lingue
Modelli correlati
link
jina-embeddings-v2-base-en
Disponibile tramite
API di Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Grafico I/O

Codice

jina-embeddings-v2-base-code

Compito

Vettore

Pareto fronthelp_outline
CoIR
CoIR · appsretrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderParameters (log)nDCG@10
This model
On the front
Jina AI
Other
CoIR
52.24
Parameters
161M
Rank by score
19 / 31
Pareto front
Behind it
Distribuzione dei valorihelp_outline
AUC 0.8156
Corpus
Coppie di traduzione
Ricerca documentale
Codice
0.7500.000.200.400.600.80
Correlate10.9%
Negativo difficile1.5%
Non correlate1.0%
Soglie consigliate
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
bilanciata · 0.369
AUC
0.8156
Soglia del rumore
0.805
Crollo del richiamo
0.204
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
-0.160.040.25
σ 0.0361 · 183k valori
Geometria dell'embeddinghelp_outline
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.404
Dim. effettive
43 / 768
Scegli i modelli da confrontare

Panoramica

Jina Embeddings v2 Base Code affronta una sfida critica nello sviluppo software moderno: navigare e comprendere in modo efficiente grandi basi di codice. Per i team di sviluppo che hanno difficoltà con la scoperta e la documentazione del codice, questo modello trasforma il modo in cui gli sviluppatori interagiscono con il codice abilitando la ricerca in linguaggio naturale in 30 linguaggi di programmazione. A differenza dei tradizionali strumenti di ricerca del codice che si basano sulla corrispondenza esatta dei pattern, questo modello comprende il significato semantico dietro il codice, consentendo agli sviluppatori di trovare frammenti di codice pertinenti utilizzando semplici descrizioni in inglese. Questa capacità è particolarmente preziosa per i team che gestiscono grandi basi di codice legacy, gli sviluppatori che si iscrivono a nuovi progetti o le organizzazioni che cercano di migliorare le pratiche di riutilizzo e documentazione del codice.

Metodi

Il modello raggiunge le sue prestazioni impressionanti attraverso un'architettura specializzata progettata specificamente per la comprensione del codice. Al suo interno, utilizza una rete neurale basata su trasformatore con 161 milioni di parametri, addestrata su diversi set di dati di linguaggi di programmazione con enfasi su sei linguaggi principali: Python, JavaScript, Java, PHP, Go e Ruby. Ciò che rende unica questa architettura è la sua finestra di contesto estesa di 8.192 token, che gli consente di elaborare intere funzioni o più file contemporaneamente mantenendo la comprensione semantica. Il modello genera densi embedding a 768 dimensioni che catturano sia la struttura sintattica che il significato semantico del codice, consentendogli di comprendere le relazioni tra diversi segmenti di codice anche quando utilizzano diversi modelli di programmazione o sintassi per raggiungere lo stesso obiettivo.

Prestazione

Nei test nel mondo reale, Jina Embeddings v2 Base Code dimostra capacità eccezionali, guidando il campo in nove su quindici benchmark CodeNetSearch cruciali. Se confrontato con modelli di giganti del settore come Microsoft e Salesforce, raggiunge prestazioni superiori mantenendo un'impronta più efficiente. Il modello eccelle in particolare nella comprensione del codice multilinguaggio, abbinando con successo frammenti di codice funzionalmente equivalenti in diversi linguaggi di programmazione. La sua finestra di contesto di 8.192 token si dimostra particolarmente preziosa per funzioni di grandi dimensioni e file di codice complessi, superando significativamente i modelli tradizionali che in genere gestiscono solo poche centinaia di token. L'efficienza del modello è evidente nelle sue dimensioni compatte di 307 MB (non quantizzate), consentendo un'inferenza rapida mantenendo un'elevata accuratezza nella somiglianza del codice e nelle attività di ricerca.

Orientamento

Per distribuire in modo efficace Jina Embeddings v2 Base Code, i team dovrebbero considerare diversi aspetti pratici. Il modello si integra perfettamente con i database vettoriali più diffusi come MongoDB, Qdrant e Weaviate, semplificando la creazione di sistemi di ricerca del codice scalabili. Per prestazioni ottimali, implementare un'adeguata preelaborazione del codice per gestire il limite di 8.192 token, che in genere si adatta alla maggior parte delle definizioni di funzioni e classi. Sebbene il modello supporti 30 linguaggi di programmazione, mostra le prestazioni più elevate nei sei linguaggi principali: Python, JavaScript, Java, PHP, Go e Ruby. I team dovrebbero prendere in considerazione l'utilizzo dell'elaborazione batch per l'indicizzazione del codice su larga scala per ottimizzare le prestazioni. La compatibilità RAG del modello lo rende particolarmente efficace per la generazione automatizzata di documentazione e le attività di comprensione del codice, sebbene i team dovrebbero implementare strategie di suddivisione in blocchi appropriate per basi di codice molto grandi. Per le distribuzioni di produzione, prendere in considerazione l'utilizzo dell'endpoint AWS SageMaker per l'inferenza gestita e implementare strategie di memorizzazione nella cache appropriate per ottimizzare le prestazioni delle query.
Blog che menzionano questo modello
aprile 08, 2025 • 21 minuti letti
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
settembre 27, 2024 • 15 minuti letti
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
aprile 29, 2024 • 7 minuti letti
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
marzo 25, 2024 • 21 minuti letti
Next-Level Cloud AI: Jina Embeddings and Rerankers on Amazon SageMaker
Learn to use Jina Embeddings and Reranking models in a full-stack AI application on AWS, using only components available in Amazon SageMaker and the AWS Marketplace.
Scott Martens
Saahil Ognawala
Abstract image with colorful wavy background featuring AWS, Embeddings, and Reranker logos.
febbraio 05, 2024 • 4 minuti letti
Elevate Your Code Search with New Jina Code Embeddings
New 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲 is optimized for code & docstring search. This powerful model supports searches between English and 30 widely-used programming languages, all with 8192 context length and SOTA performance.
Jina AI
Abstract image with concentric circles in purple and green, featuring "jina" logo and repeated "code embeddings" text around
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.