Grafico I/O

Codice

jina-embeddings-v2-base-code

Attività

Vettore

Frontiera di Pareto
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderParametri (log)nDCG@10
Questo modello
Sulla frontiera
Jina AI
Altri
CoIR
52.24
Parametri
161M
Classifica per punteggio
19 / 31
Frontiera di Pareto
Dietro
Distribuzione dei valori
AUC 0.8156
Corpus
Coppie di traduzione
Ricerca documentale
Codice
0.7500.000.200.400.600.80
Correlate10.9%
Negativo difficile1.5%
Non correlate1.0%
Soglie consigliate
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
bilanciata · 0.369
AUC
0.8156
Soglia del rumore
0.805
Crollo del richiamo
0.204
Coppie misurate
119 / 11k
Componenti del vettore
-0.160.040.25
σ 0.0361 · 183k valori
Geometria dell'embedding
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.404
Dim. effettive
43 / 768
Scegli i modelli da confrontare

Panoramica

jina-embeddings-v2-base-code è un modello di embedding del codice da 161M parametri che mappa il codice di programmazione in 30 linguaggi in uno spazio semantico condiviso di 768 dimensioni. Con una finestra di contesto di 8.192 token, è stato il primo modello di embedding Jina a supportare la retrieval di intere funzioni e di più file senza troncatura. Al rilascio, era al primo posto in nove dei quindici benchmark CodeNetSearch.

Metodi

Il modello usa un encoder basato su transformer da 161M parametri, addestrato su dataset di linguaggi di programmazione vari, con enfasi su Python, JavaScript, Java, PHP, Go e Ruby. La finestra di contesto di 8.192 token (tramite codifiche posizionali ALiBi) permette l'elaborazione di intere funzioni e di piccoli file in una singola passata. L'addestramento ha incluso pre-addestramento contrastivo su coppie codice-testo (descrizioni in linguaggio naturale abbinate a implementazioni di codice), seguito da fine-tuning supervisionato su dataset di retrieval del codice con mining di negativi difficili. Gli embedding a 768 dimensioni catturano sia la struttura sintattica sia il significato semantico, abilitando il matching del codice cross-linguaggio in cui codice funzionalmente equivalente in linguaggi diversi mappa su regioni vicine dello spazio di embedding.

Prestazione

Al rilascio, il modello era al primo posto in nove dei quindici benchmark CodeNetSearch, superando i modelli di embedding del codice di Microsoft e Salesforce mantenendo un'occupazione più efficiente di 307MB. Il suo contesto di 8.192 token era 4–16 volte più grande di quello dei modelli di embedding del codice concorrenti, abilitando la retrieval su file interi e blocchi di codice complessi. La comprensione del codice cross-linguaggio era una forza particolare, facendo il matching di frammenti funzionalmente equivalenti tra linguaggi di programmazione diversi. Nel 2026, jina-code-embeddings-0.5b e jina-code-embeddings-1.5b rimpiazzano questo modello con backbones autoregressivi, contesto di 32K e precisione di retrieval significativamente maggiore.

Orientamento

Usa per la ricerca del codice, la retrieval della documentazione e il riuso del codice in codebase monolingue o cross-linguaggio. Per documenti che superano 8.192 token, implementa il chunking ai confini di funzione o di classe. Il modello si integra con database vettoriali (Qdrant, Weaviate, MongoDB) e framework RAG. Per nuovi progetti di ricerca del codice, preferisci jina-code-embeddings-1.5b (1,5B parametri, contesto di 32K, accuratezza SOTA) o jina-code-embeddings-0.5b (494M parametri, edge-friendly). GPU con supporto CUDA consigliata per la produzione. Prestazioni migliori su Python, JavaScript, Java, PHP, Go e Ruby; supporta 30+ lingue con degradazione graduale.

Blog che menzionano questo modello
aprile 08, 2025 • 21 minuti letti
jina-reranker-m0: Reranker multilingue e multimodale per documenti
Presentiamo jina-reranker-m0, il nostro nuovo reranker multimodale multilingue per il recupero di documenti visivi, con prestazioni allo stato dell'arte su documenti lunghi multilingue e attività di ricerca codice.
settembre 27, 2024 • 15 minuti letti
Migrazione da Jina Embeddings v2 a v3
Abbiamo raccolto alcuni suggerimenti per aiutarti a migrare da Jina Embeddings v2 a v3.
aprile 29, 2024 • 7 minuti letti
Jina Embeddings e Reranker su Azure: Soluzioni AI Scalabili Pronte per il Business
Jina Embeddings e Rerankers sono ora disponibili su Azure Marketplace. Le aziende che danno priorità alla privacy e alla sicurezza possono ora integrare facilmente i modelli all'avanguardia di Jina AI direttamente nel loro ecosistema Azure esistente.
marzo 25, 2024 • 21 minuti letti
IA sul Cloud di Nuova Generazione: Jina Embeddings e Rerankers su Amazon SageMaker
Impara a utilizzare i modelli Jina Embeddings e Reranking in un'applicazione AI full-stack su AWS, utilizzando solo componenti disponibili in Amazon SageMaker e nell'AWS Marketplace.
febbraio 05, 2024 • 4 minuti letti
Migliora la Tua Ricerca di Codice con i Nuovi Jina Code Embeddings
Il nuovo 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲 è ottimizzato per la ricerca di codice e docstring. Questo potente modello supporta ricerche tra inglese e 30 linguaggi di programmazione ampiamente utilizzati, tutti con lunghezza di contesto di 8192 e prestazioni SOTA.