Panoramica
jina-embeddings-v2-base-code è un modello di embedding del codice da 161M parametri che mappa il codice di programmazione in 30 linguaggi in uno spazio semantico condiviso di 768 dimensioni. Con una finestra di contesto di 8.192 token, è stato il primo modello di embedding Jina a supportare la retrieval di intere funzioni e di più file senza troncatura. Al rilascio, era al primo posto in nove dei quindici benchmark CodeNetSearch.
Metodi
Il modello usa un encoder basato su transformer da 161M parametri, addestrato su dataset di linguaggi di programmazione vari, con enfasi su Python, JavaScript, Java, PHP, Go e Ruby. La finestra di contesto di 8.192 token (tramite codifiche posizionali ALiBi) permette l'elaborazione di intere funzioni e di piccoli file in una singola passata. L'addestramento ha incluso pre-addestramento contrastivo su coppie codice-testo (descrizioni in linguaggio naturale abbinate a implementazioni di codice), seguito da fine-tuning supervisionato su dataset di retrieval del codice con mining di negativi difficili. Gli embedding a 768 dimensioni catturano sia la struttura sintattica sia il significato semantico, abilitando il matching del codice cross-linguaggio in cui codice funzionalmente equivalente in linguaggi diversi mappa su regioni vicine dello spazio di embedding.
Prestazione
Al rilascio, il modello era al primo posto in nove dei quindici benchmark CodeNetSearch, superando i modelli di embedding del codice di Microsoft e Salesforce mantenendo un'occupazione più efficiente di 307MB. Il suo contesto di 8.192 token era 4–16 volte più grande di quello dei modelli di embedding del codice concorrenti, abilitando la retrieval su file interi e blocchi di codice complessi. La comprensione del codice cross-linguaggio era una forza particolare, facendo il matching di frammenti funzionalmente equivalenti tra linguaggi di programmazione diversi. Nel 2026, jina-code-embeddings-0.5b e jina-code-embeddings-1.5b rimpiazzano questo modello con backbones autoregressivi, contesto di 32K e precisione di retrieval significativamente maggiore.
Orientamento
Usa per la ricerca del codice, la retrieval della documentazione e il riuso del codice in codebase monolingue o cross-linguaggio. Per documenti che superano 8.192 token, implementa il chunking ai confini di funzione o di classe. Il modello si integra con database vettoriali (Qdrant, Weaviate, MongoDB) e framework RAG. Per nuovi progetti di ricerca del codice, preferisci jina-code-embeddings-1.5b (1,5B parametri, contesto di 32K, accuratezza SOTA) o jina-code-embeddings-0.5b (494M parametri, edge-friendly). GPU con supporto CUDA consigliata per la produzione. Prestazioni migliori su Python, JavaScript, Java, PHP, Go e Ruby; supporta 30+ lingue con degradazione graduale.









