Descripción general
jina-embeddings-v2-base-code es un modelo de embeddings de código de 161M parámetros que mapea código de programación en 30 lenguajes a un espacio semántico compartido de 768 dimensiones. Con una ventana de contexto de 8.192 tokens, fue el primer modelo de embedding de Jina en soportar la recuperación de funciones completas y de múltiples archivos sin truncamiento. Al momento de su lanzamiento lideraba nueve de quince benchmarks de CodeNetSearch.
Métodos
El modelo usa un codificador basado en transformers de 161M parámetros, entrenado en conjuntos de datos de lenguajes de programación diversos, con énfasis en Python, JavaScript, Java, PHP, Go y Ruby. La ventana de contexto de 8.192 tokens (mediante codificaciones posicionales ALiBi) permite procesar funciones enteras y archivos pequeños en una sola pasada. El entrenamiento incluyó preentrenamiento contrastivo en pares de código y texto (descripciones en lenguaje natural emparejadas con implementaciones de código), seguido de ajuste fino supervisado en conjuntos de datos de recuperación de código con minería de negativos difíciles. Los embeddings de 768 dimensiones capturan tanto la estructura sintáctica como el significado semántico, permitiendo la coincidencia de código entre lenguajes: el código funcionalmente equivalente en diferentes lenguajes se mapea a regiones cercanas del espacio de embedding.
Rendimiento
Al momento de su lanzamiento, el modelo lideraba nueve de quince benchmarks de CodeNetSearch, superando los modelos de embeddings de código de Microsoft y Salesforce mientras mantenía una huella más eficiente de 307MB. Su contexto de 8.192 tokens era 4–16 veces mayor que el de los modelos de embeddings de código competidores, permitiendo la recuperación sobre archivos enteros y bloques de código complejos. La comprensión de código entre lenguajes era una fuerza particular, haciendo coincidir fragmentos funcionalmente equivalentes entre diferentes lenguajes de programación. En 2026, jina-code-embeddings-0.5b y jina-code-embeddings-1.5b reemplazaron a este modelo con backbones autoregresivos, contexto de 32K y una precisión de recuperación significativamente mayor.
Guía
Úselo para búsqueda de código, recuperación de documentación y reutilización de código en bases de código monolingües o multilingües. Para documentos que excedan 8.192 tokens, implemente segmentación (chunking) en límites de función o de clase. El modelo se integra con bases de datos vectoriales (Qdrant, Weaviate, MongoDB) y marcos de RAG. Para nuevos proyectos de búsqueda de código, prefiera jina-code-embeddings-1.5b (1,5B parámetros, contexto de 32K, precisión SOTA) o jina-code-embeddings-0.5b (494M parámetros, amigable con el edge). Se recomienda una GPU con soporte CUDA para producción. El mejor rendimiento está en Python, JavaScript, Java, PHP, Go y Ruby; admite 30+ lenguajes con degradación gradual.









