Gráfico de E/S

Código

jina-embeddings-v2-base-code

Tarea

Vector

Frontera de Pareto
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderParámetros (log)nDCG@10
Este modelo
En la frontera
Jina AI
Otros
CoIR
52.24
Parámetros
161M
Rango por score
19 / 31
Frontera de Pareto
Por detrás
Distribución de valores
AUC 0.8156
Corpus
Pares de traducción
Búsqueda documental
Código
0.7500.000.200.400.600.80
Relacionados10.9%
Negativo difícil1.5%
No relacionados1.0%
Umbrales recomendados
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
equilibrado · 0.369
AUC
0.8156
Techo de ruido
0.805
Caída de exhaustividad
0.204
Pares medidos
119 / 11k
Componentes del vector
-0.160.040.25
σ 0.0361 · 183k valores
Geometría del embedding
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.404
Dim. efectivas
43 / 768
Elija modelos para comparar

Descripción general

jina-embeddings-v2-base-code es un modelo de embeddings de código de 161M parámetros que mapea código de programación en 30 lenguajes a un espacio semántico compartido de 768 dimensiones. Con una ventana de contexto de 8.192 tokens, fue el primer modelo de embedding de Jina en soportar la recuperación de funciones completas y de múltiples archivos sin truncamiento. Al momento de su lanzamiento lideraba nueve de quince benchmarks de CodeNetSearch.

Métodos

El modelo usa un codificador basado en transformers de 161M parámetros, entrenado en conjuntos de datos de lenguajes de programación diversos, con énfasis en Python, JavaScript, Java, PHP, Go y Ruby. La ventana de contexto de 8.192 tokens (mediante codificaciones posicionales ALiBi) permite procesar funciones enteras y archivos pequeños en una sola pasada. El entrenamiento incluyó preentrenamiento contrastivo en pares de código y texto (descripciones en lenguaje natural emparejadas con implementaciones de código), seguido de ajuste fino supervisado en conjuntos de datos de recuperación de código con minería de negativos difíciles. Los embeddings de 768 dimensiones capturan tanto la estructura sintáctica como el significado semántico, permitiendo la coincidencia de código entre lenguajes: el código funcionalmente equivalente en diferentes lenguajes se mapea a regiones cercanas del espacio de embedding.

Rendimiento

Al momento de su lanzamiento, el modelo lideraba nueve de quince benchmarks de CodeNetSearch, superando los modelos de embeddings de código de Microsoft y Salesforce mientras mantenía una huella más eficiente de 307MB. Su contexto de 8.192 tokens era 4–16 veces mayor que el de los modelos de embeddings de código competidores, permitiendo la recuperación sobre archivos enteros y bloques de código complejos. La comprensión de código entre lenguajes era una fuerza particular, haciendo coincidir fragmentos funcionalmente equivalentes entre diferentes lenguajes de programación. En 2026, jina-code-embeddings-0.5b y jina-code-embeddings-1.5b reemplazaron a este modelo con backbones autoregresivos, contexto de 32K y una precisión de recuperación significativamente mayor.

Guía

Úselo para búsqueda de código, recuperación de documentación y reutilización de código en bases de código monolingües o multilingües. Para documentos que excedan 8.192 tokens, implemente segmentación (chunking) en límites de función o de clase. El modelo se integra con bases de datos vectoriales (Qdrant, Weaviate, MongoDB) y marcos de RAG. Para nuevos proyectos de búsqueda de código, prefiera jina-code-embeddings-1.5b (1,5B parámetros, contexto de 32K, precisión SOTA) o jina-code-embeddings-0.5b (494M parámetros, amigable con el edge). Se recomienda una GPU con soporte CUDA para producción. El mejor rendimiento está en Python, JavaScript, Java, PHP, Go y Ruby; admite 30+ lenguajes con degradación gradual.

Blogs que mencionan este modelo
abril 08, 2025 • 21 minutos de lectura
jina-reranker-m0: Reranqueador multilingüe y multimodal de documentos
Presentamos jina-reranker-m0, nuestro nuevo reranker multimodal multilingüe para recuperar documentos visuales, con rendimiento SOTA en documentos largos multilingües y tareas de búsqueda de código.
septiembre 27, 2024 • 15 minutos de lectura
Migración de Jina Embeddings v2 a v3
Recopilamos algunos consejos para ayudarte a migrar de Jina Embeddings v2 a v3.
abril 29, 2024 • 7 minutos de lectura
Embeddings y Reranker de Jina en Azure: Soluciones de IA escalables y listas para negocios
Los Jina Embeddings y Rerankers están ahora disponibles en Azure Marketplace. Las empresas que priorizan la privacidad y la seguridad ahora pueden integrar fácilmente los modelos de última generación de Jina AI directamente en su ecosistema Azure existente.
marzo 25, 2024 • 21 minutos de lectura
IA en la Nube de Siguiente Nivel: Jina Embeddings y Rerankers en Amazon SageMaker
Aprende a usar los modelos de Jina Embeddings y Reranking en una aplicación de IA full-stack en AWS, utilizando únicamente componentes disponibles en Amazon SageMaker y AWS Marketplace.
febrero 05, 2024 • 4 minutos de lectura
Optimiza tu búsqueda de código con los nuevos embeddings de Jina Code
El nuevo 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲 está optimizado para la búsqueda de código y docstrings. Este potente modelo admite búsquedas entre inglés y 30 lenguajes de programación ampliamente utilizados, todos con una longitud de contexto de 8192 y rendimiento SOTA.