Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
warning
Este modelo está obsoleto por los modelos más nuevos.
Incrustaciones
Licencia Apache 2.0
open_in_new Publicación de lanzamiento

jina-embeddings-v2-base-code

Optimizado para búsqueda de código y cadenas de documentos
Licencia
Apache-2.0
Fecha de lanzamiento
calendar_month
2024-02-05
Aporte
abc
Texto (Código)
arrow_forward
Producción
more_horiz
Vector
Fragmentación tardía help_outline
check_circle
Yes
Detalles del modelo
Parámetros: 137M
Longitud del token de entrada: 8K
Dimensión de salida: 768
Modelo base help_outline
open_in_new
jina-embeddings-v2-base-en
Idiomas entrenados help_outline
1 idiomas
Modelos relacionados
link
jina-embeddings-v2-base-en
Disponible a través de
API de Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Gráfico de E/S

Código

jina-embeddings-v2-base-code

Tarea

Vector

Pareto fronthelp_outline
CoIR
CoIR · appsretrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderParameters (log)nDCG@10
This model
On the front
Jina AI
Other
CoIR
52.24
Parameters
161M
Rank by score
19 / 31
Pareto front
Behind it
Distribución de valoreshelp_outline
AUC 0.8156
Corpus
Pares de traducción
Búsqueda documental
Código
0.7500.000.200.400.600.80
Relacionados10.9%
Negativo difícil1.5%
No relacionados1.0%
Umbrales recomendados
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
equilibrado · 0.369
AUC
0.8156
Techo de ruido
0.805
Caída de exhaustividad
0.204
Pares medidos
119 / 11k
Componentes del vectorhelp_outline
-0.160.040.25
σ 0.0361 · 183k valores
Geometría del embeddinghelp_outline
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.404
Dim. efectivas
43 / 768
Elige modelos para comparar

Descripción general

Jina Embeddings v2 Base Code aborda un desafío crítico en el desarrollo de software moderno: navegar y comprender de manera eficiente bases de código grandes. Para los equipos de desarrollo que tienen dificultades con el descubrimiento y la documentación de código, este modelo transforma la forma en que los desarrolladores interactúan con el código al permitir la búsqueda en lenguaje natural en 30 lenguajes de programación. A diferencia de las herramientas de búsqueda de código tradicionales que se basan en la coincidencia exacta de patrones, este modelo comprende el significado semántico detrás del código, lo que permite a los desarrolladores encontrar fragmentos de código relevantes mediante descripciones en inglés simple. Esta capacidad es particularmente valiosa para los equipos que mantienen bases de código heredadas de gran tamaño, los desarrolladores que se incorporan a nuevos proyectos o las organizaciones que buscan mejorar las prácticas de documentación y reutilización de código.

Métodos

El modelo logra su impresionante rendimiento a través de una arquitectura especializada diseñada específicamente para la comprensión del código. En esencia, utiliza una red neuronal basada en transformadores con 161 millones de parámetros, entrenada en diversos conjuntos de datos de lenguajes de programación con énfasis en seis lenguajes principales: Python, JavaScript, Java, PHP, Go y Ruby. Lo que hace que esta arquitectura sea única es su ventana de contexto extendida de 8192 tokens, lo que le permite procesar funciones completas o múltiples archivos a la vez mientras mantiene la comprensión semántica. El modelo genera incrustaciones densas de 768 dimensiones que capturan tanto la estructura sintáctica como el significado semántico del código, lo que le permite comprender las relaciones entre diferentes segmentos de código incluso cuando utilizan diferentes patrones de programación o sintaxis para lograr el mismo objetivo.

Actuación

En pruebas reales, Jina Embeddings v2 Base Code demuestra capacidades excepcionales, liderando el campo en nueve de quince puntos de referencia cruciales de CodeNetSearch. En comparación con modelos de gigantes de la industria como Microsoft y Salesforce, logra un rendimiento superior al mismo tiempo que mantiene una huella más eficiente. El modelo se destaca particularmente en la comprensión de código entre lenguajes, al hacer coincidir con éxito fragmentos de código funcionalmente equivalentes en diferentes lenguajes de programación. Su ventana de contexto de 8192 tokens resulta particularmente valiosa para funciones grandes y archivos de código complejos, superando significativamente a los modelos tradicionales que generalmente manejan solo unos pocos cientos de tokens. La eficiencia del modelo es evidente en su tamaño compacto de 307 MB (sin cuantificar), lo que permite una inferencia rápida al tiempo que mantiene una alta precisión en tareas de similitud y búsqueda de código.

Guía

Para implementar de manera eficaz Jina Embeddings v2 Base Code, los equipos deben considerar varios aspectos prácticos. El modelo se integra perfectamente con bases de datos vectoriales populares como MongoDB, Qdrant y Weaviate, lo que facilita la creación de sistemas de búsqueda de código escalables. Para lograr un rendimiento óptimo, implemente un preprocesamiento de código adecuado para manejar el límite de 8192 tokens, que generalmente admite la mayoría de las definiciones de funciones y clases. Si bien el modelo admite 30 lenguajes de programación, muestra el mejor rendimiento en los seis lenguajes principales: Python, JavaScript, Java, PHP, Go y Ruby. Los equipos deben considerar el uso del procesamiento por lotes para la indexación de código a gran escala para optimizar el rendimiento. La compatibilidad del modelo con RAG lo hace particularmente eficaz para la generación automatizada de documentación y las tareas de comprensión de código, aunque los equipos deben implementar estrategias de fragmentación adecuadas para bases de código muy grandes. Para implementaciones de producción, considere usar el punto de conexión de AWS SageMaker para la inferencia administrada e implemente estrategias de almacenamiento en caché adecuadas para optimizar el rendimiento de las consultas.
Blogs que mencionan este modelo
abril 08, 2025 • 21 minutos de lectura
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
septiembre 27, 2024 • 15 minutos de lectura
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
abril 29, 2024 • 7 minutos de lectura
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
marzo 25, 2024 • 21 minutos de lectura
Next-Level Cloud AI: Jina Embeddings and Rerankers on Amazon SageMaker
Learn to use Jina Embeddings and Reranking models in a full-stack AI application on AWS, using only components available in Amazon SageMaker and the AWS Marketplace.
Scott Martens
Saahil Ognawala
Abstract image with colorful wavy background featuring AWS, Embeddings, and Reranker logos.
febrero 05, 2024 • 4 minutos de lectura
Elevate Your Code Search with New Jina Code Embeddings
New 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲 is optimized for code & docstring search. This powerful model supports searches between English and 30 widely-used programming languages, all with 8192 context length and SOTA performance.
Jina AI
Abstract image with concentric circles in purple and green, featuring "jina" logo and repeated "code embeddings" text around
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.