Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
warning
Эта модель устарела из-за появления новых моделей.
Вложения
Лицензия Apache 2.0
open_in_new Выпуск Пост

jina-embeddings-v2-base-code

Оптимизирован для поиска кода и строки документации.
Лицензия
Apache-2.0
Дата выпуска
calendar_month
2024-02-05
Вход
abc
Текст (Код)
arrow_forward
Выход
more_horiz
Вектор
Позднее фрагментирование help_outline
check_circle
Yes
Подробности модели
Параметры: 137M
Длина входного токена: 8K
Выходной размер: 768
Базовая модель help_outline
open_in_new
jina-embeddings-v2-base-en
Обученные языки help_outline
1 языки
Похожие модели
link
jina-embeddings-v2-base-en
Доступно через
API Джина
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
График ввода-вывода

Код

jina-embeddings-v2-base-code

Задача

Вектор

Pareto fronthelp_outline
CoIR
CoIR · appsretrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderParameters (log)nDCG@10
This model
On the front
Jina AI
Other
CoIR
52.24
Parameters
161M
Rank by score
19 / 31
Pareto front
Behind it
Распределение значенийhelp_outline
AUC 0.8156
Корпус
Пары переводов
Поиск по документации
Код
0.7500.000.200.400.600.80
Связанные10.9%
Сложный отрицательный1.5%
Несвязанные1.0%
Рекомендуемые пороги
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
сбалансированный · 0.369
AUC
0.8156
Потолок шума
0.805
Обрыв полноты
0.204
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
-0.160.040.25
σ 0.0361 · 183k значений
Геометрия эмбеддинговhelp_outline
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.404
Эффективных изм.
43 / 768
Выберите модели для сравнения

Обзор

Jina Embeddings v2 Base Code решает важнейшую задачу в современной разработке программного обеспечения: эффективное перемещение и понимание больших кодовых баз. Для команд разработчиков, которые борются с обнаружением и документированием кода, эта модель преобразует то, как разработчики взаимодействуют с кодом, обеспечивая поиск на естественном языке по 30 языкам программирования. В отличие от традиционных инструментов поиска кода, которые полагаются на точное сопоставление с образцом, эта модель понимает семантическое значение кода, позволяя разработчикам находить соответствующие фрагменты кода с помощью описаний на простом английском языке. Эта возможность особенно ценна для команд, поддерживающих большие устаревшие кодовые базы, разработчиков, подключающихся к новым проектам, или организаций, стремящихся улучшить методы повторного использования и документирования кода.

Методы

Модель достигает своей впечатляющей производительности благодаря специализированной архитектуре, разработанной специально для понимания кода. В своей основе она использует нейронную сеть на основе трансформатора с 161 миллионом параметров, обученную на различных наборах данных языков программирования с упором на шесть основных языков: Python, JavaScript, Java, PHP, Go и Ruby. Уникальность этой архитектуры заключается в ее расширенном окне контекста из 8192 токенов, что позволяет ей обрабатывать целые функции или несколько файлов одновременно, сохраняя семантическое понимание. Модель генерирует плотные 768-мерные вложения, которые фиксируют как синтаксическую структуру, так и семантическое значение кода, что позволяет ей понимать отношения между различными сегментами кода, даже если они используют разные шаблоны программирования или синтаксис для достижения одной и той же цели.

Производительность

В реальных тестах Jina Embeddings v2 Base Code демонстрирует исключительные возможности, лидируя в девяти из пятнадцати важнейших тестов CodeNetSearch. По сравнению с моделями от таких гигантов отрасли, как Microsoft и Salesforce, он достигает превосходной производительности, сохраняя при этом меньший размер. Модель особенно выделяется в межъязыковом понимании кода, успешно сопоставляя функционально эквивалентные фрагменты кода на разных языках программирования. Его контекстное окно из 8192 токенов оказывается особенно ценным для больших функций и сложных файлов кода, значительно превосходя традиционные модели, которые обычно обрабатывают всего несколько сотен токенов. Эффективность модели очевидна в ее компактном размере 307 МБ (без квантования), что обеспечивает быстрый инференс при сохранении высокой точности в задачах поиска и определения сходства кода.

Руководство

Для эффективного развертывания Jina Embeddings v2 Base Code командам следует рассмотреть несколько практических аспектов. Модель легко интегрируется с популярными векторными базами данных, такими как MongoDB, Qdrant и Weaviate, что упрощает создание масштабируемых систем поиска кода. Для оптимальной производительности реализуйте надлежащую предварительную обработку кода для обработки ограничения в 8192 токена, которое обычно охватывает большинство определений функций и классов. Хотя модель поддерживает 30 языков программирования, она демонстрирует наивысшую производительность на шести основных языках: Python, JavaScript, Java, PHP, Go и Ruby. Командам следует рассмотреть возможность использования пакетной обработки для крупномасштабной индексации кода с целью оптимизации производительности. Совместимость модели с RAG делает ее особенно эффективной для задач автоматизированной генерации документации и понимания кода, хотя командам следует реализовать соответствующие стратегии разбиения на фрагменты для очень больших кодовых баз. Для производственных развертываний рассмотрите возможность использования эндпоинта AWS SageMaker для управляемого инференса и реализуйте соответствующие стратегии кэширования для оптимизации производительности запросов.
Блоги, в которых упоминается эта модель
апрель 08, 2025 • 21 минуты чтения
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
сентябрь 27, 2024 • 15 минуты чтения
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
апрель 29, 2024 • 7 минуты чтения
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
март 25, 2024 • 21 минуты чтения
Next-Level Cloud AI: Jina Embeddings and Rerankers on Amazon SageMaker
Learn to use Jina Embeddings and Reranking models in a full-stack AI application on AWS, using only components available in Amazon SageMaker and the AWS Marketplace.
Scott Martens
Saahil Ognawala
Abstract image with colorful wavy background featuring AWS, Embeddings, and Reranker logos.
февраль 05, 2024 • 4 минуты чтения
Elevate Your Code Search with New Jina Code Embeddings
New 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲 is optimized for code & docstring search. This powerful model supports searches between English and 30 widely-used programming languages, all with 8192 context length and SOTA performance.
Jina AI
Abstract image with concentric circles in purple and green, featuring "jina" logo and repeated "code embeddings" text around
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.