График ввода-вывода

Код

jina-embeddings-v2-base-code

Задача

Вектор

Парето-фронт
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderПараметры (лог)nDCG@10
Эта модель
На фронте
Jina AI
Другие
CoIR
52.24
Параметры
161M
Ранг по баллу
19 / 31
Парето-фронт
Позади
Распределение значений
AUC 0.8156
Корпус
Пары переводов
Поиск по документации
Код
0.7500.000.200.400.600.80
Связанные10.9%
Сложный отрицательный1.5%
Несвязанные1.0%
Рекомендуемые пороги
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
сбалансированный · 0.369
AUC
0.8156
Потолок шума
0.805
Обрыв полноты
0.204
Измерено пар
119 / 11k
Компоненты вектора
-0.160.040.25
σ 0.0361 · 183k значений
Геометрия эмбеддингов
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.404
Эффективных изм.
43 / 768
Выберите модели для сравнения

Обзор

jina-embeddings-v2-base-code — эмбеддинг-модель для кода на 161M параметров, которая отображает программный код на 30 языках в общее 768-мерное семантическое пространство. С окном контекста в 8 192 токенов это была первая эмбеддинг-модель Jina, поддержавшая поиск по целым функциям и нескольким файлам без усечения. На момент релиза она лидировала на девяти из пятнадцати бенчмарков CodeNetSearch.

Методы

Модель использует трансформерный энкодер на 161M параметров, обученный на разнообразных датасетах программирования с акцентом на Python, JavaScript, Java, PHP, Go и Ruby. Окно контекста в 8 192 токенов (через ALiBi позиционное кодирование) позволяет обрабатывать целые функции и небольшие файлы за один прямой проход. Обучение включало контрастивное предобучение на парах «код-текст» (описания на естественном языке, спаренные с реализациями кода) с последующим контролируемым дообучением на датасетах поиска кода с добычей трудных негативов. 768-мерные эмбеддинги улавливают и синтаксическую структуру, и семантический смысл, обеспечивая межъязыковое сопоставление кода: функционально эквивалентный код на разных языках отображается в соседние области пространства эмбеддингов.

Производительность

На момент релиза модель лидировала на девяти из пятнадцати бенчмарков CodeNetSearch, превосходя эмбеддинг-модели кода от Microsoft и Salesforce при более эффективном footprint 307 МБ. Её контекст в 8 192 токенов был на 4–16 раз больше, чем у конкурирующих эмбеддинг-моделей кода, что позволяло искать по целым файлам и сложным блокам кода. Межъязыковое понимание кода было особым преимуществом, сопоставляя функционально эквивалентные фрагменты на разных языках программирования. В 2026 году jina-code-embeddings-0.5b и jina-code-embeddings-1.5b вытесняют эту модель с autoregressive бэкбонами, контекстом 32K и существенно более высокой точностью поиска.

Руководство

Используйте для поиска кода, поиска документации и повторного использования кода в одноязычных и межъязыковых кодовых базах. Для документов свыше 8 192 токенов реализуйте чанкинг на границах функций или классов. Модель интегрируется с векторными базами данных (Qdrant, Weaviate, MongoDB) и RAG-фреймворками. Для новых проектов поиска кода предпочитайте jina-code-embeddings-1.5b (1,5B параметров, контекст 32K, SOTA-точность) или jina-code-embeddings-0.5b (494M параметров, пригодна для edge-устройств). Для продакшена рекомендуется GPU с поддержкой CUDA. Наилучшая производительность на Python, JavaScript, Java, PHP, Go и Ruby; поддерживает 30+ языков с плавным снижением качества.

Блоги, в которых упоминается эта модель
апрель 08, 2025 • 21 минуты чтения
jina-reranker-m0: Многоязычный мультимодальный ранжировщик документов
Представляем jina-reranker-m0, наш новый мультиязычный мультимодальный ранжировщик для поиска визуальных документов, демонстрирующий передовую производительность в задачах поиска многоязычных длинных документов и программного кода.
сентябрь 27, 2024 • 15 минуты чтения
Миграция с Jina Embeddings v2 на v3
Мы собрали несколько советов, которые помогут вам мигрировать с Jina Embeddings v2 на v3.
апрель 29, 2024 • 7 минуты чтения
Jina Embeddings и Reranker в Azure: масштабируемые AI-решения для бизнеса
Теперь Jina Embeddings и Rerankers доступны в Azure Marketplace. Предприятия, для которых приоритетом являются конфиденциальность и безопасность, могут легко интегрировать современные модели Jina AI прямо в свою существующую экосистему Azure.
март 25, 2024 • 21 минуты чтения
Новый уровень облачного ИИ: Jina Embeddings и Rerankers на Amazon SageMaker
Научитесь использовать модели Jina Embeddings и Reranking в полноценном AI-приложении на AWS, используя только компоненты, доступные в Amazon SageMaker и AWS Marketplace.
февраль 05, 2024 • 4 минуты чтения
Улучшите свой поиск по коду с помощью новых Code Embeddings от Jina
Новая модель 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲 оптимизирована для поиска по коду и документации. Эта мощная модель поддерживает поиск между английским и 30 широко используемыми языками программирования, всё с контекстным окном в 8192 токена и производительностью на уровне SOTA.