Обзор
jina-embeddings-v2-base-code — эмбеддинг-модель для кода на 161M параметров, которая отображает программный код на 30 языках в общее 768-мерное семантическое пространство. С окном контекста в 8 192 токенов это была первая эмбеддинг-модель Jina, поддержавшая поиск по целым функциям и нескольким файлам без усечения. На момент релиза она лидировала на девяти из пятнадцати бенчмарков CodeNetSearch.
Методы
Модель использует трансформерный энкодер на 161M параметров, обученный на разнообразных датасетах программирования с акцентом на Python, JavaScript, Java, PHP, Go и Ruby. Окно контекста в 8 192 токенов (через ALiBi позиционное кодирование) позволяет обрабатывать целые функции и небольшие файлы за один прямой проход. Обучение включало контрастивное предобучение на парах «код-текст» (описания на естественном языке, спаренные с реализациями кода) с последующим контролируемым дообучением на датасетах поиска кода с добычей трудных негативов. 768-мерные эмбеддинги улавливают и синтаксическую структуру, и семантический смысл, обеспечивая межъязыковое сопоставление кода: функционально эквивалентный код на разных языках отображается в соседние области пространства эмбеддингов.
Производительность
На момент релиза модель лидировала на девяти из пятнадцати бенчмарков CodeNetSearch, превосходя эмбеддинг-модели кода от Microsoft и Salesforce при более эффективном footprint 307 МБ. Её контекст в 8 192 токенов был на 4–16 раз больше, чем у конкурирующих эмбеддинг-моделей кода, что позволяло искать по целым файлам и сложным блокам кода. Межъязыковое понимание кода было особым преимуществом, сопоставляя функционально эквивалентные фрагменты на разных языках программирования. В 2026 году jina-code-embeddings-0.5b и jina-code-embeddings-1.5b вытесняют эту модель с autoregressive бэкбонами, контекстом 32K и существенно более высокой точностью поиска.
Руководство
Используйте для поиска кода, поиска документации и повторного использования кода в одноязычных и межъязыковых кодовых базах. Для документов свыше 8 192 токенов реализуйте чанкинг на границах функций или классов. Модель интегрируется с векторными базами данных (Qdrant, Weaviate, MongoDB) и RAG-фреймворками. Для новых проектов поиска кода предпочитайте jina-code-embeddings-1.5b (1,5B параметров, контекст 32K, SOTA-точность) или jina-code-embeddings-0.5b (494M параметров, пригодна для edge-устройств). Для продакшена рекомендуется GPU с поддержкой CUDA. Наилучшая производительность на Python, JavaScript, Java, PHP, Go и Ruby; поддерживает 30+ языков с плавным снижением качества.









