График ввода-вывода

Код

jina-code-embeddings

Задача

Вектор

Парето-фронт
100M300M1B3.0B10B50607080b1ade-embedbge-m3EmbeddingGemma-300MF2LLM-v2-80Mgranite-embedding-125m-…granite-embedding-278m-…granite-embedding-311m-…granite-embedding-97m-m…granite-embedding-small…gte-multilingual-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructharrier-oss-v1-270mjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…multilingual-e5-basemultilingual-e5-smallNV-Embed-v2Qwen3-Embedding-0.6BQwen3-Embedding-4BQwen3-Embedding-8Bsnowflake-arctic-embed-…jina-code-embeddings-1.…Параметры (лог)score
Эта модель
На фронте
Jina AI
Другие
MTEB Code
78.94
Параметры
1.5B
Ранг по баллу
3 / 26
Парето-фронт
На фронте
Распределение значений
AUC 0.8780
Корпус
Пары переводов
Поиск по документации
Код
Задача
nl2code.passage
nl2code.query
nl2code.query → nl2code.passage
qa.passage
qa.query
qa.query → qa.passage
0.6810.000.200.400.600.80
Связанные22.7%
Сложный отрицательный2.0%
Несвязанные0.8%
Рекомендуемые пороги
FPR 0.1 · 0.501
FPR 0.01 · 0.681
FPR 0.001 · 0.782
FPR 0.0001 · 0.850
сбалансированный · 0.372
AUC
0.8780
Потолок шума
0.782
Обрыв полноты
0.244
Измерено пар
119 / 11k
Компоненты вектора
-0.240.000.24
σ 0.0255 · 366k значений
Геометрия эмбеддингов
01536
Среднее по измерениям, наведите для диапазона
Уровень шума
0.311
Эффективных изм.
60 / 1536
Выберите модели для сравнения
Публикации (1)

Обзор

jina-code-embeddings-1.5b — эмбеддинг-модель для кода на 1,5B параметров, которая отображает программный код и запросы на естественном языке в общее 1536-мерное семантическое пространство. Поддерживает окна контекста в 32K токенов, что позволяет искать по целым файлам и мультифайловым кодовым контекстам. Достигает передовых результатов в поиске кода, существенно превосходя свою 0,5B версию и значительно более крупные специализированные модели поиска кода.

Методы

Модель построена на autoregressive трансформер-бэкбоне, предобученном на корпусах естественного языка и кода, использующем цель предобучения генерации кода для создания богатых семантических представлений. Она извлекает эмбеддинги через Last-Token-Pooling с последней позиции последовательности — каузальное внимание autoregressive модели естественно обращено на весь контекст входа, а цель генерации кода создаёт представления, улавливающие и синтаксическую структуру, и функциональную семантику. Обучение использует двухстадийный рецепт: (1) контрастивное предобучение на больших парах «код-текст», (2) супервизированное дообучение на отобранных датасетах поиска кода с добычей трудных негативов. Длина контекста 32K обеспечивается rotary position embeddings с подогнанной базовой частотой. Обучение представлений Matryoshka позволяет урезать размерность с 1536 до 128.

Производительность

Модель достигает среднего значения 79,04% в целом и 78,94% в среднем MTEB Code, устанавливая новые бенчмарки для своего класса параметров. Заметные результаты: 98,41% на HumanEval, 90,13% на MBPP, 98,02% на WikiSQL, 99,44% на CodeChefXLang, 92,54% на CodeTransOceanContest (код в код), 86,45% на COIR-CodeSearchNet (NL2Code), 96,34% на Doc2Code, 92,37% на StackOverflowQA и 86,33% на SWE-Bench (против 83,00% у 0,5B версии). Она превосходит более крупные альтернативы и показывает устойчивые улучшения относительно 0,5B версии, особенно на сложных мультифайловых и межрепозиторных задачах.

Руководство

Стратегически применяйте инструктивные префиксы в зависимости от требований поиска: nl2code, code2code, code2nl, techqa, code2completion. Сохраняйте согласованность во всей конвейере — в заданном сценарии поиска используйте один тип префикса для запросов и документов. Увеличенная ёмкость 1,5B идеальна для сложных сценариев с несколькими программными парадигмами и большими кодовыми базами. Профилируйте сценарии использования, чтобы определить оптимальное измерение Matryoshka, балансирующее качество и ресурсы; 256–512 измерений — хорошая отправная точка для индексации, 1536 — для re-ranking. Для согласования с обучением в продакшене используйте размер батча 256. Модель превосходна для межрепозиторного и межъязыкового поиска при показателе 99,44% на CodeChefXLang. Встраивайте как основной поисковый компонент в RAG-системах, в паре с jina-reranker-v3.5 для точности на 50 лучших кандидатах. Используйте косинусное сходство для сравнения эмбеддингов. Оптимально для корпоративных развёртываний, где нужны и производительность, и эффективность с латентностью менее секунды.

Блоги, в которых упоминается эта модель