График ввода-вывода 1
График ввода-вывода 2
Парето-фронт
300M1B3.0B10B4050607080bge-m3 (multi-vector)bge-reranker-v2-gemmabge-reranker-v2-m3bge-reranker-v2.5-gemma…ColBERT-ZeroGTE-ModernColBERT-v1jina-reranker-m0jina-reranker-v2-base-m…jina-reranker-v3jina-reranker-v3.5LFM2.5-ColBERT-350Mmxbai-rerank-base-v2mxbai-rerank-large-v2PLAID-XQwen3-Reranker-0.6BQwen3-Reranker-4Bjina-colbert-v2Параметры (лог)nDCG@10
Эта модель
На фронте
Jina AI
Другие
MIRACL
62.30
Параметры
559M
Ранг по баллу
13 / 17
Парето-фронт
Позади
Распределение значений
AUC 0.9726
Корпус
Пары переводов
Код
19.141518202325
Связанные81.0%
Сложный отрицательный10.3%
Несвязанные0.8%
Рекомендуемые пороги
FPR 0.1 · 17.83
FPR 0.01 · 19.14
FPR 0.001 · 21.08
FPR 0.0001 · 23.67
сбалансированный · 18.66
AUC
0.9726
Потолок шума
21.05
Обрыв полноты
16.22
Измерено пар
100 / 9 200
Оценка по позиции
12345678910
Средняя оценка на каждой позиции
Выберите модели для сравнения
Публикации (1)

Обзор

jina-colbert-v2 — мультиязычная late-interaction поисковая модель на 560M параметров, поддерживающая 89 языков. Это первая мультиязычная модель типа ColBERT, генерирующая компактные эмбеддинги на уровне токенов (64–128 измерений на токен), что обеспечивает масштабируемый и экономичный мультиязычный поиск. Обучение представлений Matryoshka позволяет снизить размерность с 128 до 64 при падении качества всего на 1,5%, вдвое сокращая требования к хранилищу.

Методы

Модель построена на архитектуре late-interaction ColBERT с модифицированным бэкбоном XLM-RoBERTa (560M параметров), усиленной rotary position embeddings и оптимизированной Flash Attention. Обучение включает два ключевых этапа: (1) начальное предобучение на разнообразных слабо-надзорных данных различных языков, (2) дообучение на размеченных тройках данных с контролируемой дистилляцией из более крупной учительной модели. Ключевая инновация — реализация обучения представлений Matryoshka для мульти-векторных эмбеддингов: модель производит векторы на уровне токенов в 128, 96 или 64 измерениях из одного процесса обучения, обеспечивая динамическую оптимизацию хранилища без переобучения. Контекст документов в 8 192 токенов (расширяемый до 12 288) и лимит запросов в 32 токена управляются ALiBi позиционным кодированием.

Производительность

Модель достигает улучшения на 6,5% по сравнению с исходным ColBERT-v2 на английских задачах, со средним счётом 0,521 на 14 бенчмарках BEIR. Она превосходит традиционные методы поиска на основе BM25 во всех тестируемых языках на бенчмарках MIRACL, демонстрируя особую силу в межъязыковых сценариях. Снижение с 128 до 64 измерений приводит лишь к 1,5% потери качества, вдвое сокращая требования к хранилищу — например, хранение 100 миллионов документов с 64-мерными векторами стоит 659,62 $/месяц на AWS, против 1 319,24 $ для 128 измерений. Мультиязычный охват модели (89 языков) и компактные эмбеддинги на уровне токенов делают её уникально подходящей для глобальных поисковых приложений.

Руководство

Модель требует аппаратного обеспечения с поддержкой CUDA для оптимальной производительности. Она поддерживает длину документов до 8 192 токенов (расширяемую до 12 288), ограничивая запросы 32 токенами. Для продакшен-развёртывания доступна через Jina Search Foundation API, AWS marketplace и Azure, с некоммерческой версией на Hugging Face. При реализации указывайте, что именно вы эмбеддите — запросы или документы: модель использует асимметричное кодирование. Модель не рассчитана на обработку в реальном времени сверхбольших коллекций документов без должной индексации; для ANN-поиска используйте FAISS, Qdrant или Weaviate. Для задач в специфической области рассмотрите дообучение на вашем корпусе. Для поиска с единственным вектором и выходом в больших измерениях рассмотрите jina-embeddings-v4 (режим мульти-векторов) или jina-embeddings-v5-text-small.

Блоги, в которых упоминается эта модель
октябрь 03, 2025 • 7 минуты чтения
Jina Reranker v3: 0.6B Listwise Reranker для SOTA Мультиязычного Поиска
Новый списочный реранкер с 0.6B параметрами, который рассматривает запрос и все документы-кандидаты в едином контекстном окне.
декабрь 16, 2024 • 2 минуты чтения
Re·Search: Ежегодник 2024 о достижениях в области поисковых технологий
Встречайте Re·Search — наш премиальный ежегодник, в котором собраны лучшие исследовательские статьи и базовые модели поиска за 2024 год. Издание отличает твердая обложка с выборочным УФ-лакированием, 160 полноцветных страниц и тщательно продуманный дизайн. Доступен по всему миру по цене $35, включая доставку.
октябрь 29, 2024 • 11 минуты чтения
CLIP и не только: как Jina-CLIP развивает мультимодальный поиск
Узнайте, как Jina-CLIP улучшает модель CLIP от OpenAI, обеспечивая более высокую точность поиска и более разнообразные результаты благодаря унифицированным текстово-графическим эмбеддингам.
август 30, 2024 • 10 минуты чтения
Jina ColBERT v2: многоязычный ретривер с поздним взаимодействием для эмбеддингов и переранжирования
Jina ColBERT v2 поддерживает 89 языков с улучшенной производительностью поиска, настраиваемой размерностью выходных данных и длиной токена 8192.
февраль 20, 2024 • 16 минуты чтения
Что такое ColBERT и позднее взаимодействие, и почему они важны для поиска?
Модель ColBERT от Jina AI на платформе Hugging Face вызвала оживленные дискуссии в Twitter, предлагая новый взгляд на поиск благодаря возможности обработки 8192 токенов. В этой статье разбираются тонкости ColBERT и ColBERTv2, демонстрируя их инновационный дизайн и объясняя, почему их функция позднего взаимодействия является революционной для поиска.