Обзор
jina-colbert-v1-en — англоязычная late-interaction поисковая модель на 137M параметров, которая формирует эмбеддинги на уровне токенов (128 измерений на токен), а не единственный вектор документа. Это даёт качество cross-encoder при эффективности bi-encoder: документы индексируются один раз, а оценка релевантности происходит во время запроса путём max-pooling и суммирования по парам токенов. Поддерживает документы до 8 192 токенов и стала первой моделью Jina, выведшей поиск в стиле ColBERT в продакшен.
Методы
Модель использует архитектуру late-interaction на основе адаптированного подхода ColBERT. Вместо сравнения целых документов за один раз она обрабатывает запросы и документы независимо до финального этапа сопоставления. Инкодер документов обрабатывает текст до 8 192 токенов; инкодер запросов создаёт точные представления на уровне токенов. Каждый токен запроса и документа получает собственный 128-мерный эмбеддинг-вектор, сохраняя тонкую семантическую информацию, теряемую в одно-векторных моделях. Механизм late-interaction вычисляет оценки релевантности max-pooling по токенам запроса и суммированием по токенам документа, избегая дорогих all-to-all внимания cross-encoders, но сохраняя сигналы сопоставления на уровне токенов. Архитектура использует 137M параметров с BERT-инкодерами и ALiBi позиционным кодированием для контекста в 8 192 токенов.
Производительность
На коллекции датасетов BEIR модель достигает превосходных результатов: 49,4% на Arguana (против 46,5% у ColBERTv2), 79,5% на FEVER (против 78,8%) и 75,0% на TREC-COVID (против 72,6%). Наиболее впечатляет драматическое улучшение на бенчмарке LoCo для понимания длинного контекста: 83,7% против 74,3% у ColBERTv2 — прирост на 9,4 пункта, демонстрирующий ценность представлений на уровне токенов для длинных документов. Модель превосходит традиционные одно-векторные эмбеддинг-модели, сохраняя вычислительную эффективность благодаря подходу late-interaction. Количество параметров (137M) делает её практичной для продакшен-развёртываний.
Руководство
Используйте эту модель, когда вам нужно качество поиска cross-encoder без задержки cross-encoder. Для оптимальной производительности требуется GPU с поддержкой CUDA; инференс на CPU возможен для разработки. Лимит документов в 8 192 токенов соответствует примерно 6 000 словам и подходит для большинства типов документов, включая научные статьи и техническую документацию. Модель только на английском — для мультиязычных приложений используйте jina-colbert-v2. Для продакшен-развёртываний реализуйте правильные стратегии чанкинга документов и используйте индексы векторного сходства (FAISS, Qdrant, Weaviate) для эффективного поиска. Модель особенно эффективна в RAG-конвейерах с фреймворками вроде RAGatouille, упрощающими реализацию late-interaction. Для мультиязычных или более высокоточных задач рассмотрите jina-colbert-v2 или jina-embeddings-v4 (режим мульти-векторов).











