График ввода-вывода 1
График ввода-вывода 2
Распределение значенийhelp_outlineAUC 0.9726
Корпус
Пары переводов
Код
Связанные81.0%
Сложный отрицательный10.3%
Несвязанные0.8%
Наведите курсор или щёлкните по графику, чтобы сдвинуть порог
Рекомендуемые пороги
FPR 0.1 · 17.83
FPR 0.01 · 19.14
FPR 0.001 · 21.08
FPR 0.0001 · 23.67
сбалансированный · 18.66
AUC
0.9726
Потолок шума
21.05
Обрыв полноты
16.22
Измерено пар
100 / 9,200
Оценка по позицииhelp_outline
Средняя оценка на каждой позиции
Выберите модели для сравнения
Публикации (1)
Обзор
Jina-ColBERT-v2 — это новаторская многоязычная модель поиска информации, которая решает критическую задачу эффективного, высококачественного поиска на нескольких языках. Как первая многоязычная модель ColBERT, которая генерирует компактные вложения, она удовлетворяет растущую потребность в масштабируемых, экономически эффективных многоязычных поисковых решениях в глобальных приложениях. Организации, работающие с многоязычным контентом, от платформ электронной коммерции до систем управления контентом, могут использовать эту модель для предоставления точных результатов поиска на 89 языках, при этом значительно сокращая затраты на хранение и вычисления благодаря ее инновационным возможностям сокращения размерности.
Методы
Модель основана на архитектуре ColBERT, внедряя сложный механизм позднего взаимодействия, который кардинально меняет способ сопоставления запросов и документов. В своей основе она использует модифицированную основу XLM-RoBERTa с 560M параметрами, улучшенную вращающимися позиционными вложениями и оптимизированную с помощью флэш-внимания. Процесс обучения включает два ключевых этапа: начальное предварительное обучение с разнообразными слабо контролируемыми данными из разных языков, за которым следует тонкая настройка с маркированными триплетными данными и контролируемой дистилляцией. Уникальность этого подхода заключается в реализации обучения представлению Matryoshka, которое позволяет модели производить вложения в нескольких измерениях (128, 96 или 64) из одного процесса обучения, что позволяет проводить динамическую оптимизацию хранения без повторного обучения.
Производительность
В реальных тестах Jina-ColBERT-v2 демонстрирует исключительные возможности в нескольких тестах. Он достигает 6,5% улучшения по сравнению с оригинальным ColBERT-v2 в задачах на английском языке, со средним баллом 0,521 по 14 тестам BEIR. Что еще более впечатляюще, он превосходит традиционные методы поиска на основе BM25 по всем протестированным языкам в тестах MIRACL, показывая особую силу в кросс-языковых сценариях. Модель сохраняет эту высокую производительность даже при использовании сокращенных измерений встраивания — снижение со 128 до 64 измерений приводит всего к 1,5% снижению производительности при сокращении вдвое требований к хранению. Это приводит к значительной экономии затрат в производстве: например, хранение 100 миллионов документов с 64-мерными векторами стоит 659,62 долл. США в месяц на AWS по сравнению с 1319,24 долл. США для 128 измерений.
Руководство
Для эффективного развертывания Jina-ColBERT-v2 команды должны рассмотреть несколько практических аспектов. Для оптимальной производительности модели требуется оборудование с поддержкой CUDA, а также она поддерживает длину документов до 8192 токенов (с возможностью расширения до 12288) при ограничении запросов 32 токенами. Для производственного развертывания модель доступна через API Jina Search Foundation, AWS marketplace и Azure, а некоммерческая версия доступна через Hugging Face. При реализации команды должны указать, внедряют ли они запросы или документы, поскольку модель использует асимметричное кодирование. Модель не предназначена для обработки в реальном времени очень больших коллекций документов без надлежащего индексирования, и хотя она отлично подходит для многоязычного поиска, она может показывать немного более низкую производительность при выполнении специализированных задач, специфичных для доменов, по сравнению с моделями, настроенными для этих конкретных доменов.
Блоги, в которых упоминается эта модель









