Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
Вложения
Реранкер
copyright CC BY-NC 4.0
open_in_new Выпуск Пост

jina-colbert-v2

Лучший многоязычный ColBERT с высочайшей производительностью при встраивании и переоценке
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2024-08-31
Вход
abc
Текст
arrow_forward
Выход
apps
Многовекторный
Размерности Matryoshka help_outline
64
96
128
Подробности модели
Параметры: 560M
Длина входного токена: 8K
Выходной размер: 128
Базовая модель help_outline
open_in_new
XLM-RoBERTa Large
Обученные языки help_outline
89 языки
Поддерживаемые языки help_outline
108 языки
Похожие модели
link
jina-colbert-v1-en
Доступно через
API Джина
AWS SageMaker
Microsoft Azure
Google Облако
Hugging Face
Air-gapped
График ввода-вывода 1

несколько

Вектор

Запрос

jina-colbert-v2

График ввода-вывода 2

несколько

Вектор

Документ

jina-colbert-v2

Распределение значенийhelp_outline
AUC 0.9726
Корпус
Пары переводов
Код
19.141518202325
Связанные81.0%
Сложный отрицательный10.3%
Несвязанные0.8%
Наведите курсор или щёлкните по графику, чтобы сдвинуть порог
Рекомендуемые пороги
FPR 0.1 · 17.83
FPR 0.01 · 19.14
FPR 0.001 · 21.08
FPR 0.0001 · 23.67
сбалансированный · 18.66
AUC
0.9726
Потолок шума
21.05
Обрыв полноты
16.22
Измерено пар
100 / 9,200
Оценка по позицииhelp_outline
12345678910
Средняя оценка на каждой позиции
Выберите модели для сравнения
Публикации (1)
EMNLP 2024
август 30, 2024
Jina-ColBERT-v2: A General-Purpose Multilingual Late Interaction Retriever

Обзор

Jina-ColBERT-v2 — это новаторская многоязычная модель поиска информации, которая решает критическую задачу эффективного, высококачественного поиска на нескольких языках. Как первая многоязычная модель ColBERT, которая генерирует компактные вложения, она удовлетворяет растущую потребность в масштабируемых, экономически эффективных многоязычных поисковых решениях в глобальных приложениях. Организации, работающие с многоязычным контентом, от платформ электронной коммерции до систем управления контентом, могут использовать эту модель для предоставления точных результатов поиска на 89 языках, при этом значительно сокращая затраты на хранение и вычисления благодаря ее инновационным возможностям сокращения размерности.

Методы

Модель основана на архитектуре ColBERT, внедряя сложный механизм позднего взаимодействия, который кардинально меняет способ сопоставления запросов и документов. В своей основе она использует модифицированную основу XLM-RoBERTa с 560M параметрами, улучшенную вращающимися позиционными вложениями и оптимизированную с помощью флэш-внимания. Процесс обучения включает два ключевых этапа: начальное предварительное обучение с разнообразными слабо контролируемыми данными из разных языков, за которым следует тонкая настройка с маркированными триплетными данными и контролируемой дистилляцией. Уникальность этого подхода заключается в реализации обучения представлению Matryoshka, которое позволяет модели производить вложения в нескольких измерениях (128, 96 или 64) из одного процесса обучения, что позволяет проводить динамическую оптимизацию хранения без повторного обучения.

Производительность

В реальных тестах Jina-ColBERT-v2 демонстрирует исключительные возможности в нескольких тестах. Он достигает 6,5% улучшения по сравнению с оригинальным ColBERT-v2 в задачах на английском языке, со средним баллом 0,521 по 14 тестам BEIR. Что еще более впечатляюще, он превосходит традиционные методы поиска на основе BM25 по всем протестированным языкам в тестах MIRACL, показывая особую силу в кросс-языковых сценариях. Модель сохраняет эту высокую производительность даже при использовании сокращенных измерений встраивания — снижение со 128 до 64 измерений приводит всего к 1,5% снижению производительности при сокращении вдвое требований к хранению. Это приводит к значительной экономии затрат в производстве: например, хранение 100 миллионов документов с 64-мерными векторами стоит 659,62 долл. США в месяц на AWS по сравнению с 1319,24 долл. США для 128 измерений.

Руководство

Для эффективного развертывания Jina-ColBERT-v2 команды должны рассмотреть несколько практических аспектов. Для оптимальной производительности модели требуется оборудование с поддержкой CUDA, а также она поддерживает длину документов до 8192 токенов (с возможностью расширения до 12288) при ограничении запросов 32 токенами. Для производственного развертывания модель доступна через API Jina Search Foundation, AWS marketplace и Azure, а некоммерческая версия доступна через Hugging Face. При реализации команды должны указать, внедряют ли они запросы или документы, поскольку модель использует асимметричное кодирование. Модель не предназначена для обработки в реальном времени очень больших коллекций документов без надлежащего индексирования, и хотя она отлично подходит для многоязычного поиска, она может показывать немного более низкую производительность при выполнении специализированных задач, специфичных для доменов, по сравнению с моделями, настроенными для этих конкретных доменов.
Блоги, в которых упоминается эта модель
октябрь 03, 2025 • 7 минуты чтения
Jina Reranker v3: 0.6B Listwise Reranker for SOTA Multilingual Retrieval
New 0.6B-parameter listwise reranker that considers the query and all candidate documents in a single context window.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
декабрь 16, 2024 • 2 минуты чтения
Re·Search: Order 2024 Yearbook of Search Foundation Advances
Discover Re·Search, our premium yearbook showcasing our best research articles and search foundation models in 2024. Featuring spot UV-coated hardcover, 160 full-color pages, and meticulous design throughout. Available worldwide at $35, shipping included.
Jina AI
Open red publication "ReSearch" volume 24 displayed on a white surface with a distinctive shadow casting over the pages.
октябрь 29, 2024 • 11 минуты чтения
Beyond CLIP: How Jina-CLIP Advances Multimodal Search
Learn how Jina-CLIP enhances OpenAI's CLIP with better retrieval accuracy and more diverse results through unified text-image embeddings.
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
август 30, 2024 • 10 минуты чтения
Jina ColBERT v2: Multilingual Late Interaction Retriever for Embedding and Reranking
Jina ColBERT v2 supports 89 languages with superior retrieval performance, user-controlled output dimensions, and 8192 token-length.
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
февраль 20, 2024 • 16 минуты чтения
What is ColBERT and Late Interaction and Why They Matter in Search?
Jina AI's ColBERT on Hugging Face has set Twitter abuzz, bringing a fresh perspective to search with its 8192-token capability. This article unpacks the nuances of ColBERT and ColBERTv2, showcasing their innovative designs and why their late interaction feature is a game-changer for search.
Han Xiao
Neon theater or concert hall marquee letters lit up at night with city lights and faint "Adobe Sto" visible.
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.