График ввода-вывода
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
LongEmbed
66.39
Parameters
596M
Rank by score
8 / 69
Pareto front
Behind it
Распределение значенийhelp_outlineAUC 0.8269
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Задача
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
Связанные10.9%
Сложный отрицательный2.1%
Несвязанные0.9%
Рекомендуемые пороги
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
сбалансированный · 0.697
AUC
0.8269
Потолок шума
0.855
Обрыв полноты
0.566
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
σ 0.0313 · 244k значений
Геометрия эмбеддинговhelp_outline
Среднее по измерениям, наведите для диапазона
Уровень шума
0.300
Эффективных изм.
70 / 1024
Усечение размерностиhelp_outline
text-matching · Порог в зависимости от запрошенной размерности
Языковые парыhelp_outline
Разброс порога между парами: 0.024
Выберите модели для сравнения
Публикации (1)
Обзор
jina-embeddings-v5-text-small — это многоязычная модель встраивания текста с 0,6 млрд параметров, построенная на основе архитектуры Qwen3-0.6B-Base. Она генерирует 1024-мерные встраивания с помощью объединения последних токенов и поддерживает длину контекста до 32 тыс. токенов с помощью вращающихся позиционных встраиваний (RoPE) с скорректированными базовыми частотами. Модель включает четыре специализированных адаптера LoRA для поиска, семантического сходства, кластеризации и классификации, обученных независимо на замороженных весах базовой архитектуры. Matryoshka Representation Learning позволяет усекать встраивания до размеров всего 32. Модель обучается в два этапа: сначала дистилляция встраиваний из Qwen3-Embedding-4B для переноса знаний из более крупной модели-учителя, а затем обучение специализированных адаптеров с функциями потерь для каждой категории задач. Он поддерживает асимметричный поиск с префиксами 'Query:' и 'Document:'.
Методы
Обучение проходит в два этапа. На первом этапе дистилляция эмбеддингов переносит знания из Qwen3-Embedding-4B (4B-параметрическая модель учителя) в модель ученика Qwen3-0.6B-Base, используя функцию потерь на основе косинусного расстояния между спроецированными эмбеддингами ученика и эмбеддингами учителя. Линейный проекционный слой отображает 1024-мерное пространство ученика в многомерное пространство учителя. Дистилляция общего назначения использует более 300 наборов данных на более чем 30 языках в течение 50 000 шагов, после чего следует обучение на основе длинного контекста с использованием синтетических и естественных длинных документов (1000-4096 токенов) с скорректированными параметрами RoPE. На втором этапе четыре адаптера LoRA обучаются на замороженных весах базовой модели: адаптер поиска объединяет контрастивную функцию потерь InfoNCE с жесткими отрицаниями, функцию потерь непрерывной дистилляции и глобальный ортогональный регуляризатор (GOR) для устойчивости к квантизации; Адаптер для сопоставления текста использует функцию потерь ранжирования CoSENT для градуированной схожести с дистилляцией на неоцененных парах; адаптер для кластеризации использует повторную дистилляцию с инструкцией учителя, специфичной для кластеризации; а адаптер для классификации использует двунаправленную функцию потерь InfoNCE с регуляризацией дистилляции реляционных знаний. Итоговые веса адаптера поиска усредняются по контрольным точкам.
Производительность
На MMTEB (многоязычный) jina-embeddings-v5-text-small достигает среднего показателя 67,0 (на уровне задач) и 58,9 (на уровне типов), что является наивысшим результатом среди всех моделей с числом параметров менее 1 млрд. Она набирает 71,3 балла по классификации, 53,4 по кластеризации, 82,9 по парной классификации, 65,7 по переранжированию, 64,9 по поиску и 78,9 по STS. На английском MTEB она достигает среднего показателя 71,7, превосходя Qwen3-0.6B с инструкциями (70,5) и jina-embeddings-v3 (65,7). На специализированных тестах поиска она набирает 64,88 балла по поиску MTEB-M, 66,84 балла по RTEB, 56,67 балла по BEIR и 66,39 балла по LongEmbed. Модель превосходит своего учителя Qwen3-4B по парной классификации (42,0 против 26,8 на MMTEB), сохраняя при этом конкурентоспособные результаты во всех остальных категориях, несмотря на то, что она в 6 раз меньше по размеру.
Руководство
Выберите подходящий адаптер LoRA для вашей задачи: «retrieval» для асимметричного поиска документов по запросу (добавьте «Query:» к запросам и «Document:» к фрагментам текста), «text-matching» для симметричных задач определения сходства, таких как обнаружение дубликатов и идентификация перефразирований (использует префикс «Document:» для обоих типов входных данных), «clustering» для группировки связанных документов и «classification» для категоризации и анализа тональности. Для задач поиска всегда используйте правильный префикс, поскольку модель обучается с асимметричным кодированием. Усечение Matryoshka позволяет уменьшить размерность эмбеддингов с 1024 до 32; производительность остается высокой выше 256 измерений, но заметно снижается ниже этого порога, что соответствует пределам Джонсона-Линденштрауса. Бинарное квантование поддерживается с минимальной потерей производительности благодаря регуляризации GOR. Контекстное окно в 32K токенов обрабатывает длинные документы нативно, но модель дополнительно обучалась на данных с длинным контекстом для надежного поиска длинных документов. Используйте косинусное сходство для сравнения эмбеддингов. Модель доступна через Jina AI API, Hugging Face (с интеграцией Sentence Transformers и vLLM) и в квантованных вариантах для llama.cpp.
Блоги, в которых упоминается эта модель






