График ввода-вывода
Парето-фронтhelp_outline
chevron_leftchevron_right
Эта модель
На фронте
Jina AI
Другие
LongEmbed
63.65
Параметры
212M
Ранг по баллу
14 / 69
Парето-фронт
Позади
Распределение значенийhelp_outlineAUC 0.8242
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Задача
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
Связанные20.2%
Сложный отрицательный1.7%
Несвязанные1.1%
Рекомендуемые пороги
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
сбалансированный · 0.678
AUC
0.8242
Потолок шума
0.840
Обрыв полноты
0.557
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
σ 0.0361 · 183k значений
Геометрия эмбеддинговhelp_outline
Среднее по измерениям, наведите для диапазона
Уровень шума
0.288
Эффективных изм.
69 / 768
Усечение размерностиhelp_outline
text-matching · Порог в зависимости от запрошенной размерности
Языковые парыhelp_outline
Разброс порога между парами: 0.027
Выберите модели для сравнения
Публикации (1)
Обзор
jina-embeddings-v5-text-nano — это многоязычная модель эмбеддинга текста с 239 миллионами параметров, построенная на основе архитектуры EuroBERT-210M, двунаправленного кодировщика, предварительно обученного на 15 основных европейских и мировых языках. Она генерирует 768-мерные эмбеддинга с помощью объединения последних токенов и поддерживает длину контекста до 32 000 токенов. Модель включает четыре специализированных адаптера LoRA (по 6,7 млн параметров каждый) для поиска, семантического сходства, кластеризации и классификации. Технология Matryoshka Representation Learning позволяет усекать эмбеддинга до размеров всего 32. Обученная с использованием дистилляции эмбеддингов из Qwen3-Embedding-4B с последующим обучением специализированных адаптеров, модель достигает производительности, сопоставимой с моделями, более чем в два раза превосходящими её по размеру, что делает её подходящей для критически важных по задержке и периферийных вычислений.
Методы
Обучение проходит по тому же двухэтапному процессу, что и jina-embeddings-v5-text-small, но применяется к архитектуре EuroBERT-210M. На первом этапе дистилляция эмбеддингов переносит знания из Qwen3-Embedding-4B, используя функцию потерь косинусного расстояния с линейным проекционным слоем, отображающим 768-мерные эмбеддинги ученика в пространство учителя. Обучение использует разнообразные многоязычные текстовые пары из более чем 300 наборов данных. На втором этапе обучаются четыре специализированных адаптера LoRA (по 6,7 млн параметров каждый) на замороженных весах архитектуры: поиск (InfoNCE + дистилляция + GOR), сопоставление текста (CoSENT + дистилляция), кластеризация (повторная дистилляция с инструкциями учителя, специфичными для задачи) и классификация (двунаправленная InfoNCE + дистилляция реляционных знаний). Базовая сеть EuroBERT обеспечивает широкое многоязычное покрытие по 15 основным европейским и мировым языкам, включая английский, французский, немецкий, испанский, китайский, японский, арабский и хинди.
Производительность
На многоязычном MMTEB модель jina-embeddings-v5-text-nano достигает в среднем 65,5 (на уровне задач) и 57,7 (на уровне типов) при количестве параметров всего 239 млн, превосходя все модели с количеством параметров менее 500 млн, включая KaLM-mini-v2.5 (60,1, 494 млн параметров), voyage-4-nano (58,9, 480 млн параметров) и Gemma-300M (61,1, 308 млн параметров). Она набирает 69,2 балла по классификации, 52,7 по кластеризации, 81,9 по парной классификации, 64,6 по реранжированию, 63,3 по поиску и 78,2 по STS. На английском MTEB она достигает в среднем 71,0, почти сравнявшись с гораздо более крупной моделью jina-embeddings-v5-text-small (71,7). В тестах на поиск она набирает 63,26 балла на MTEB-M, 64,08 на RTEB, 56,06 на BEIR и 63,65 на LongEmbed. Эмбеддинги остаются устойчивыми при бинарном квантовании, а регуляризация GOR ограничивает снижение производительности до менее чем 2 баллов при поиске на MTEB.
Руководство
Выберите подходящий адаптер LoRA для вашей задачи: «retrieval» для асимметричного поиска по запросу и документу (добавьте «Query:» к запросам и «Document:» к фрагментам текста), «text-matching» для симметричных задач определения сходства (использует префикс «Document:» для обоих типов входных данных), «clustering» для группировки связанных документов и «classification» для категоризации. Модель nano оптимизирована для развертывания в условиях низкой задержки и ограниченных ресурсов, сохраняя при этом конкурентоспособную точность по сравнению с моделями, более чем вдвое превосходящими её по размеру. Усечение Matryoshka позволяет уменьшить размерность эмбеддингов с 768 до 32; для достижения наилучших результатов сохраняйте размерность выше 256. Поддерживается бинарное квантование. Основа EuroBERT обеспечивает широкое покрытие для 15 основных языков, включая английский, французский, немецкий, испанский, китайский, японский, арабский и хинди. Используйте косинусное сходство для сравнения эмбеддингов. Доступно через Jina AI API, Hugging Face (Sentence Transformers и vLLM), а также в квантованных вариантах для llama.cpp.
Блоги, в которых упоминается эта модель





