График ввода-вывода

Текст

jina-embeddings-v5-text-nano

Задача

Вектор

Парето-фронт
30M100M300M1B3.0B10B30B3040506070all-MiniLM-L6-v2bge-large-en-v1.5e5-large-v2e5-small-v2EmbeddingGemma-300Mgranite-embedding-311m-…granite-embedding-97m-m…GritLM-7BGritLM-8x7Bgte-Qwen2-7B-instructharrier-oss-v1-0.6bharrier-oss-v1-27bjina-embeddings-v3jina-embeddings-v5-omni…KaLM-Embedding-Gemma3-1…LaBSELanguageBindLCO-Embedding-Omni-3Bllama-embed-nemotron-8bmultilingual-e5-basemultilingual-e5-large-i…Omni-Embed-Nemotron-3Bpotion-multilingual-128MQwen3-Embedding-0.6BQwen3-Embedding-4BQwen3-Embedding-8Bsnowflake-arctic-embed-…static-similarity-mrl-m…stella_en_1.5B_v5stella_en_400M_v5jina-embeddings-v5-text…Параметры (лог)score
Эта модель
На фронте
Jina AI
Другие
MMTEB
65.50
Параметры
212M
Ранг по баллу
12 / 48
Парето-фронт
На фронте
Распределение значений
AUC 0.8242
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Задача
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
Связанные20.2%
Сложный отрицательный1.7%
Несвязанные1.1%
Рекомендуемые пороги
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
сбалансированный · 0.678
AUC
0.8242
Потолок шума
0.840
Обрыв полноты
0.557
Измерено пар
119 / 11k
Компоненты вектора
-0.180.000.19
σ 0.0361 · 183k значений
Геометрия эмбеддингов
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.288
Эффективных изм.
69 / 768
Усечение размерности
3264128256512768
text-matching · Порог в зависимости от запрошенной размерности
Языковые пары
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.027
Выберите модели для сравнения
Публикации (1)

Обзор

jina-embeddings-v5-text-nano — мультиязычная текстовая embedding-модель на 239M параметров, построенная на backbone EuroBERT-210M. Она поддерживает 8K-токенный контекст, формирует 768-мерные эмбеддинги с обрезкой Matryoshka до 32 измерений и даёт наибольшую точность на параметр в семействе embedding-моделей Jina под 500M. Рассчитана на edge-развёртывание, чувствительные к задержке приложения и среды с ограничением ресурсов, где нет полной GPU.

Методы

Модель построена на EuroBERT-210M — компактном двунаправленном энкодере, обученном на мультиязычных данных, покрывающих 15 основных языков. Она использует Last-Token-Pooling для формирования эмбеддингов из представления финального токена. Обучение следует двухэтапному рецепту дистилляции: во-первых, дистилляция знаний из более крупной teacher-модели передаёт качество эмбеддингов; во-вторых, task-specific контрастивный loss дообучает модель на задачах поиска, text-matching, кластеризации и классификации. Matryoshka Representation Learning позволяет обрезать размерность эмбеддингов до любого поддерживаемого размера (32, 64, 128, 256, 512, 768), сохраняя сильную производительность. Geometric Orthogonal Regularization (GOR) ограничивает деградацию качества под бинарной квантизацией менее чем 2 пунктами в MTEB retrieval. 8K-контекстное окно обеспечивает обработку длинных документов без чанкинга.

Производительность

На MMTEB (мультиязычный) модель достигает в среднем 65,5 (уровень задач) и 57,7 (уровень типов) всего при 239M параметров, превосходя все модели под 500M, включая KaLM-mini-v2.5 (60,1, 494M), voyage-4-nano (58,9, 480M) и Gemma-300M (61,1, 308M). Оценки по задачам: классификация 69,2, кластеризация 52,7, парная классификация 81,9, ранжирование 64,6, поиск 63,3, STS 78,2. На английском MTEB она набирает 71,0 в среднем, почти догоняя гораздо более крупный jina-embeddings-v5-text-small (71,7). Поиск в частности: 63,26 на MTEB-M, 64,08 на RTEB, 56,06 на BEIR, 63,65 на LongEmbed. Благодаря регуляризации GOR эмбеддинги остаются робастными при бинарной квантизации.

Руководство

Выберите подходящий task-префикс: 'retrieval' для асимметричного query-document поиска, 'text-matching' для симметричного сходства, 'clustering' для группировки, 'classification' для категоризации. Обрезка Matryoshka до 256 измерений сохраняет более 95% качества поиска, сокращая хранилище на 67%. Бинарная квантизация поддерживается для дальнейшего сокращения хранилища. Backbone EuroBERT обеспечивает сильное покрытие 15 основных языков, включая английский, французский, немецкий, испанский, китайский, японский, арабский и хинди. Используйте косинусное сходство для сравнения эмбеддингов. Доступна через Jina AI API, Hugging Face (Sentence Transformers, vLLM) и квантованные варианты для llama.cpp. Для нагрузок, требующих 32K контекста или более высокой точности, используйте вместо этого jina-embeddings-v5-text-small.

Блоги, в которых упоминается эта модель