Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Реранкер для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документация
Авторизоваться
login
Эмбеддинги
copyright CC BY-NC 4.0
open_in_new Пост о релизе

jina-embeddings-v5-text-nano

SOTA многоязычные эмбеддинги для edge-развёртывания
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2026-02-18
Вход
abc
Текст
arrow_forward
Выход
more_horiz
Вектор
Размерности Matryoshka help_outline
32
64
128
256
512
768
Подробности модели
Параметры: 239M
Длина входного токена: 8K
Выходной размер: 768
Базовая модель help_outline
open_in_new
EuroBERT-210M
Обученные языки help_outline
32 языки
Поддерживаемые языки help_outline
108 языки
Квантования help_outline
GGUF
Поддержка Apple Silicon help_outline
MLX
Похожие модели
link
jina-embeddings-v3
link
jina-embeddings-v5-text-small
Поддерживаемые задачи
search Поиск
compare_arrows Сопоставление текста
bubble_chart Кластеризация
label Классификация
Доступно через
Elastic Inference Service
API Jina AI
AWS SageMaker
Hugging Face
Air-gapped
График ввода-вывода

Текст

jina-embeddings-v5-text-nano

Задача

Вектор

Парето-фронт help_outline
workspace_premium
MMTEB
MIRACL
RTEB public
LongEmbed
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B3040506070all-MiniLM-L6-v2bge-large-en-v1.5e5-large-v2e5-small-v2EmbeddingGemma-300Mgranite-embedding-311m-…granite-embedding-97m-m…GritLM-7BGritLM-8x7Bgte-Qwen2-7B-instructharrier-oss-v1-0.6bharrier-oss-v1-27bjina-embeddings-v3jina-embeddings-v5-omni…KaLM-Embedding-Gemma3-1…LaBSELanguageBindLCO-Embedding-Omni-3Bllama-embed-nemotron-8bmultilingual-e5-basemultilingual-e5-large-i…Omni-Embed-Nemotron-3Bpotion-multilingual-128MQwen3-Embedding-0.6BQwen3-Embedding-4BQwen3-Embedding-8Bsnowflake-arctic-embed-…static-similarity-mrl-m…stella_en_1.5B_v5stella_en_400M_v5jina-embeddings-v5-text…Параметры (лог)score
Эта модель
На фронте
Jina AI
Другие
MMTEB
65.50
Параметры
212M
Ранг по баллу
12 / 48
Парето-фронт
На фронте
Распределение значенийhelp_outline
AUC 0.8242
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Задача
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
Связанные20.2%
Сложный отрицательный1.7%
Несвязанные1.1%
Рекомендуемые пороги
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
сбалансированный · 0.678
AUC
0.8242
Потолок шума
0.840
Обрыв полноты
0.557
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
-0.180.000.19
σ 0.0361 · 183k значений
Геометрия эмбеддинговhelp_outline
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.288
Эффективных изм.
69 / 768
Усечение размерностиhelp_outline
3264128256512768
text-matching · Порог в зависимости от запрошенной размерности
Языковые парыhelp_outline
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.027
Выберите модели для сравнения
Публикации (1)
SIGIR 2026
февраль 17, 2026
jina-embeddings-v5-text: Task-Targeted Embedding Distillation

Обзор

jina-embeddings-v5-text-nano — мультиязычная текстовая embedding-модель на 239M параметров, построенная на backbone EuroBERT-210M. Она поддерживает 8K-токенный контекст, формирует 768-мерные эмбеддинги с обрезкой Matryoshka до 32 измерений и даёт наибольшую точность на параметр в семействе embedding-моделей Jina под 500M. Рассчитана на edge-развёртывание, чувствительные к задержке приложения и среды с ограничением ресурсов, где нет полной GPU.

Методы

Модель построена на EuroBERT-210M — компактном двунаправленном энкодере, обученном на мультиязычных данных, покрывающих 15 основных языков. Она использует Last-Token-Pooling для формирования эмбеддингов из представления финального токена. Обучение следует двухэтапному рецепту дистилляции: во-первых, дистилляция знаний из более крупной teacher-модели передаёт качество эмбеддингов; во-вторых, task-specific контрастивный loss дообучает модель на задачах поиска, text-matching, кластеризации и классификации. Matryoshka Representation Learning позволяет обрезать размерность эмбеддингов до любого поддерживаемого размера (32, 64, 128, 256, 512, 768), сохраняя сильную производительность. Geometric Orthogonal Regularization (GOR) ограничивает деградацию качества под бинарной квантизацией менее чем 2 пунктами в MTEB retrieval. 8K-контекстное окно обеспечивает обработку длинных документов без чанкинга.

Производительность

На MMTEB (мультиязычный) модель достигает в среднем 65,5 (уровень задач) и 57,7 (уровень типов) всего при 239M параметров, превосходя все модели под 500M, включая KaLM-mini-v2.5 (60,1, 494M), voyage-4-nano (58,9, 480M) и Gemma-300M (61,1, 308M). Оценки по задачам: классификация 69,2, кластеризация 52,7, парная классификация 81,9, ранжирование 64,6, поиск 63,3, STS 78,2. На английском MTEB она набирает 71,0 в среднем, почти догоняя гораздо более крупный jina-embeddings-v5-text-small (71,7). Поиск в частности: 63,26 на MTEB-M, 64,08 на RTEB, 56,06 на BEIR, 63,65 на LongEmbed. Благодаря регуляризации GOR эмбеддинги остаются робастными при бинарной квантизации.

Руководство

Выберите подходящий task-префикс: 'retrieval' для асимметричного query-document поиска, 'text-matching' для симметричного сходства, 'clustering' для группировки, 'classification' для категоризации. Обрезка Matryoshka до 256 измерений сохраняет более 95% качества поиска, сокращая хранилище на 67%. Бинарная квантизация поддерживается для дальнейшего сокращения хранилища. Backbone EuroBERT обеспечивает сильное покрытие 15 основных языков, включая английский, французский, немецкий, испанский, китайский, японский, арабский и хинди. Используйте косинусное сходство для сравнения эмбеддингов. Доступна через Jina AI API, Hugging Face (Sentence Transformers, vLLM) и квантованные варианты для llama.cpp. Для нагрузок, требующих 32K контекста или более высокой точности, используйте вместо этого jina-embeddings-v5-text-small.

Блоги, в которых упоминается эта модель
май 12, 2026 • 7 минуты чтения
jina-embeddings-v5-omni: Векторные модели для текста, изображений, аудио и видео
Одна модель, четыре модальности: текст, изображение, аудио, видео. Лучшие в своем классе омни-векторные модели (Embeddings) с 1,6 млрд и 0,9 млрд параметров.
Jina AI
март 06, 2026 • 6 минуты чтения
Идентификация векторных моделей по сырым числовым значениям
Крошечный трансформер, который создает цифровые отпечатки векторных моделей, считывая необработанные цифры. Без проектирования признаков.
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
февраль 19, 2026 • 7 минуты чтения
jina-embeddings-v5-text: новые SOTA компактные мультиязычные векторные модели
Две многоязычные модели Embeddings объемом менее 1 млрд параметров с лучшей в своем классе производительностью, доступные в Elastic Inference Service, Llama.cpp и MLX.
Jina AI
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.