

Мы выпускаем jina-embeddings-v5-text, пятое поколение нашего семейства векторных моделей, расширяющее границы качества и эффективности для мультиязычных векторных моделей размером менее 1 млрд параметров:
- jina-embeddings-v5-text-small (677 млн параметров): 67.0 в MMTEB, 71.7 в MTEB English
- jina-embeddings-v5-text-nano (239 млн параметров): 65.5 в MMTEB, 71.0 в MTEB English
Малая модель поддерживает контекст до 32 тыс. токенов (8 тыс. для nano), 4 специализированных LoRA-адаптера (поиск, сопоставление текста, классификация, кластеризация) и усечение размерности по методу Матрешки от 1024 до 32. При 239 млн параметров модель nano достигает качества поиска моделей, у которых вдвое больше параметров.
По сравнению с нашими предыдущими поколениями: v5-text-small соответствует jina-embeddings-v4 (3.8 млрд) в задачах поиска, будучи при этом в 5.6 раза меньше, и превосходит jina-embeddings-v3 (572 млн) по всем задачам при сопоставимом количестве параметров.
| Характеристика | v5-text-small | v5-text-nano |
|---|---|---|
| Базовая модель | Qwen3-0.6B-Base | EuroBERT-210m |
| Параметры | 677 млн | 239 млн |
| Размерность векторов | 1024 | 768 |
| Длина контекста | 32 768 | 8 192 |
| Языки | 119 (токенизатор Qwen3) | 15+ (токенизатор EuroBERT) |
| Пулинг | По последнему токену | По последнему токену |
| LoRA-адаптеры | 4 (поиск, сопоставление текста, классификация, кластеризация) | |
| Размерности Матрешки | 32-1024 | 32-768 |
| Оценка MMTEB | 67.0 | 65.5 |
| MTEB English | 71.7 | 71.0 |
| Лицензия | CC BY-NC 4.0 |
v5-text-small достигает 67.0 в MMTEB (усредненно по 131 задаче в 9 типах), превосходя следующую лучшую модель менее 1 млрд параметров (Qwen3-0.6B с инструкциями на 64.3) на +2.7 балла. Модель nano с 239 млн параметров набирает 65.5, побеждая модели с вдвое большим количеством параметров.v5-text-small лидирует среди всех мультиязычных моделей менее 1 млрд параметров с результатом 71.7 (усредненно по 41 задаче в 7 типах), за ней следуют KaLM-mini-v2.5 (71.3) и v5-text-nano (71.0). Модель nano (239 млн) достигает паритета с KaLM (494 млн), будучи менее чем в два раза меньше по размеру.v5-text-small достигает наивысшего среднего уровня по задачам (63.28) по пяти бенчмаркам поиска (MTEB Multilingual, MTEB English, RTEB, BEIR и LongEmbed) среди моделей до 4 млрд параметров, сравнявшись с jina-embeddings-v4 (3.8 млрд, 63.62), при этом будучи в 5.6 раза меньше.
jina-embeddings-v5-small (0.6 млрд параметров, 8-е место) является мощнейшей векторной моделью с количеством параметров менее 1 млрд в MTEB Multilingual v2, превосходя Qwen3-Embedding-0.6b по всем метрикам. jina-embeddings-v5-nano (0.2 млрд параметров, 11-е место) демонстрирует производительность на уровне топ-11 при крошечном размере — ни одна другая модель в этом классе параметров даже близко не приближается.tagАрхитектура

v5-text использует декодерные основы с пулингом по последнему токену вместо среднего пулинга. Четыре легких LoRA-адаптера внедряются в каждый слой трансформера, независимо обрабатывая поиск, сопоставление текста, классификацию и кластеризацию. Пользователи выбирают подходящий адаптер во время инференса. Для поиска запросы получают префикс "Query:", а документы — "Document:". Длина контекста составляет 32 тыс. токенов для small (8 тыс. для nano), что в 4 раза больше, чем в v3.
tagНачало работы
tagСервис эластичного инференса (Elastic Inference Service)
Самый быстрый способ использования v5-text в продакшене. Elastic Inference Service (EIS) предоставляет управляемый инференс векторных представлений со встроенным масштабированием, поэтому вы можете генерировать векторы непосредственно внутри вашего развертывания Elastic, не управляя инфраструктурой.
PUT _inference/text_embedding/jina-v5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-embeddings-v5-text-small"
}
}
Подробности настройки см. в документации EIS.
tagJina Embedding API
Наш хостинг-API с оплатой за каждый токен. Поддерживает выбор задач, усечение размерности и пакетную обработку «из коробки». GPU не требуется.
curl https://api.jina.ai/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "jina-embeddings-v5-text-small",
"task": "retrieval.query",
"dimensions": 1024,
"input": ["What is knowledge distillation?"]
}'
Получите API-ключ на jina.ai/embeddings.
tagHugging Face + sentence-transformers
Запуск локально с полным контролем над инференсом. Веса доступны на Hugging Face с готовой интеграцией sentence-transformers.
from sentence_transformers import SentenceTransformer
import torch
model = SentenceTransformer(
"jinaai/jina-embeddings-v5-text-small-retrieval",
model_kwargs={"dtype": torch.bfloat16},
)
query_emb = model.encode("What is knowledge distillation?", prompt_name="query")
doc_embs = model.encode(["Knowledge distillation transfers...", "Venus is..."], prompt_name="document")
similarity = model.similarity(query_emb, doc_embs)
tagvLLM
Высокопроизводительное обслуживание для рабочих нагрузок в продакшене. vLLM поддерживает v5-text нативно с пулингом по последнему токену (last-token pooling).
from vllm import LLM
from vllm.config.pooler import PoolerConfig
model = LLM(
model="jinaai/jina-embeddings-v5-text-small-retrieval",
dtype="float16",
runner="pooling",
pooler_config=PoolerConfig(seq_pooling_type="LAST", normalize=True),
)
outputs = model.encode(["Query: climate change impacts"], pooling_task="embed")
Для оптимизированного локального инференса через llama.cpp и MLX веса LoRA каждого адаптера задачи объединяются с базовой моделью для создания независимых файлов весов. Именно поэтому вы видите отдельные репозитории для каждой задачи (поиск, сопоставление текста, классификация, кластеризация) — каждый из них содержит полные объединенные веса, готовые к прямой загрузке без дополнительных затрат ресурсов на LoRA во время инференса.
tagllama.cpp (GGUF)
Запуск квантованных моделей на CPU или edge-устройствах. Мы предоставляем 14 вариантов квантования GGUF для каждой модели, от F16 до IQ1_S.
llama-server -hf jinaai/jina-embeddings-v5-text-small-retrieval-GGUF:Q4_K_M \
--embedding --pooling last -ub 32768
tagMLX
Нативный инференс для Apple Silicon через MLX. Доступны полная точность, 4-битное и 8-битное квантование для всех адаптеров задач.
import mlx.core as mx
from tokenizers import Tokenizer
from model import JinaEmbeddingModel
import json
with open("config.json") as f:
config = json.load(f)
model = JinaEmbeddingModel(config)
weights = mx.load("model-4bit.safetensors") # или model.safetensors, model-8bit.safetensors
model.load_weights(list(weights.items()))
tokenizer = Tokenizer.from_file("tokenizer.json")
texts = ["Query: What is machine learning?"]
embeddings = model.encode(texts, tokenizer)
Скачайте с Hugging Face: jinaai/jina-embeddings-v5-text-small-retrieval-mlx (также доступно для адаптеров сопоставления текста, классификации и кластеризации).
tagОбучение
Обе модели дистиллированы из Qwen3-Embedding-4B, значительно более крупной обученной модели векторов. Малая (small) версия использует Qwen3-0.6B-Base в качестве основы, а нано-версия — EuroBERT-210m. Наше обучение объединяет два взаимодополняющих сигнала:
- Дистилляция векторов от «учителя» 4B через функцию потерь косинусного сходства. «Ученик» учится аппроксимировать векторное пространство «учителя» без необходимости использования промптов в стиле инструкций. Это особенно эффективно для языков и задач, где размеченных данных недостаточно.
- Контрастивная функция потерь для конкретной задачи (
InfoNCE) на размеченных парах «запрос-документ» с использованием майнинга трудных отрицательных примеров (hard negative mining) и внутрипакетных отрицательных примеров (in-batch negatives). После заморозки дистиллированной основы мы обучаем отдельные адаптеры LoRA для каждой категории задач.
Наши абляционные исследования показывают, что этот комбинированный подход стабильно превосходит каждый метод по отдельности. В задачах англоязычного поиска на MTEB комбинированный метод достигает 60.1 nDCG@10 против 58.6 при использовании только дистилляции и 54.3 при использовании только контрастивного обучения на той же основе.
Мы также применяем GOR (Generalized Orthogonal Regularization) во время обучения, что способствует более равномерному распределению компонентов векторов. Это не дает значительного прироста в стандартных бенчмарках, но делает бинарное квантование практически без потерь, что является критически важным свойством для развертывания в условиях ограниченной памяти.
Несколько наблюдений из процесса обучения, на которые стоит обратить внимание:
- Дистилляция и контрастивное обучение дополняют друг друга способами, которые мы изначально не предполагали.
- Удаление любого отдельного компонента из нашей смеси функций потерь приводит к ухудшению общей производительности.
- Адаптеры LoRA для конкретных задач работают лучше, чем многозадачное обучение, при незначительных дополнительных затратах параметров.
- Регуляризация GOR делает бинарное квантование почти без потерь, что важнее для развертывания, чем незначительный прирост при полной точности.
tagЗаключение
Модели 向量模型 (Embeddings) все чаще используются как компоненты цепочки инструментов внутри более крупных систем. Агенты на базе大模型 (LLM) вызывают API векторов для поиска, работы с памятью и классификации в рамках агентских рабочих процессов. Такие проекты, как OpenClaw и OpenViking, рассматривают векторы как ключевой уровень инфраструктуры для управления контекстом агента, а не как автономные поисковые эндпоинты. В этом режиме стоимость инференса и задержка на запрос имеют такое же значение, как и оценки в бенчмарках, поэтому компактные модели становятся естественным выбором.
Тенденция к переходу на более мелкие векторные модели отражает более широкий сдвиг. Поиск на устройстве, браузерный поиск и развертывание на edge-устройствах — все это требует моделей, которые вписываются в ограниченный бюджет памяти. Поддержка размерностей Matryoshka позволяет одной модели обслуживать как высокоточный, так и сверхбыстрый аппроксимированный поиск без необходимости дообучения. В сочетании с квантованием GGUF до 1–2 бит, эффективный объем памяти для продакшн-сервиса векторов уменьшается на порядок.
Мы работаем над jina-embeddings-v5-multimodal, расширяя ту же архитектуру до визуального и кросс-модального поиска. Первые результаты показывают, что выравнивание визуального энкодера с дообученной моделью текстовых векторов возможно без ущерба для качества работы с текстом. Следите за обновлениями.






