Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
Архитектура
Начало работы
Обучение
Заключение
star
Избранное
пресс-релиз
февраль 19, 2026

jina-embeddings-v5-text: новые SOTA компактные мультиязычные векторные модели

Две многоязычные модели Embeddings объемом менее 1 млрд параметров с лучшей в своем классе производительностью, доступные в Elastic Inference Service, Llama.cpp и MLX.
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Han Xiao
Han Xiao • 7 минуты чтения
jina-embeddings-v5-text: дистилляция векторных моделей, ориентированная на задачи
Модели векторных представлений (Embeddings) широко используются для задач семантической близости, включая информационный поиск, кластеризацию и классификацию. Модели общего назначения обычно обучаются с помощью одно- или многоэтапных процессов с использованием функций контрастивных потерь. Мы представляем новый режим обучения, который сочетает методы дистилляции моделей со специфическими для задач контрастивными потерями для создания компактных и высокопроизводительных векторных моделей. Наши результаты показывают, что этот подход более эффективен для обучения малых моделей (SLM), чем чисто контрастивные или основанные только на дистилляции парадигмы обучения. Результаты тестов для созданных моделей, jina-embeddings-v5-text-small и jina-embeddings-v5-text-nano, превосходят или соответствуют современным стандартам для моделей аналогичного размера. Модели jina-embeddings-v5-text дополнительно поддерживают длинные тексты (до 32 тыс. токенов для small и 8 тыс. для nano) на многих языках и генерируют векторные представления, которые остаются устойчивыми при усечении и бинарной квантовании. Веса моделей находятся в открытом доступе, что, как мы надеемся, вдохновит на дальнейшие достижения в разработке векторных моделей.
arXiv.orgМохаммад Калим Акрам
jina-embeddings-v5-text — коллекция jinaai
Наши векторные модели 5-го поколения: две легкие мультиязычные модели с передовой производительностью (SOTA) в задачах поиска, сопоставления, кластеризации и классификации.
коллекция jinaai

Мы выпускаем jina-embeddings-v5-text, пятое поколение нашего семейства векторных моделей, расширяющее границы качества и эффективности для мультиязычных векторных моделей размером менее 1 млрд параметров:

  • jina-embeddings-v5-text-small (677 млн параметров): 67.0 в MMTEB, 71.7 в MTEB English
  • jina-embeddings-v5-text-nano (239 млн параметров): 65.5 в MMTEB, 71.0 в MTEB English

Малая модель поддерживает контекст до 32 тыс. токенов (8 тыс. для nano), 4 специализированных LoRA-адаптера (поиск, сопоставление текста, классификация, кластеризация) и усечение размерности по методу Матрешки от 1024 до 32. При 239 млн параметров модель nano достигает качества поиска моделей, у которых вдвое больше параметров.

По сравнению с нашими предыдущими поколениями: v5-text-small соответствует jina-embeddings-v4 (3.8 млрд) в задачах поиска, будучи при этом в 5.6 раза меньше, и превосходит jina-embeddings-v3 (572 млн) по всем задачам при сопоставимом количестве параметров.

Характеристикаv5-text-smallv5-text-nano
Базовая модельQwen3-0.6B-BaseEuroBERT-210m
Параметры677 млн239 млн
Размерность векторов1024768
Длина контекста32 7688 192
Языки119 (токенизатор Qwen3)15+ (токенизатор EuroBERT)
ПулингПо последнему токенуПо последнему токену
LoRA-адаптеры4 (поиск, сопоставление текста, классификация, кластеризация)
Размерности Матрешки32-102432-768
Оценка MMTEB67.065.5
MTEB English71.771.0
ЛицензияCC BY-NC 4.0
Мультиязычный бенчмарк MMTEB
v5-text-small достигает 67.0 в MMTEB (усредненно по 131 задаче в 9 типах), превосходя следующую лучшую модель менее 1 млрд параметров (Qwen3-0.6B с инструкциями на 64.3) на +2.7 балла. Модель nano с 239 млн параметров набирает 65.5, побеждая модели с вдвое большим количеством параметров.
Английский бенчмарк MTEB
В оценке только на английском языке v5-text-small лидирует среди всех мультиязычных моделей менее 1 млрд параметров с результатом 71.7 (усредненно по 41 задаче в 7 типах), за ней следуют KaLM-mini-v2.5 (71.3) и v5-text-nano (71.0). Модель nano (239 млн) достигает паритета с KaLM (494 млн), будучи менее чем в два раза меньше по размеру.
Результаты бенчмарка поиска
v5-text-small достигает наивысшего среднего уровня по задачам (63.28) по пяти бенчмаркам поиска (MTEB Multilingual, MTEB English, RTEB, BEIR и LongEmbed) среди моделей до 4 млрд параметров, сравнявшись с jina-embeddings-v4 (3.8 млрд, 63.62), при этом будучи в 5.6 раза меньше.
Таблица с метриками производительности мультиязычных моделей MTEB, рейтингами и оценками по различным задачам
Согласно лидерборду MTEB на 21.02.2026, jina-embeddings-v5-small (0.6 млрд параметров, 8-е место) является мощнейшей векторной моделью с количеством параметров менее 1 млрд в MTEB Multilingual v2, превосходя Qwen3-Embedding-0.6b по всем метрикам. jina-embeddings-v5-nano (0.2 млрд параметров, 11-е место) демонстрирует производительность на уровне топ-11 при крошечном размере — ни одна другая модель в этом классе параметров даже близко не приближается.

tagАрхитектура

Архитектура <code>jina-embeddings-v5-text</code>

v5-text использует декодерные основы с пулингом по последнему токену вместо среднего пулинга. Четыре легких LoRA-адаптера внедряются в каждый слой трансформера, независимо обрабатывая поиск, сопоставление текста, классификацию и кластеризацию. Пользователи выбирают подходящий адаптер во время инференса. Для поиска запросы получают префикс "Query:", а документы — "Document:". Длина контекста составляет 32 тыс. токенов для small (8 тыс. для nano), что в 4 раза больше, чем в v3.

tagНачало работы

tagСервис эластичного инференса (Elastic Inference Service)

Самый быстрый способ использования v5-text в продакшене. Elastic Inference Service (EIS) предоставляет управляемый инференс векторных представлений со встроенным масштабированием, поэтому вы можете генерировать векторы непосредственно внутри вашего развертывания Elastic, не управляя инфраструктурой.

PUT _inference/text_embedding/jina-v5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-embeddings-v5-text-small"
  }
}

Подробности настройки см. в документации EIS.

tagJina Embedding API

Наш хостинг-API с оплатой за каждый токен. Поддерживает выбор задач, усечение размерности и пакетную обработку «из коробки». GPU не требуется.

curl https://api.jina.ai/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "jina-embeddings-v5-text-small",
    "task": "retrieval.query",
    "dimensions": 1024,
    "input": ["What is knowledge distillation?"]
  }'

Получите API-ключ на jina.ai/embeddings.

tagHugging Face + sentence-transformers

Запуск локально с полным контролем над инференсом. Веса доступны на Hugging Face с готовой интеграцией sentence-transformers.

from sentence_transformers import SentenceTransformer
import torch

model = SentenceTransformer(
    "jinaai/jina-embeddings-v5-text-small-retrieval",
    model_kwargs={"dtype": torch.bfloat16},
)

query_emb = model.encode("What is knowledge distillation?", prompt_name="query")
doc_embs = model.encode(["Knowledge distillation transfers...", "Venus is..."], prompt_name="document")
similarity = model.similarity(query_emb, doc_embs)

tagvLLM

Высокопроизводительное обслуживание для рабочих нагрузок в продакшене. vLLM поддерживает v5-text нативно с пулингом по последнему токену (last-token pooling).

from vllm import LLM
from vllm.config.pooler import PoolerConfig

model = LLM(
    model="jinaai/jina-embeddings-v5-text-small-retrieval",
    dtype="float16",
    runner="pooling",
    pooler_config=PoolerConfig(seq_pooling_type="LAST", normalize=True),
)
outputs = model.encode(["Query: climate change impacts"], pooling_task="embed")

Для оптимизированного локального инференса через llama.cpp и MLX веса LoRA каждого адаптера задачи объединяются с базовой моделью для создания независимых файлов весов. Именно поэтому вы видите отдельные репозитории для каждой задачи (поиск, сопоставление текста, классификация, кластеризация) — каждый из них содержит полные объединенные веса, готовые к прямой загрузке без дополнительных затрат ресурсов на LoRA во время инференса.

tagllama.cpp (GGUF)

Запуск квантованных моделей на CPU или edge-устройствах. Мы предоставляем 14 вариантов квантования GGUF для каждой модели, от F16 до IQ1_S.

llama-server -hf jinaai/jina-embeddings-v5-text-small-retrieval-GGUF:Q4_K_M \
  --embedding --pooling last -ub 32768

tagMLX

Нативный инференс для Apple Silicon через MLX. Доступны полная точность, 4-битное и 8-битное квантование для всех адаптеров задач.

import mlx.core as mx
from tokenizers import Tokenizer
from model import JinaEmbeddingModel
import json

with open("config.json") as f:
    config = json.load(f)

model = JinaEmbeddingModel(config)
weights = mx.load("model-4bit.safetensors")  # или model.safetensors, model-8bit.safetensors
model.load_weights(list(weights.items()))

tokenizer = Tokenizer.from_file("tokenizer.json")
texts = ["Query: What is machine learning?"]
embeddings = model.encode(texts, tokenizer)

Скачайте с Hugging Face: jinaai/jina-embeddings-v5-text-small-retrieval-mlx (также доступно для адаптеров сопоставления текста, классификации и кластеризации).

tagОбучение

Обе модели дистиллированы из Qwen3-Embedding-4B, значительно более крупной обученной модели векторов. Малая (small) версия использует Qwen3-0.6B-Base в качестве основы, а нано-версия — EuroBERT-210m. Наше обучение объединяет два взаимодополняющих сигнала:

  1. Дистилляция векторов от «учителя» 4B через функцию потерь косинусного сходства. «Ученик» учится аппроксимировать векторное пространство «учителя» без необходимости использования промптов в стиле инструкций. Это особенно эффективно для языков и задач, где размеченных данных недостаточно.
  2. Контрастивная функция потерь для конкретной задачи (InfoNCE) на размеченных парах «запрос-документ» с использованием майнинга трудных отрицательных примеров (hard negative mining) и внутрипакетных отрицательных примеров (in-batch negatives). После заморозки дистиллированной основы мы обучаем отдельные адаптеры LoRA для каждой категории задач.

Наши абляционные исследования показывают, что этот комбинированный подход стабильно превосходит каждый метод по отдельности. В задачах англоязычного поиска на MTEB комбинированный метод достигает 60.1 nDCG@10 против 58.6 при использовании только дистилляции и 54.3 при использовании только контрастивного обучения на той же основе.

Мы также применяем GOR (Generalized Orthogonal Regularization) во время обучения, что способствует более равномерному распределению компонентов векторов. Это не дает значительного прироста в стандартных бенчмарках, но делает бинарное квантование практически без потерь, что является критически важным свойством для развертывания в условиях ограниченной памяти.

Несколько наблюдений из процесса обучения, на которые стоит обратить внимание:

  • Дистилляция и контрастивное обучение дополняют друг друга способами, которые мы изначально не предполагали.
  • Удаление любого отдельного компонента из нашей смеси функций потерь приводит к ухудшению общей производительности.
  • Адаптеры LoRA для конкретных задач работают лучше, чем многозадачное обучение, при незначительных дополнительных затратах параметров.
  • Регуляризация GOR делает бинарное квантование почти без потерь, что важнее для развертывания, чем незначительный прирост при полной точности.

tagЗаключение

Модели 向量模型 (Embeddings) все чаще используются как компоненты цепочки инструментов внутри более крупных систем. Агенты на базе大模型 (LLM) вызывают API векторов для поиска, работы с памятью и классификации в рамках агентских рабочих процессов. Такие проекты, как OpenClaw и OpenViking, рассматривают векторы как ключевой уровень инфраструктуры для управления контекстом агента, а не как автономные поисковые эндпоинты. В этом режиме стоимость инференса и задержка на запрос имеют такое же значение, как и оценки в бенчмарках, поэтому компактные модели становятся естественным выбором.

Тенденция к переходу на более мелкие векторные модели отражает более широкий сдвиг. Поиск на устройстве, браузерный поиск и развертывание на edge-устройствах — все это требует моделей, которые вписываются в ограниченный бюджет памяти. Поддержка размерностей Matryoshka позволяет одной модели обслуживать как высокоточный, так и сверхбыстрый аппроксимированный поиск без необходимости дообучения. В сочетании с квантованием GGUF до 1–2 бит, эффективный объем памяти для продакшн-сервиса векторов уменьшается на порядок.

Мы работаем над jina-embeddings-v5-multimodal, расширяя ту же архитектуру до визуального и кросс-модального поиска. Первые результаты показывают, что выравнивание визуального энкодера с дообученной моделью текстовых векторов возможно без ущерба для качества работы с текстом. Следите за обновлениями.

Категории:
star
Избранное
пресс-релиз
rss_feed

Читать далее
август 03, 2026 • 11 минуты чтения
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
май 12, 2026 • 7 минуты чтения
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
декабрь 04, 2025 • 7 минуты чтения
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.