График ввода-вывода

Текст

jina-embeddings-v2-base-en

Вектор

Парето-фронт
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxlПараметры (лог)nDCG@10
Эта модель
На фронте
Jina AI
Другие
MTEB English · retrieval
49.05
Параметры
137M
Ранг по баллу
17 / 39
Парето-фронт
Позади
Распределение значений
AUC 0.8376
Корпус
Пары переводов
Поиск по документации
0.8500.600.700.800.90
Связанные26.9%
Сложный отрицательный2.7%
Несвязанные1.1%
Рекомендуемые пороги
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
сбалансированный · 0.762
AUC
0.8376
Потолок шума
0.893
Обрыв полноты
0.691
Измерено пар
119 / 11k
Компоненты вектора
-0.14-0.000.14
σ 0.0361 · 183k значений
Геометрия эмбеддингов
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.751
Эффективных изм.
59 / 768
Выберите модели для сравнения
Публикации (1)

Обзор

jina-embeddings-v2-base-en — английская эмбеддинг-модель текста на 137M параметров с окном контекста в 8 192 токенов — в 16 раз больше стандартного лимита в 512 токенов её эпохи. Построенная на backbone BERT-small с симметричным двунаправленным ALiBi (Attention with Linear Biases), это был первый open-source эмбеддинг Jina, нативно обрабатывавший длинные документы без усечения и чанкинга. Она производит 768-мерные векторы и остаётся надёжным выбором для поиска только на английском, когда мультиязычные или длинноконтекстные функции v3/v5 не нужны.

Методы

Архитектура сочетает трансформер BERT-small (12 слоёв, 12 головок внимания, 768 скрытых измерений) с симметричным двунаправленным ALiBi позиционным кодированием. ALiBi заменяет выученные позиционные эмбеддинги линейно убывающим смещением внимания, позволяя модели экстраполировать далеко за её тренировочную длину в 512 токенов — до 8 192 токенов — без потери качества. Обучение следовало двухэтапному конвейеру: предобучение на C4, затем дообучение на кураторской коллекции Jina из 40+ специализированных датасетов пар предложений с добычей трудных негативов. Симметричное двунаправленное внимание обеспечивает, чтобы каждый токен обращал внимание и на предшествующий, и на последующий контекст, порождая представления, улавливающие глобальный смысл предложения. Средний пулинг по всем токеновым представлениям даёт финальное 768-мерное эмбеддинг.

Производительность

На момент релиза модель превзошла text-embedding-ada-002 от OpenAI на нескольких английских подзадачах MTEB: классификация (73,45 % против 70,93 %), ранжирование (85,38 % против 84,89 %), поиск (56,98 % против 56,32 %) и суммаризация (31,6 % против 30,8 %). Её контекст в 8 192 токенов стал значимым преимуществом перед конкурирующими моделями, ограниченными 512–2 048 токенами, и позволил искать на уровне документов без чанкинга. Компактный footprint в 307МБ делал её разворачиваемой на потребительских GPU. В 2026 году jina-embeddings-v5-text-small (677M параметров, контекст 32K, task-специфичные LoRA-адаптеры) превосходит её для большинства продакшен-нагрузок, но она остаётся релевантной для лёгких англоязычных конвейеров.

Руководство

Используйте эту модель для поиска только на английском, когда контекстное окно в 8K достаточно и не нужны мультиязычные или task-специфичные адаптеры. Для документов свыше 8 192 токенов применяйте семантический чанкинг перед эмбеддингом. Модель интегрируется с основными векторными базами данных (Qdrant, Weaviate, MongoDB Atlas, Milvus) и RAG-фреймворками (LangChain, LlamaIndex, Haystack). Для новых проектов, требующих мультиязычности, контекста 32K или task-специфичной оптимизации, предпочитайте jina-embeddings-v5-text-small. Для продакшен-пропускной способности рекомендуется GPU с поддержкой CUDA; инференс на CPU возможен, но заметно медленнее.

Блоги, в которых упоминается эта модель
декабрь 17, 2024 • 12 минуты чтения
Текстовые эмбеддинги не сохраняют порядок слов и как это исправить
Модели текстовых эмбеддингов испытывают трудности с захватом тонких лингвистических нюансов, таких как порядок слов, направленные отношения, временные последовательности, причинно-следственные связи, сравнения и отрицания. Понимание этих проблем является ключом к улучшению производительности моделей.
октябрь 25, 2024 • 19 минуты чтения
Поиск оптимальных точек перелома в длинных документах с помощью малых языковых моделей
Мы обучили три небольшие языковые модели для лучшего разделения длинных документов на фрагменты и вот основные выводы, которые мы сделали.
октябрь 15, 2024 • 9 минуты чтения
Проверка фактов с помощью нового Grounding API в Jina Reader
С помощью нового g.jina.ai вы можете легко обосновывать утверждения, чтобы снизить галлюцинации LLM или улучшить достоверность контента, написанного людьми.
сентябрь 27, 2024 • 15 минуты чтения
Миграция с Jina Embeddings v2 на v3
Мы собрали несколько советов, которые помогут вам мигрировать с Jina Embeddings v2 на v3.
сентябрь 18, 2024 • 10 минуты чтения
Jina Embeddings v3: Передовая мультиязычная модель для создания эмбеддингов
jina-embeddings-v3 - это передовая многоязычная модель текстовых эмбеддингов с 570M параметров и длиной токена 8192, превосходящая по показателям последние проприетарные эмбеддинги от OpenAI и Cohere на бенчмарке MTEB.