Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Реранкер для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документация
Авторизоваться
login
warning
Эта модель устарела из-за появления новых моделей.
Эмбеддинги
Лицензия Apache 2.0
open_in_new Пост о релизе

jina-embeddings-v2-base-en

На одном уровне с text-embedding-ada002 от OpenAI.
Лицензия
Apache-2.0
Дата выпуска
calendar_month
2023-10-28
Вход
abc
Текст
arrow_forward
Выход
more_horiz
Вектор
Позднее дробление help_outline
check_circle
Yes
Подробности модели
Параметры: 137M
Длина входного токена: 8K
Выходной размер: 768
Обученные языки help_outline
1 языки
Похожие модели
link
jina-embedding-b-en-v1
link
jina-embeddings-v3
Доступно через
API Jina AI
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
График ввода-вывода

Текст

jina-embeddings-v2-base-en

Вектор

Парето-фронтhelp_outline
MTEB English
RTEB public
LongEmbed
LoCo
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v2-base…Параметры (лог)nDCG@10
Эта модель
На фронте
Jina AI
Другие
LongEmbed
58.12
Параметры
137M
Ранг по баллу
18 / 69
Парето-фронт
Позади
Распределение значенийhelp_outline
AUC 0.8376
Корпус
Пары переводов
Поиск по документации
0.8500.600.700.800.90
Связанные26.9%
Сложный отрицательный2.7%
Несвязанные1.1%
Рекомендуемые пороги
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
сбалансированный · 0.762
AUC
0.8376
Потолок шума
0.893
Обрыв полноты
0.691
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
-0.14-0.000.14
σ 0.0361 · 183k значений
Геометрия эмбеддинговhelp_outline
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.751
Эффективных изм.
59 / 768
Выберите модели для сравнения
Публикации (1)
arXiv
октябрь 30, 2023
Jina Embeddings 2: 8192-Token General-Purpose Text Embeddings for Long Documents

Обзор

jina-embeddings-v2-base-en — английская эмбеддинг-модель текста на 137M параметров с окном контекста в 8 192 токенов — в 16 раз больше стандартного лимита в 512 токенов её эпохи. Построенная на backbone BERT-small с симметричным двунаправленным ALiBi (Attention with Linear Biases), это был первый open-source эмбеддинг Jina, нативно обрабатывавший длинные документы без усечения и чанкинга. Она производит 768-мерные векторы и остаётся надёжным выбором для поиска только на английском, когда мультиязычные или длинноконтекстные функции v3/v5 не нужны.

Методы

Архитектура сочетает трансформер BERT-small (12 слоёв, 12 головок внимания, 768 скрытых измерений) с симметричным двунаправленным ALiBi позиционным кодированием. ALiBi заменяет выученные позиционные эмбеддинги линейно убывающим смещением внимания, позволяя модели экстраполировать далеко за её тренировочную длину в 512 токенов — до 8 192 токенов — без потери качества. Обучение следовало двухэтапному конвейеру: предобучение на C4, затем дообучение на кураторской коллекции Jina из 40+ специализированных датасетов пар предложений с добычей трудных негативов. Симметричное двунаправленное внимание обеспечивает, чтобы каждый токен обращал внимание и на предшествующий, и на последующий контекст, порождая представления, улавливающие глобальный смысл предложения. Средний пулинг по всем токеновым представлениям даёт финальное 768-мерное эмбеддинг.

Производительность

На момент релиза модель превзошла text-embedding-ada-002 от OpenAI на нескольких английских подзадачах MTEB: классификация (73,45 % против 70,93 %), ранжирование (85,38 % против 84,89 %), поиск (56,98 % против 56,32 %) и суммаризация (31,6 % против 30,8 %). Её контекст в 8 192 токенов стал значимым преимуществом перед конкурирующими моделями, ограниченными 512–2 048 токенами, и позволил искать на уровне документов без чанкинга. Компактный footprint в 307МБ делал её разворачиваемой на потребительских GPU. В 2026 году jina-embeddings-v5-text-small (677M параметров, контекст 32K, task-специфичные LoRA-адаптеры) превосходит её для большинства продакшен-нагрузок, но она остаётся релевантной для лёгких англоязычных конвейеров.

Руководство

Используйте эту модель для поиска только на английском, когда контекстное окно в 8K достаточно и не нужны мультиязычные или task-специфичные адаптеры. Для документов свыше 8 192 токенов применяйте семантический чанкинг перед эмбеддингом. Модель интегрируется с основными векторными базами данных (Qdrant, Weaviate, MongoDB Atlas, Milvus) и RAG-фреймворками (LangChain, LlamaIndex, Haystack). Для новых проектов, требующих мультиязычности, контекста 32K или task-специфичной оптимизации, предпочитайте jina-embeddings-v5-text-small. Для продакшен-пропускной способности рекомендуется GPU с поддержкой CUDA; инференс на CPU возможен, но заметно медленнее.

Блоги, в которых упоминается эта модель
декабрь 17, 2024 • 12 минуты чтения
Text Embeddings Fail to Capture Word Order and How to Fix It
Text embedding models struggle with capturing subtle linguistic nuances like word order, directional relationships, temporal sequences, causal connections, comparisons, and negation. Understanding these challenges is key to improving model performance.
Bo Wang
Alex C-G
Three abstract figures in white, gray, and pink on matching cubes placed on a colorful checkered surface against a green back
октябрь 25, 2024 • 19 минуты чтения
Finding Optimal Breakpoints in Long Documents Using Small Language Models
We trained three small language models to better segment long documents into chunks, and here are the key lessons we learned.
Andrei Ungureanu
Alex C-G
A pattern of yellow file icons on a blue background with one icon displaying a smiley face creating an emotive contrast.
октябрь 15, 2024 • 9 минуты чтения
Fact-Checking with New Grounding API in Jina Reader
With the new g.jina.ai, you can easily ground statements to reduce LLM hallucinations or improve the integrity of human-written content.
Jina AI
Jina developer interface showing "Jina AI was founded in 2020" with controls labeled true and false, and web address on top.
сентябрь 27, 2024 • 15 минуты чтения
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
сентябрь 18, 2024 • 10 минуты чтения
Jina Embeddings v3: A Frontier Multilingual Embedding Model
jina-embeddings-v3 is a frontier multilingual text embedding model with 570M parameters and 8192 token-length, outperforming the latest proprietary embeddings from OpenAI and Cohere on MTEB.
Jina AI
Dynamic image showing the characters "V3" formed by bright green dots varying in size on a black background.
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.