Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
warning
Эта модель устарела из-за появления новых моделей.
Вложения
Лицензия Apache 2.0

jina-embedding-b-en-v1

Первая версия модели Jina Embedding, OG.
Лицензия
Apache-2.0
Дата выпуска
calendar_month
2023-06-17
Вход
abc
Текст
arrow_forward
Выход
more_horiz
Вектор
Подробности модели
Параметры: 110M
Длина входного токена: 512
Выходной размер: 768
Базовая модель help_outline
open_in_new
T5-Base Encoder
Обученные языки help_outline
1 языки
Похожие модели
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
Доступно через
Hugging Face
Air-gapped
График ввода-вывода

Текст

jina-embedding-b-en-v1

Вектор

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
44.03
Parameters
110M
Rank by score
28 / 39
Pareto front
Behind it
Выберите модели для сравнения
Публикации (1)
EMNLP 2023
июль 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models

Обзор

Jina Embedding B v1 — это специализированная модель встраивания текста, разработанная для преобразования английского текста в многомерные числовые представления с сохранением семантического значения. Модель удовлетворяет критическую потребность в эффективных и точных встраиваниях текста в производственных средах, что особенно ценно для организаций, которым требуется баланс между вычислительной эффективностью и качеством встраивания. Благодаря 110 млн параметров, генерирующих 768-мерные встраивания, она служит практическим решением для групп, внедряющих семантический поиск, кластеризацию документов или системы рекомендаций по контенту, не требуя при этом значительных вычислительных ресурсов.

Методы

Модель использует архитектуру на основе кодировщика T5, улучшенную с помощью объединения средних значений для генерации представлений фиксированной длины. Обученная на тщательно подобранном наборе данных Linnaeus-Clean, который содержит 385 миллионов высококачественных пар предложений, отфильтрованных из исходных 1,6 миллиарда пар, модель прошла двухфазный процесс обучения. На первом этапе использовалось контрастное обучение с потерей InfoNCE на текстовых парах, а на втором этапе было включено обучение триплетами для уточнения способности модели различать похожий и разный контент. Этот инновационный подход к обучению в сочетании со строгой фильтрацией данных, включая обнаружение языка и проверку согласованности, позволяет модели эффективно улавливать тонкие семантические отношения.

Производительность

В реальных оценках Jina Embedding B v1 демонстрирует впечатляющие возможности, особенно в задачах семантического текстового сходства. Модель достигает самой современной производительности на STS12 с результатом 0,751, превосходя такие устоявшиеся модели, как all-mpnet-base-v2 и all-minilm-l6-v2. Она показывает высокую производительность в различных тестах, сохраняя при этом эффективное время вывода. Однако пользователи должны учитывать, что модель специально оптимизирована для англоязычного контента и может не работать оптимально на многоязычных или специфичных для кода задачах. С тех пор модель была заменена на jina-embeddings-v2-base-en и jina-embeddings-v3, которые предлагают улучшенную производительность в более широком диапазоне вариантов использования.

Руководство

Для оптимального развертывания модели требуется графический процессор с поддержкой CUDA, хотя его умеренный размер позволяет эффективно выводить данные на стандартном оборудовании. Модель принимает входные последовательности длиной до 512 токенов и особенно хорошо подходит для производственных сред, где решающее значение имеет последовательная и надежная генерация встраивания. Она лучше всего работает с контентом на английском языке и идеально подходит для таких приложений, как семантический поиск, сравнение схожести документов и системы рекомендаций по контенту. Командам следует рассмотреть возможность использования более новых версий v2 или v3 для новых проектов, поскольку они предлагают улучшенную производительность и более широкую языковую поддержку. Модель не рекомендуется для задач, требующих многоязычного понимания или специальных знаний в области за пределами общего английского текста.
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.