График ввода-вывода

Текст

jina-embedding-b-en-v1

Вектор

Парето-фронт
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Параметры (лог)Spearman
Эта модель
На фронте
Jina AI
Другие
MTEB English · sts
79.93
Параметры
110M
Ранг по баллу
28 / 39
Парето-фронт
Позади
Выберите модели для сравнения
Публикации (1)

Обзор

jina-embedding-b-en-v1 была первой опубликованной моделью эмбеддингов текста от Jina AI: двунаправленный энкодер на 110M параметров, отображающий английский текст в 768-мерные векторы. Созданная для семантического поиска, сравнения сходства и рекомендаций контента в эпоху, когда контекст в 512 токенов был отраслевым стандартом, она обозначила выход Jina в пространство open-source эмбеддингов. Модель теперь устарела и была вытеснена семействами v2 и v3, поддерживающими контексты в 8K+ токенов и мультиязычный ввод.

Методы

Модель использует архитектуру T5-энкодера со средним пулингом для создания представлений фиксированной длины в 768 измерений. Обучение следовало двухфазному контрастивному рецепту на датасете Linnaeus-Clean (385M пар предложений, отфильтрованных из 1,6B кандидатов): сначала — InfoNCE loss на положительных парах текста для обучения семантическому выравниванию; затем — triplet loss для обострения дискриминации между похожими, но семантически различными текстами. Ключевое решение проектирования — стратегия среднего пулинга, усредняющая представления на уровне токенов, чтобы получить единственный вектор, улавливающий глобальный смысл предложения. Контекстное окно в 512 токенов было стандартом для своей эпохи, но ограничивает полезность модели для приложений с длинными документами.

Производительность

На STS12 модель достигла коэффициента корреляции 0,751, опередив all-mpnet-base-v2 и all-minilm-l6-v2 на момент выпуска. Она демонстрировала сильное качество на стандартных английских задачах эмбеддингов предложений, сохраняя быстрые времена инференса, пригодные для продакшена. Окно контекста в 512 токенов и фокус только на английском сделали её неподходящей для рабочих нагрузок с длинными документами и мультиязычностью, ставших стандартом к 2025 году. Модель вытеснена jina-embeddings-v2-base-en (контекст 8K, двунаправленное ALiBi) и jina-embeddings-v3 (570M параметров, 89 языков, task-специфичные LoRA-адаптеры).

Руководство

Эта модель устарела и не должна использоваться в новых проектах. При миграции с jina-embedding-b-en-v1 переходите на jina-embeddings-v5-text-small для текущих рабочих нагрузок — он поддерживает контекст в 32K токенов, 89 языков и task-специфичные LoRA-адаптеры. Для задач эмбеддингов, специфичных для кода, используйте jina-code-embeddings-1.5b. Модель требует аппаратного обеспечения с поддержкой CUDA для оптимальной производительности и принимает вход до 512 токенов. Она не подходит для мультиязычного контента, длинных документов или кодоцентрированных приложений.