Обзор
jina-embedding-b-en-v1 была первой опубликованной моделью эмбеддингов текста от Jina AI: двунаправленный энкодер на 110M параметров, отображающий английский текст в 768-мерные векторы. Созданная для семантического поиска, сравнения сходства и рекомендаций контента в эпоху, когда контекст в 512 токенов был отраслевым стандартом, она обозначила выход Jina в пространство open-source эмбеддингов. Модель теперь устарела и была вытеснена семействами v2 и v3, поддерживающими контексты в 8K+ токенов и мультиязычный ввод.
Методы
Модель использует архитектуру T5-энкодера со средним пулингом для создания представлений фиксированной длины в 768 измерений. Обучение следовало двухфазному контрастивному рецепту на датасете Linnaeus-Clean (385M пар предложений, отфильтрованных из 1,6B кандидатов): сначала — InfoNCE loss на положительных парах текста для обучения семантическому выравниванию; затем — triplet loss для обострения дискриминации между похожими, но семантически различными текстами. Ключевое решение проектирования — стратегия среднего пулинга, усредняющая представления на уровне токенов, чтобы получить единственный вектор, улавливающий глобальный смысл предложения. Контекстное окно в 512 токенов было стандартом для своей эпохи, но ограничивает полезность модели для приложений с длинными документами.
Производительность
На STS12 модель достигла коэффициента корреляции 0,751, опередив all-mpnet-base-v2 и all-minilm-l6-v2 на момент выпуска. Она демонстрировала сильное качество на стандартных английских задачах эмбеддингов предложений, сохраняя быстрые времена инференса, пригодные для продакшена. Окно контекста в 512 токенов и фокус только на английском сделали её неподходящей для рабочих нагрузок с длинными документами и мультиязычностью, ставших стандартом к 2025 году. Модель вытеснена jina-embeddings-v2-base-en (контекст 8K, двунаправленное ALiBi) и jina-embeddings-v3 (570M параметров, 89 языков, task-специфичные LoRA-адаптеры).
Руководство
Эта модель устарела и не должна использоваться в новых проектах. При миграции с jina-embedding-b-en-v1 переходите на jina-embeddings-v5-text-small для текущих рабочих нагрузок — он поддерживает контекст в 32K токенов, 89 языков и task-специфичные LoRA-адаптеры. Для задач эмбеддингов, специфичных для кода, используйте jina-code-embeddings-1.5b. Модель требует аппаратного обеспечения с поддержкой CUDA для оптимальной производительности и принимает вход до 512 токенов. Она не подходит для мультиязычного контента, длинных документов или кодоцентрированных приложений.
