Обзор
jina-embeddings-v2-base-es — двуязычная эмбеддинг-модель текста на 161M параметров для испанского и английского, с окном контекста в 8 192 токенов и выходом в 768 измерений. Создана для межъязыкового поиска на испаноязычных рынках, отображая семантически эквивалентный контент на испанском и английском в общее пространство эмбеддингов. Модель закрывает критический пробел: большинство эмбеддинг-моделей того времени были англоцентричными, с заметно сниженным качеством на испанском.
Методы
Модель использует backbone на базе BERT с симметричным двунаправленным ALiBi позиционным кодированием, 161M параметров и выходное пространство в 768 измерений. Обучение следовало трёхэтапному процессу: (1) предобучение на параллельных корпусах испанско-английских текстов, (2) контрастивное дообучение с добычей трудных негативов на курированных парах предложений и (3) межъязыковое выравнивание, чтобы гарантировать, что представления одного и того же понятия на испанском и английском группируются вместе. Механизм ALiBi обеспечивает окно контекста в 8 192 токенов без выученных позиционных эмбеддингов, позволяя модели экстраполировать за её тренировочную длину в 512 токенов. Средний пулинг производит итоговый вектор эмбеддинга.
Производительность
Модель превзошла значительно более крупные мультиязычные модели (E5, BGE-M3) на задачах поиска испанский-английский, будучи лишь на 15–30 % их размера. Она продемонстрировала сильное качество на подзадачах MTEB на испанском, особенно в поиске и кластеризации. Окно контекста в 8 192 токенов дало стабильное качество на многостраничных документах, где большинство конкурирующих моделей требовали чанкинга. В 2026 году jina-embeddings-v5-text-small вытесняет эту модель, предлагая 89 языков, контекст 32K и task-специфичные LoRA-адаптеры. Модель v2-base-es остаётся экономически выгодным вариантом для специализированных испанско-английских конвейеров.
Руководство
Идеальна для двуязычного поиска испанский-английский, рекомендаций контента и межъязыкового анализа документов. Для документов свыше 8 192 токенов используйте семантический чанкинг или параметр `late_chunking через API Jina. Модель интегрируется с основными векторными базами данных и RAG-фреймворками. Для новых проектов, требующих мультиязычного охвата помимо испанско-английского, контекста 32K или task-специфичной оптимизации, предпочитайте jina-embeddings-v5-text-small`. Для продакшена рекомендуется GPU с поддержкой CUDA. Входной текст должен быть на испанском или английском; вход в смешанных языках поддерживается, но производительность оптимизирована под два тренированных языка.




