График ввода-вывода

Текст

jina-embeddings-v2-base-es

Вектор

Парето-фронт
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Параметры (лог)Spearman
Эта модель
На фронте
Jina AI
Другие
MTEB English · sts
83.50
Параметры
161M
Ранг по баллу
11 / 39
Парето-фронт
На фронте
Распределение значений
AUC 0.8383
Корпус
Пары переводов
Поиск по документации
0.6830.000.200.400.600.80
Связанные17.6%
Сложный отрицательный3.0%
Несвязанные0.8%
Рекомендуемые пороги
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
сбалансированный · 0.365
AUC
0.8383
Потолок шума
0.774
Обрыв полноты
0.163
Измерено пар
119 / 11k
Компоненты вектора
-0.160.000.17
σ 0.0361 · 183k значений
Геометрия эмбеддингов
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.326
Эффективных изм.
51 / 768
Языковые пары
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.315
Выберите модели для сравнения
Публикации (1)

Обзор

jina-embeddings-v2-base-es — двуязычная эмбеддинг-модель текста на 161M параметров для испанского и английского, с окном контекста в 8 192 токенов и выходом в 768 измерений. Создана для межъязыкового поиска на испаноязычных рынках, отображая семантически эквивалентный контент на испанском и английском в общее пространство эмбеддингов. Модель закрывает критический пробел: большинство эмбеддинг-моделей того времени были англоцентричными, с заметно сниженным качеством на испанском.

Методы

Модель использует backbone на базе BERT с симметричным двунаправленным ALiBi позиционным кодированием, 161M параметров и выходное пространство в 768 измерений. Обучение следовало трёхэтапному процессу: (1) предобучение на параллельных корпусах испанско-английских текстов, (2) контрастивное дообучение с добычей трудных негативов на курированных парах предложений и (3) межъязыковое выравнивание, чтобы гарантировать, что представления одного и того же понятия на испанском и английском группируются вместе. Механизм ALiBi обеспечивает окно контекста в 8 192 токенов без выученных позиционных эмбеддингов, позволяя модели экстраполировать за её тренировочную длину в 512 токенов. Средний пулинг производит итоговый вектор эмбеддинга.

Производительность

Модель превзошла значительно более крупные мультиязычные модели (E5, BGE-M3) на задачах поиска испанский-английский, будучи лишь на 15–30 % их размера. Она продемонстрировала сильное качество на подзадачах MTEB на испанском, особенно в поиске и кластеризации. Окно контекста в 8 192 токенов дало стабильное качество на многостраничных документах, где большинство конкурирующих моделей требовали чанкинга. В 2026 году jina-embeddings-v5-text-small вытесняет эту модель, предлагая 89 языков, контекст 32K и task-специфичные LoRA-адаптеры. Модель v2-base-es остаётся экономически выгодным вариантом для специализированных испанско-английских конвейеров.

Руководство

Идеальна для двуязычного поиска испанский-английский, рекомендаций контента и межъязыкового анализа документов. Для документов свыше 8 192 токенов используйте семантический чанкинг или параметр `late_chunking через API Jina. Модель интегрируется с основными векторными базами данных и RAG-фреймворками. Для новых проектов, требующих мультиязычного охвата помимо испанско-английского, контекста 32K или task-специфичной оптимизации, предпочитайте jina-embeddings-v5-text-small`. Для продакшена рекомендуется GPU с поддержкой CUDA. Входной текст должен быть на испанском или английском; вход в смешанных языках поддерживается, но производительность оптимизирована под два тренированных языка.

Блоги, в которых упоминается эта модель