График ввода-вывода
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
Распределение значенийhelp_outlineAUC 0.8383
Корпус
Пары переводов
Поиск по документации
Связанные17.6%
Сложный отрицательный3.0%
Несвязанные0.8%
Рекомендуемые пороги
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
сбалансированный · 0.365
AUC
0.8383
Потолок шума
0.774
Обрыв полноты
0.163
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
σ 0.0361 · 183k значений
Геометрия эмбеддинговhelp_outline
Среднее по измерениям, наведите для диапазона
Уровень шума
0.326
Эффективных изм.
51 / 768
Языковые парыhelp_outline
Разброс порога между парами: 0.315
Выберите модели для сравнения
Публикации (1)
Обзор
Jina Embeddings v2 Base Spanish — это новаторская модель встраивания двуязычного текста, которая решает критическую задачу кросс-языкового поиска и анализа информации между испанским и английским контентом. В отличие от традиционных многоязычных моделей, которые часто демонстрируют предвзятость в отношении определенных языков, эта модель обеспечивает действительно сбалансированную производительность как на испанском, так и на английском языках, что делает ее незаменимой для организаций, работающих на испаноязычных рынках или обрабатывающих двуязычный контент. Наиболее примечательной особенностью модели является ее способность генерировать геометрически выровненные встраивания — когда тексты на испанском и английском языках выражают одно и то же значение, их векторные представления естественным образом группируются вместе в пространстве встраивания, обеспечивая бесшовный кросс-языковой поиск и анализ.
Методы
В основе этой модели лежит инновационная архитектура, основанная на симметричном двунаправленном ALiBi (Attention with Linear Biases), сложном подходе, который позволяет обрабатывать последовательности до 8192 токенов без традиционных позиционных вложений. Модель использует модифицированную архитектуру BERT с 161 млн параметров, включающую Gated Linear Units (GLU) и специализированные методы нормализации слоев. Обучение следует трехэтапному процессу: первоначальное предварительное обучение на массивном текстовом корпусе, за которым следует тонкая настройка с тщательно отобранными парами текстов и, наконец, жестко-отрицательное обучение для улучшения различения похожего, но семантически различного контента. Этот подход в сочетании с 768-мерными вложениями позволяет модели улавливать тонкие семантические отношения, сохраняя при этом вычислительную эффективность.
Производительность
В комплексных бенчмарк-оценках модель демонстрирует исключительные возможности, особенно в задачах поиска на разных языках, где она превосходит значительно более крупные многоязычные модели, такие как E5 и BGE-M3, несмотря на то, что составляет всего 15–30 % от их размера. Модель достигает превосходной производительности в задачах поиска и кластеризации, демонстрируя особую силу в сопоставлении семантически эквивалентного контента на разных языках. При тестировании на бенчмарке MTEB она демонстрирует надежную производительность в различных задачах, включая классификацию, кластеризацию и семантическую схожесть. Расширенное контекстное окно из 8192 токенов оказывается особенно ценным для обработки длинных документов, демонстрируя стабильную производительность даже с документами, охватывающими несколько страниц — возможность, которой не хватает большинству конкурирующих моделей.
Руководство
Для эффективного использования этой модели организации должны обеспечить доступ к инфраструктуре GPU с поддержкой CUDA для оптимальной производительности. Модель легко интегрируется с основными векторными базами данных и фреймворками RAG, включая MongoDB, Qdrant, Weaviate и Haystack, что делает ее легко развертываемой в производственных средах. Она отлично подходит для таких приложений, как поиск двуязычных документов, системы рекомендаций по контенту и кросс-языковой анализ документов. Хотя модель демонстрирует впечатляющую универсальность, она особенно оптимизирована для двуязычных сценариев испанского и английского языков и может быть не лучшим выбором для одноязычных приложений или сценариев, включающих другие языковые пары. Для получения оптимальных результатов входные тексты должны быть правильно отформатированы на испанском или английском языках, хотя модель эффективно обрабатывает контент на разных языках. Модель поддерживает тонкую настройку для приложений, специфичных для домена, но к этому следует подходить с тщательным учетом качества и распределения обучающих данных.
Блоги, в которых упоминается эта модель




