Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
warning
Эта модель устарела из-за появления новых моделей.
Вложения
Лицензия Apache 2.0
open_in_new Выпуск Пост

jina-embeddings-v2-base-es

Двуязычные встраивания на испанском и английском языках с производительностью SOTA
Лицензия
Apache-2.0
Дата выпуска
calendar_month
2024-02-14
Вход
abc
Текст
arrow_forward
Выход
more_horiz
Вектор
Позднее фрагментирование help_outline
check_circle
Yes
Подробности модели
Параметры: 161M
Длина входного токена: 8K
Выходной размер: 768
Базовая модель help_outline
open_in_new
jina-embeddings-v2-base-en
Обученные языки help_outline
2 языки
Похожие модели
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
Доступно через
API Джина
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
График ввода-вывода

Текст

jina-embeddings-v2-base-es

Вектор

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
Распределение значенийhelp_outline
AUC 0.8383
Корпус
Пары переводов
Поиск по документации
0.6830.000.200.400.600.80
Связанные17.6%
Сложный отрицательный3.0%
Несвязанные0.8%
Рекомендуемые пороги
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
сбалансированный · 0.365
AUC
0.8383
Потолок шума
0.774
Обрыв полноты
0.163
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
-0.160.000.17
σ 0.0361 · 183k значений
Геометрия эмбеддинговhelp_outline
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.326
Эффективных изм.
51 / 768
Языковые парыhelp_outline
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.315
Выберите модели для сравнения
Публикации (1)
arXiv
февраль 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Обзор

Jina Embeddings v2 Base Spanish — это новаторская модель встраивания двуязычного текста, которая решает критическую задачу кросс-языкового поиска и анализа информации между испанским и английским контентом. В отличие от традиционных многоязычных моделей, которые часто демонстрируют предвзятость в отношении определенных языков, эта модель обеспечивает действительно сбалансированную производительность как на испанском, так и на английском языках, что делает ее незаменимой для организаций, работающих на испаноязычных рынках или обрабатывающих двуязычный контент. Наиболее примечательной особенностью модели является ее способность генерировать геометрически выровненные встраивания — когда тексты на испанском и английском языках выражают одно и то же значение, их векторные представления естественным образом группируются вместе в пространстве встраивания, обеспечивая бесшовный кросс-языковой поиск и анализ.

Методы

В основе этой модели лежит инновационная архитектура, основанная на симметричном двунаправленном ALiBi (Attention with Linear Biases), сложном подходе, который позволяет обрабатывать последовательности до 8192 токенов без традиционных позиционных вложений. Модель использует модифицированную архитектуру BERT с 161 млн параметров, включающую Gated Linear Units (GLU) и специализированные методы нормализации слоев. Обучение следует трехэтапному процессу: первоначальное предварительное обучение на массивном текстовом корпусе, за которым следует тонкая настройка с тщательно отобранными парами текстов и, наконец, жестко-отрицательное обучение для улучшения различения похожего, но семантически различного контента. Этот подход в сочетании с 768-мерными вложениями позволяет модели улавливать тонкие семантические отношения, сохраняя при этом вычислительную эффективность.

Производительность

В комплексных бенчмарк-оценках модель демонстрирует исключительные возможности, особенно в задачах поиска на разных языках, где она превосходит значительно более крупные многоязычные модели, такие как E5 и BGE-M3, несмотря на то, что составляет всего 15–30 % от их размера. Модель достигает превосходной производительности в задачах поиска и кластеризации, демонстрируя особую силу в сопоставлении семантически эквивалентного контента на разных языках. При тестировании на бенчмарке MTEB она демонстрирует надежную производительность в различных задачах, включая классификацию, кластеризацию и семантическую схожесть. Расширенное контекстное окно из 8192 токенов оказывается особенно ценным для обработки длинных документов, демонстрируя стабильную производительность даже с документами, охватывающими несколько страниц — возможность, которой не хватает большинству конкурирующих моделей.

Руководство

Для эффективного использования этой модели организации должны обеспечить доступ к инфраструктуре GPU с поддержкой CUDA для оптимальной производительности. Модель легко интегрируется с основными векторными базами данных и фреймворками RAG, включая MongoDB, Qdrant, Weaviate и Haystack, что делает ее легко развертываемой в производственных средах. Она отлично подходит для таких приложений, как поиск двуязычных документов, системы рекомендаций по контенту и кросс-языковой анализ документов. Хотя модель демонстрирует впечатляющую универсальность, она особенно оптимизирована для двуязычных сценариев испанского и английского языков и может быть не лучшим выбором для одноязычных приложений или сценариев, включающих другие языковые пары. Для получения оптимальных результатов входные тексты должны быть правильно отформатированы на испанском или английском языках, хотя модель эффективно обрабатывает контент на разных языках. Модель поддерживает тонкую настройку для приложений, специфичных для домена, но к этому следует подходить с тщательным учетом качества и распределения обучающих данных.
Блоги, в которых упоминается эта модель
апрель 29, 2024 • 7 минуты чтения
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
февраль 14, 2024 • 4 минуты чтения
Aquí Se Habla Español: Top-Quality Spanish-English Embeddings and 8k Context
Jina AI's new bilingual Spanish-English embedding model brings the state-of-the-art in AI to half a billion Spanish speakers.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.