График ввода-вывода

Текст

jina-embeddings-v2-base-de

Вектор

Парето-фронт
30M100M300M1B3.0B657075808590bge-m3EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Параметры (лог)Spearman
Эта модель
На фронте
Jina AI
Другие
MTEB English · sts
82.00
Параметры
161M
Ранг по баллу
13 / 39
Парето-фронт
Позади
Распределение значений
AUC 0.8452
Корпус
Пары переводов
Поиск по документации
0.6900.000.200.400.600.80
Связанные16.8%
Сложный отрицательный1.7%
Несвязанные0.9%
Рекомендуемые пороги
FPR 0.1 · 0.499
FPR 0.01 · 0.690
FPR 0.001 · 0.796
FPR 0.0001 · 0.897
сбалансированный · 0.368
AUC
0.8452
Потолок шума
0.793
Обрыв полноты
0.195
Измерено пар
119 / 11k
Компоненты вектора
-0.19-0.010.17
σ 0.0361 · 183k значений
Геометрия эмбеддингов
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.316
Эффективных изм.
49 / 768
Языковые пары
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.158
Выберите модели для сравнения
Публикации (1)

Обзор

jina-embeddings-v2-base-de — двуязычная эмбеддинг-модель текста на 161M параметров, покрывающая немецкий и английский, с окном контекста в 8 192 токенов. Она отображает семантически эквивалентный контент на обоих языках в то же самое 768-мерное пространство эмбеддингов, обеспечивая межъязыковый поиск без перевода. Модель была одной из первых open-source двуязычных эмбеддинг-моделей, объединивших поддержку длинного контекста со сбалансированным качеством на обоих языках.

Методы

Построенная на backbone на базе BERT с симметричным двунаправленным ALiBi позиционным кодированием, модель обрабатывает и немецкий, и английский через унифицированную архитектуру на 161M параметров, производящую 768-мерные эмбеддинги. Обучение включало три этапа: (1) мультиязычное предобучение на параллельных корпусах немецко-английских текстов, (2) контрастивное дообучение на курированных парах предложений с трудными негативами и (3) межъязыковое обучение выравниванию, чтобы гарантировать, что семантически эквивалентные тексты на немецком и английском отображаются в соседние области пространства эмбеддингов. Ключевой выбор проектирования — целевая функция минимизации смещения, которая противодействует склонности мультиязычных моделей отдавать предпочтение английским грамматическим структурам — задокументированный сбой ранних мультиязычных эмбеддингов. Окно в 8 192 токенов через ALiBi позволяет обрабатывать целые документы на обоих языках без усечения.

Производительность

Модель превзошла E5-base от Microsoft, будучи меньше трети её размера, и достигла уровня E5-large, несмотря на то что была в 7 раз меньше. На WikiCLIR (поиск с английского на немецкий), STS17/STS22 (двунаправленная семантическая близость) и BUCC (двуязычное выравнивание текста) она стабильно превосходила модели того же или большего размера. Footprint в 322МБ позволял развёртывание на стандартном оборудовании. В 2026 году jina-embeddings-v5-text-small вытесняет эту модель для большинства применений, предлагая контекст 32K, 89 языков и task-специфичные LoRA-адаптеры. Модель v2-base-de остаётся полезной для немецко-английских двуязычных конвейеров, где контекста в 8K достаточно.

Руководство

Оптимален для немецко-английского двуязычного поиска: поиск товаров, справочная документация и управление контентом, где запросы и документы могут быть на разных языках. Для документов свыше 8 192 токенов используйте семантический чанкинг или параметр `late_chunking через API Jina. Модель интегрируется с Qdrant, Weaviate, MongoDB и Milvus. Для новых мультиязычных проектов, охватывающих более двух языков, предпочитайте jina-embeddings-v5-text-small` (89 языков, контекст 32K, LoRA-адаптеры). Для продакшен-пропускной способности рекомендуется GPU с поддержкой CUDA.

Блоги, в которых упоминается эта модель
сентябрь 27, 2024 • 15 минуты чтения
Миграция с Jina Embeddings v2 на v3
Мы собрали несколько советов, которые помогут вам мигрировать с Jina Embeddings v2 на v3.
май 15, 2024 • 11 минуты чтения
Бинарные эмбеддинги: вся мощь ИИ при 3,125% объема данных
32 бита — это слишком много точности для такой надежной и неточной вещи, как AI-модель. Поэтому мы избавились от 31 из них! Бинарные эмбеддинги меньше, быстрее и высокопроизводительны.
апрель 29, 2024 • 7 минуты чтения
Jina Embeddings и Reranker в Azure: масштабируемые AI-решения для бизнеса
Теперь Jina Embeddings и Rerankers доступны в Azure Marketplace. Предприятия, для которых приоритетом являются конфиденциальность и безопасность, могут легко интегрировать современные модели Jina AI прямо в свою существующую экосистему Azure.
январь 31, 2024 • 16 минуты чтения
Глубокое погружение в токенизацию
Токенизация в LLM означает разделение входных текстов на более мелкие части для обработки. Так почему же за embeddings берут плату по токенам?
январь 26, 2024 • 13 минуты чтения
Двуязычные модели Jina Embeddings v2 теперь в открытом доступе на Hugging Face
Билингвальные модели эмбеддингов с открытым исходным кодом от Jina AI для немецко-английской и китайско-английской языковых пар теперь доступны на Hugging Face. Рассмотрим процесс установки и кросс-языкового поиска.