График ввода-вывода

Текст

jina-embeddings-v2-base-zh

Вектор

Парето-фронт
30M100M300M1B3.0B10B506070acge_text_embeddingbge-base-zhbge-base-zh-v1.5bge-large-zh-noinstructbge-small-zhbge-small-zh-v1.5Conan-embedding-v1Dmeta-embedding-zh-smalle5-mistral-7b-instructgte-base-zhgte-large-zhgte-multilingual-basegte-Qwen1.5-7B-instructgte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-small-zhluotuo-bert-mediumm3e-basem3e-largemultilingual-e5-basemultilingual-e5-largemultilingual-e5-smallpiccolo-base-zhpiccolo-large-zh-v2stella-base-zh-v2stella-base-zh-v3-1792dstella-large-zh-v2stella-mrl-large-zh-v3.…text2vec-base-chinesetext2vec-large-chinesexiaobu-embeddingxiaobu-embedding-v2Yinkazpoint_large_embedding_…Параметры (лог)score
Эта модель
На фронте
Jina AI
Другие
C-MTEB
63.79
Параметры
161M
Ранг по баллу
23 / 40
Парето-фронт
Позади
Распределение значений
AUC 0.8373
Корпус
Пары переводов
Поиск по документации
0.6820.000.200.400.600.80
Связанные12.6%
Сложный отрицательный1.8%
Несвязанные1.2%
Рекомендуемые пороги
FPR 0.1 · 0.475
FPR 0.01 · 0.682
FPR 0.001 · 0.796
FPR 0.0001 · 0.835
сбалансированный · 0.353
AUC
0.8373
Потолок шума
0.793
Обрыв полноты
0.113
Измерено пар
119 / 11k
Компоненты вектора
-0.180.000.18
σ 0.0361 · 183k значений
Геометрия эмбеддингов
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.308
Эффективных изм.
56 / 768
Выберите модели для сравнения
Публикации (1)

Обзор

jina-embeddings-v2-base-zh — двуязычная эмбеддинг-модель текста на 161M параметров для китайского и английского, с окном контекста в 8 192 токенов и выходом в 768 измерений. Это была первая open-source модель, бесшовно обрабатывавшая и китайский, и английский с поддержкой длинного контекста, и решавшая специфические задачи токенизации китайского текста, основанного на иероглифах, в трансформерных архитектурах.

Методы

Модель использует backbone на базе BERT с симметричным двунаправленным ALiBi позиционным кодированием, 161M параметров и выходное пространство в 768 измерений. Обучение следовало трёхфазному подходу: начальное предобучение на высококачественных двуязычных китайско-английских данных, за которым последовали основной и дополнительный этапы дообучения с контрастивным loss и добычей трудных негативов. Механизм ALiBi обеспечивает окно контекста в 8 192 токенов без выученных позиционных эмбеддингов. Заметное улучшение в финальном релизе — уточнённое распределение оценок близости, которое устранило проблемы инфляции оценок, присутствовавшие в превью-версии, и дало более дискриминативные и хорошо откалиброванные оценки близости.

Производительность

На лидерборде C-MTEB (китайский MTEB) модель продемонстрировала выдающееся качество среди моделей меньше 0,5GB, особенно отличившись на китайских задачах. Она значительно превзошла text-embedding-ada-002 от OpenAI на специфичных для китайского задачах поиска и близости, сохраняя при этом конкурентоспособное качество на английских задачах. Уточнённое распределение оценок близости улучшило дискриминацию между связанным и несвязанным контентом на обоих языках. В 2026 году jina-embeddings-v5-text-small вытесняет эту модель с 89 языками, контекстом 32K и task-специфичными LoRA-адаптерами.

Руководство

Оптимальна для двуязычного поиска китайский-английский, межъязыкового поиска документов и мультиязычного анализа контента. Для документов свыше 8 192 токенов используйте семантический чанкинг или параметр `late_chunking через API Jina. Модель интегрируется с основными векторными базами данных и RAG-фреймворками. Для новых мультиязычных проектов предпочитайте jina-embeddings-v5-text-small` (89 языков, контекст 32K, LoRA-адаптеры). Для продакшен-пропускной способности рекомендуется GPU с поддержкой CUDA. Входной текст должен быть на китайском или английском; модель обрабатывает оба языка нативно без перевода.

Блоги, в которых упоминается эта модель