Обзор
jina-embeddings-v2-base-zh — двуязычная эмбеддинг-модель текста на 161M параметров для китайского и английского, с окном контекста в 8 192 токенов и выходом в 768 измерений. Это была первая open-source модель, бесшовно обрабатывавшая и китайский, и английский с поддержкой длинного контекста, и решавшая специфические задачи токенизации китайского текста, основанного на иероглифах, в трансформерных архитектурах.
Методы
Модель использует backbone на базе BERT с симметричным двунаправленным ALiBi позиционным кодированием, 161M параметров и выходное пространство в 768 измерений. Обучение следовало трёхфазному подходу: начальное предобучение на высококачественных двуязычных китайско-английских данных, за которым последовали основной и дополнительный этапы дообучения с контрастивным loss и добычей трудных негативов. Механизм ALiBi обеспечивает окно контекста в 8 192 токенов без выученных позиционных эмбеддингов. Заметное улучшение в финальном релизе — уточнённое распределение оценок близости, которое устранило проблемы инфляции оценок, присутствовавшие в превью-версии, и дало более дискриминативные и хорошо откалиброванные оценки близости.
Производительность
На лидерборде C-MTEB (китайский MTEB) модель продемонстрировала выдающееся качество среди моделей меньше 0,5GB, особенно отличившись на китайских задачах. Она значительно превзошла text-embedding-ada-002 от OpenAI на специфичных для китайского задачах поиска и близости, сохраняя при этом конкурентоспособное качество на английских задачах. Уточнённое распределение оценок близости улучшило дискриминацию между связанным и несвязанным контентом на обоих языках. В 2026 году jina-embeddings-v5-text-small вытесняет эту модель с 89 языками, контекстом 32K и task-специфичными LoRA-адаптерами.
Руководство
Оптимальна для двуязычного поиска китайский-английский, межъязыкового поиска документов и мультиязычного анализа контента. Для документов свыше 8 192 токенов используйте семантический чанкинг или параметр `late_chunking через API Jina. Модель интегрируется с основными векторными базами данных и RAG-фреймворками. Для новых мультиязычных проектов предпочитайте jina-embeddings-v5-text-small` (89 языков, контекст 32K, LoRA-адаптеры). Для продакшен-пропускной способности рекомендуется GPU с поддержкой CUDA. Входной текст должен быть на китайском или английском; модель обрабатывает оба языка нативно без перевода.







