Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Реранкер для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документация
Авторизоваться
login
warning
Эта модель устарела из-за появления новых моделей.
Эмбеддинги
Лицензия Apache 2.0
open_in_new Пост о релизе

jina-embeddings-v2-base-zh

Китайско-английское двуязычное эмбеддинг с производительностью SOTA
Лицензия
Apache-2.0
Дата выпуска
calendar_month
2024-01-09
Вход
abc
Текст
arrow_forward
Выход
more_horiz
Вектор
Позднее дробление help_outline
check_circle
Yes
Подробности модели
Параметры: 161M
Длина входного токена: 8K
Выходной размер: 768
Базовая модель help_outline
jina-bert-v2-base-zh
Обученные языки help_outline
2 языки
Похожие модели
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
Доступно через
API Jina AI
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
График ввода-вывода

Текст

jina-embeddings-v2-base-zh

Вектор

Парето-фронтhelp_outline
30M100M300M1B3.0B10B506070acge_text_embeddingbge-base-zhbge-base-zh-v1.5bge-large-zh-noinstructbge-small-zhbge-small-zh-v1.5Conan-embedding-v1Dmeta-embedding-zh-smalle5-mistral-7b-instructgte-base-zhgte-large-zhgte-multilingual-basegte-Qwen1.5-7B-instructgte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-small-zhluotuo-bert-mediumm3e-basem3e-largemultilingual-e5-basemultilingual-e5-largemultilingual-e5-smallpiccolo-base-zhpiccolo-large-zh-v2stella-base-zh-v2stella-base-zh-v3-1792dstella-large-zh-v2stella-mrl-large-zh-v3.…text2vec-base-chinesetext2vec-large-chinesexiaobu-embeddingxiaobu-embedding-v2Yinkazpoint_large_embedding_…Параметры (лог)score
Эта модель
На фронте
Jina AI
Другие
C-MTEB
63.79
Параметры
161M
Ранг по баллу
23 / 40
Парето-фронт
Позади
Распределение значенийhelp_outline
AUC 0.8373
Корпус
Пары переводов
Поиск по документации
0.6820.000.200.400.600.80
Связанные12.6%
Сложный отрицательный1.8%
Несвязанные1.2%
Рекомендуемые пороги
FPR 0.1 · 0.475
FPR 0.01 · 0.682
FPR 0.001 · 0.796
FPR 0.0001 · 0.835
сбалансированный · 0.353
AUC
0.8373
Потолок шума
0.793
Обрыв полноты
0.113
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
-0.180.000.18
σ 0.0361 · 183k значений
Геометрия эмбеддинговhelp_outline
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.308
Эффективных изм.
56 / 768
Выберите модели для сравнения
Публикации (1)
arXiv
февраль 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Обзор

jina-embeddings-v2-base-zh — двуязычная эмбеддинг-модель текста на 161M параметров для китайского и английского, с окном контекста в 8 192 токенов и выходом в 768 измерений. Это была первая open-source модель, бесшовно обрабатывавшая и китайский, и английский с поддержкой длинного контекста, и решавшая специфические задачи токенизации китайского текста, основанного на иероглифах, в трансформерных архитектурах.

Методы

Модель использует backbone на базе BERT с симметричным двунаправленным ALiBi позиционным кодированием, 161M параметров и выходное пространство в 768 измерений. Обучение следовало трёхфазному подходу: начальное предобучение на высококачественных двуязычных китайско-английских данных, за которым последовали основной и дополнительный этапы дообучения с контрастивным loss и добычей трудных негативов. Механизм ALiBi обеспечивает окно контекста в 8 192 токенов без выученных позиционных эмбеддингов. Заметное улучшение в финальном релизе — уточнённое распределение оценок близости, которое устранило проблемы инфляции оценок, присутствовавшие в превью-версии, и дало более дискриминативные и хорошо откалиброванные оценки близости.

Производительность

На лидерборде C-MTEB (китайский MTEB) модель продемонстрировала выдающееся качество среди моделей меньше 0,5GB, особенно отличившись на китайских задачах. Она значительно превзошла text-embedding-ada-002 от OpenAI на специфичных для китайского задачах поиска и близости, сохраняя при этом конкурентоспособное качество на английских задачах. Уточнённое распределение оценок близости улучшило дискриминацию между связанным и несвязанным контентом на обоих языках. В 2026 году jina-embeddings-v5-text-small вытесняет эту модель с 89 языками, контекстом 32K и task-специфичными LoRA-адаптерами.

Руководство

Оптимальна для двуязычного поиска китайский-английский, межъязыкового поиска документов и мультиязычного анализа контента. Для документов свыше 8 192 токенов используйте семантический чанкинг или параметр `late_chunking через API Jina. Модель интегрируется с основными векторными базами данных и RAG-фреймворками. Для новых мультиязычных проектов предпочитайте jina-embeddings-v5-text-small` (89 языков, контекст 32K, LoRA-адаптеры). Для продакшен-пропускной способности рекомендуется GPU с поддержкой CUDA. Входной текст должен быть на китайском или английском; модель обрабатывает оба языка нативно без перевода.

Блоги, в которых упоминается эта модель
апрель 29, 2024 • 7 минуты чтения
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
январь 31, 2024 • 16 минуты чтения
A Deep Dive into Tokenization
Tokenization, in LLMs, means chopping input texts up into smaller parts for processing. So why are embeddings billed by the token?
Scott Martens
Colorful speckled grid pattern with a mix of small multicolored dots on a black background, creating a mosaic effect.
январь 26, 2024 • 13 минуты чтения
Jina Embeddings v2 Bilingual Models Are Now Open-Source On Hugging Face
Jina AI's open-source bilingual embedding models for German-English and Chinese-English are now on Hugging Face. We’re going to walk through installation and cross-language retrieval.
Scott Martens
Colorful "EMBEDDINGS" text above a pile of yellow smileys on a black background with decorative lines at the top.
январь 09, 2024 • 12 минуты чтения
8K Token-Length Bilingual Embeddings Break Language Barriers in Chinese and English
The first bilingual Chinese-English embedding model with 8192 token-length.
Jina AI
Colorful 3D text "OPEN" in green and blue on a black background creating a vibrant effect
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.