개요
jina-embeddings-v2-base-zh는 중국어·영어 161M 파라미터 이중언어 텍스트 임베딩 모델로, 8,192토큰 컨텍스트 윈도우와 768차원 출력을 갖추고 있습니다. 긴 컨텍스트 지원으로 중국어와 영어를 모두 매끄럽게 처리한 최초의 오픈소스 모델로, 트랜스퍼머 아키텍처에서 중국어 문자 기반 텍스트의 고유한 토큰화 과제에 대응했습니다.
방법
모델은 대칭 양방향 ALiBi 위치 인코딩을 갖춘 BERT 기반 백본, 161M 파라미터, 768차원 출력 공간을 사용합니다. 학습은 3단계 접근을 따랐습니다: 고품질 중국어-영어 이중언어 데이터에서의 초기 사전학습에 이어, 대비 손실과 어려운 음의 마이닝을 포함한 1차·2차 정밀조정 단계. ALiBi 메커니즘으로 학습된 위치 임베딩 없이 8,192토큰 컨텍스트 윈도우가 가능해졌습니다. 최종 릴리스의 주목할 만한 개선은 미리보기 버전에서 존재했던 점수 부풀림 문제를 해결한 정제된 유사도 점수 분포로, 더 높은 판별력과 잘 보정된 유사도 점수를 생성합니다.
성능
C-MTEB(중국 MTEB) 리더보드에서 모델은 0.5GB 미만 모델 가운데 뛰어난 성능을 보여주며, 특히 중국어 작업에서 두각을 나타냈습니다. 중국어 특화 검색 및 유사도 작업에서 OpenAI의 text-embedding-ada-002를 현저히 능가하면서도 영어 작업에서는 경쟁적인 성능을 유지했습니다. 정제된 유사도 점수 분포는 두 언어 모두에서 관련 및 무관 콘텐츠 간 판별을 향상시켰습니다. 2026년에 jina-embeddings-v5-text-small이 89개 언어, 32K 컨텍스트, 작업별 LoRA 어댑터로 이 모델을 대체합니다.
모범 사례
중국어-영어 이중언어 검색, 크로스 언어 문서 검색, 다국어 콘텐츠 분석에 최적입니다. 8,192토큰을 초과하는 문서에는 시맨틱 청킹 또는 Jina API를 통한 `late_chunking 파라미터를 사용하세요. 모델은 주요 벡터 데이터베이스 및 RAG 프레임워크와 통합됩니다. 새로운 다국어 프로젝트에는 jina-embeddings-v5-text-small`(89개 언어, 32K 컨텍스트, LoRA 어댑터)을 권장합니다. 프로덕션 처리량을 위해 CUDA 지원 GPU를 권장합니다. 입력 텍스트는 중국어 또는 영어여야 합니다. 모델은 번역 없이 두 언어를 모두 네이티브로 처리합니다.







