Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
warning
이 모델은 최신 모델로 대체되어 더 이상 권장되지 않습니다.
Embeddings
아파치 2.0 라이선스
open_in_new 릴리스 포스트

jina-embeddings-v2-base-zh

SOTA 성능의 중국어-영어 이중 언어 벡터 모델
라이선스
Apache-2.0
출시일
calendar_month
2024-01-09
입력
abc
텍스트
arrow_forward
출력
more_horiz
벡터
Late Chunking help_outline
check_circle
Yes
모델 세부정보
매개변수: 161M
입력 토큰 길이: 8K
출력 크기: 768
기본 모델 help_outline
jina-bert-v2-base-zh
훈련된 언어 help_outline
2 언어
관련 모델
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
다음을 통해 이용 가능
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
망분리
I/O 다이어그램

텍스트

jina-embeddings-v2-base-zh

벡터

파레토 프론트help_outline
30M100M300M1B3.0B10B506070acge_text_embeddingbge-base-zhbge-base-zh-v1.5bge-large-zh-noinstructbge-small-zhbge-small-zh-v1.5Conan-embedding-v1Dmeta-embedding-zh-smalle5-mistral-7b-instructgte-base-zhgte-large-zhgte-multilingual-basegte-Qwen1.5-7B-instructgte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-small-zhluotuo-bert-mediumm3e-basem3e-largemultilingual-e5-basemultilingual-e5-largemultilingual-e5-smallpiccolo-base-zhpiccolo-large-zh-v2stella-base-zh-v2stella-base-zh-v3-1792dstella-large-zh-v2stella-mrl-large-zh-v3.…text2vec-base-chinesetext2vec-large-chinesexiaobu-embeddingxiaobu-embedding-v2Yinkazpoint_large_embedding_…파라미터 수(로그)score
이 모델
프론트에 있음
Jina AI
기타
C-MTEB
63.79
매개변수
161M
점수 순위
23 / 40
파레토 프론트
프론트 아래
값 분포help_outline
AUC 0.8373
코퍼스
번역 쌍
문서 검색
0.6820.000.200.400.600.80
관련12.6%
하드 네거티브1.8%
무관1.2%
권장 컷오프
FPR 0.1 · 0.475
FPR 0.01 · 0.682
FPR 0.001 · 0.796
FPR 0.0001 · 0.835
균형 · 0.353
AUC
0.8373
노이즈 상한
0.793
재현율 절벽
0.113
측정 쌍 수
119 / 11k
벡터 성분help_outline
-0.180.000.18
σ 0.0361 · 183k 개 값
임베딩 기하 구조help_outline
0768
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.308
유효 차원
56 / 768
비교할 모델을 선택하세요
논문 (1)
arXiv
2월 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

개요

jina-embeddings-v2-base-zh는 중국어·영어 161M 파라미터 이중언어 텍스트 임베딩 모델로, 8,192토큰 컨텍스트 윈도우와 768차원 출력을 갖추고 있습니다. 긴 컨텍스트 지원으로 중국어와 영어를 모두 매끄럽게 처리한 최초의 오픈소스 모델로, 트랜스퍼머 아키텍처에서 중국어 문자 기반 텍스트의 고유한 토큰화 과제에 대응했습니다.

방법

모델은 대칭 양방향 ALiBi 위치 인코딩을 갖춘 BERT 기반 백본, 161M 파라미터, 768차원 출력 공간을 사용합니다. 학습은 3단계 접근을 따랐습니다: 고품질 중국어-영어 이중언어 데이터에서의 초기 사전학습에 이어, 대비 손실과 어려운 음의 마이닝을 포함한 1차·2차 정밀조정 단계. ALiBi 메커니즘으로 학습된 위치 임베딩 없이 8,192토큰 컨텍스트 윈도우가 가능해졌습니다. 최종 릴리스의 주목할 만한 개선은 미리보기 버전에서 존재했던 점수 부풀림 문제를 해결한 정제된 유사도 점수 분포로, 더 높은 판별력과 잘 보정된 유사도 점수를 생성합니다.

성능

C-MTEB(중국 MTEB) 리더보드에서 모델은 0.5GB 미만 모델 가운데 뛰어난 성능을 보여주며, 특히 중국어 작업에서 두각을 나타냈습니다. 중국어 특화 검색 및 유사도 작업에서 OpenAI의 text-embedding-ada-002를 현저히 능가하면서도 영어 작업에서는 경쟁적인 성능을 유지했습니다. 정제된 유사도 점수 분포는 두 언어 모두에서 관련 및 무관 콘텐츠 간 판별을 향상시켰습니다. 2026년에 jina-embeddings-v5-text-small이 89개 언어, 32K 컨텍스트, 작업별 LoRA 어댑터로 이 모델을 대체합니다.

모범 사례

중국어-영어 이중언어 검색, 크로스 언어 문서 검색, 다국어 콘텐츠 분석에 최적입니다. 8,192토큰을 초과하는 문서에는 시맨틱 청킹 또는 Jina API를 통한 `late_chunking 파라미터를 사용하세요. 모델은 주요 벡터 데이터베이스 및 RAG 프레임워크와 통합됩니다. 새로운 다국어 프로젝트에는 jina-embeddings-v5-text-small`(89개 언어, 32K 컨텍스트, LoRA 어댑터)을 권장합니다. 프로덕션 처리량을 위해 CUDA 지원 GPU를 권장합니다. 입력 텍스트는 중국어 또는 영어여야 합니다. 모델은 번역 없이 두 언어를 모두 네이티브로 처리합니다.

이 모델을 언급하는 블로그
4월 29, 2024 • 7 분 소요
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
1월 31, 2024 • 16 분 소요
A Deep Dive into Tokenization
Tokenization, in LLMs, means chopping input texts up into smaller parts for processing. So why are embeddings billed by the token?
Scott Martens
Colorful speckled grid pattern with a mix of small multicolored dots on a black background, creating a mosaic effect.
1월 26, 2024 • 13 분 소요
Jina Embeddings v2 Bilingual Models Are Now Open-Source On Hugging Face
Jina AI's open-source bilingual embedding models for German-English and Chinese-English are now on Hugging Face. We’re going to walk through installation and cross-language retrieval.
Scott Martens
Colorful "EMBEDDINGS" text above a pile of yellow smileys on a black background with decorative lines at the top.
1월 09, 2024 • 12 분 소요
8K Token-Length Bilingual Embeddings Break Language Barriers in Chinese and English
The first bilingual Chinese-English embedding model with 8192 token-length.
Jina AI
Colorful 3D text "OPEN" in green and blue on a black background creating a vibrant effect
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트와 모든 관련 콘텐츠, 소프트웨어, 제품 및 서비스는 전문 목적 사용을 위한 것입니다. 소비자 사용은 의도되지 않았습니다.