개요
jina-embeddings-v5-text-nano는 EuroBERT-210M 백본 위에 구축된 239M 파라미터의 다국어 텍스트 임베딩 모델입니다. 8K 토큰 컨텍스트를 지원하고, Matryoshka 절단을 32차원까지 수행할 수 있는 768차원 임베딩을 생성하며, Jina의 500M 미만 임베딩 패밀리에서 파라미터당 최고 정확도를 제공합니다. GPU가 사용 불가능한 엣지 배포, 지연 민감 애플리케이션, 리소스 제약 환경에 맞춰 설계되었습니다.
방법
모델은 15개 주요 언어를 커버하는 다국어 데이터로 사전 학습된 컴팩트한 양방향 인코더인 EuroBERT-210M 위에 구축됩니다. Last-Token-Pooling을 사용해 최종 토큰 표현에서 임베딩을 생성합니다. 훈련은 두 단계의 증류 레시피를 따릅니다: 먼저, 더 큰 티처 모델에서 지식 증류로 임베딩 품질을 전이하고, 다음으로, 태스크별 대비 손실로 검색, 텍스트 매칭, 클러스터링, 분류 태스크에서 모델을 파인튜닝합니다. Matryoshka Representation Learning은 임베딩 차원을 지원하는 어떤 크기(32, 64, 128, 256, 512, 768)에서든 절단하면서 강력한 성능을 유지하게 합니다. Geometric Orthogonal Regularization(GOR)은 2진 양자화 하의 성능 저하를 MTEB 검색에서 2포인트 미만으로 제한합니다. 8K 컨텍스트 윈도우는 청킹 없는 장문서 처리를 가능하게 합니다.
성능
MMTEB(다국어)에서, 모델은 겨우 239M 파라미터로 태스크 레벨 평균 65.5, 타입 레벨 평균 57.7을 달성하여, KaLM-mini-v2.5(60.1, 494M), voyage-4-nano(58.9, 480M), Gemma-300M(61.1, 308M)를 포함한 500M 미만 모든 모델을 능가합니다. 태스크 레벨 점수: 분류 69.2, 클러스터링 52.7, 페어 분류 81.9, 리랭킹 64.6, 검색 63.3, STS 78.2. 영어 MTEB에서는 평균 71.0을 달성하여, 훨씬 큰 jina-embeddings-v5-text-small(71.7)에 거의 필적합니다. 검색 특화: MTEB-M 63.26, RTEB 64.08, BEIR 56.06, LongEmbed 63.65. GOR 정규화 덕분에 2진 양자화 하에서도 임베딩은 견고함을 유지합니다.
모범 사례
적절한 태스크 접두사를 선택하세요: 비대칭 쿼리-문서 검색에는 'retrieval', 대칭 유사도에는 'text-matching', 그룹화에는 'clustering', 범주화에는 'classification'. Matryoshka 절단을 256차원으로 하면 검색 품질의 95% 이상을 유지하면서 스토리지를 67% 줄입니다. 추가 스토리지 감소를 위한 2진 양자화를 지원합니다. EuroBERT 백본은 영어, 프랑스어, 독일어, 스페인어, 중국어, 일본어, 아랍어, 힌디어를 포함한 15개 주요 언어에 대해 강력한 커버리지를 제공합니다. 임베딩 비교에는 코사인 유사도를 사용하세요. Jina AI API, Hugging Face(Sentence Transformers, vLLM), llama.cpp용 양자화 변형으로 사용할 수 있습니다. 32K 컨텍스트나 더 높은 정확도가 필요한 워크로드에는 대신 jina-embeddings-v5-text-small을 사용하세요.






