개요
jina-embeddings-v2-base-es는 스페인어·영어 161M 파라미터 이중언어 텍스트 임베딩 모델로, 8,192토큰 컨텍스트 윈도우와 768차원 출력을 갖추고 있습니다. 스페인어권 시장의 크로스 언어 검색을 위해 설계되어, 의미적으로 동등한 스페인어·영어 콘텐츠를 공유 임베딩 공간으로 매핑합니다. 모델은 중요한 공백을 해결합니다: 당시 대부분의 임베딩 모델은 영어 중심이었고, 스페인어 성능이 크게 저하되어 있었습니다.
방법
모델은 대칭 양방향 ALiBi 위치 인코딩을 갖춘 BERT 기반 백본, 161M 파라미터, 768차원 출력 공간을 사용합니다. 학습은 3단계 과정을 따랐습니다: (1) 스페인어-영어 병렬 코퍼스에서의 사전학습, (2) 큐레이션된 문장 쌍에서의 어려운 음의 마이닝을 포함한 대비 정밀조정, (3) 동일한 개념의 스페인어·영어 표현이 함께 클러스터링되도록 보장하는 크로스 언어 정렬. ALiBi 메커니즘으로 학습된 위치 임베딩 없이 8,192토큰 컨텍스트가 가능해져, 모델이 512토큰 훈련 길이를 넘어 외삽할 수 있습니다. 평균 풀링이 최종 임베딩 벡터를 생성합니다.
성능
모델은 그 크기의 15–30%에 불과하면서도 훨씬 더 큰 다국어 모델(E5, BGE-M3)을 스페인어-영어 검색 작업에서 능가했습니다. MTEB 스페인어 서브태스크, 특히 검색과 클러스터링에서 강한 성능을 보여주었습니다. 8,192토큰 컨텍스트 윈도우는 대부분의 경쟁 모델이 청킹을 필요로 하던 여러 페이지 문서에서 일관된 성능을 제공했습니다. 2026년에 jina-embeddings-v5-text-small이 89개 언어, 32K 컨텍스트, 작업별 LoRA 어댑터를 제공하며 이 모델을 대체합니다. v2-base-es 모델은 전용 스페인어-영어 파이프라인에서 비용 효율적인 옵션으로 남아 있습니다.
모범 사례
스페인어-영어 이중언어 검색, 콘텐츠 추천, 크로스 언어 문서 분석에 이상적입니다. 8,192토큰을 초과하는 문서에는 시맨틱 청킹 또는 Jina API를 통한 `late_chunking 파라미터를 사용하세요. 모델은 주요 벡터 데이터베이스 및 RAG 프레임워크와 통합됩니다. 스페인어-영어를 넘는 다국어 커버리지, 32K 컨텍스트, 작업별 최적화가 필요한 새 프로젝트에는 jina-embeddings-v5-text-small`을 권장합니다. 프로덕션을 위해 CUDA 지원 GPU를 권장합니다. 입력 텍스트는 스페인어 또는 영어여야 합니다. 혼합 언어 입력은 지원되지만, 성능은 두 개의 훈련 언어에 대해 최적화되어 있습니다.




