개요
jina-embeddings-v2-base-de는 161M 파라미터 독일어·영어 이중언어 텍스트 임베딩 모델로, 8,192토큰 컨텍스트 윈도우를 갖추고 있습니다. 두 언어의 의미적으로 동등한 콘텐츠를 동일한 768차원 임베딩 공간으로 매핑해 번역 없이 크로스 언어 검색을 가능하게 합니다. 모델은 긴 컨텍스트 지원과 두 언어에 걸친 균형 잡힌 성능을 결합한 최초의 오픈소스 이중언어 임베딩 모델 중 하나였습니다.
방법
대칭 양방향 ALiBi 위치 인코딩을 갖춘 BERT 기반 백본 위에 구축된 이 모델은 161M 파라미터의 통합 아키텍처를 통해 독일어와 영어를 모두 처리해 768차원 임베딩을 생성합니다. 학습은 3단계를 포함합니다: (1) 독일어-영어 병렬 코퍼스에서의 다국어 사전학습, (2) 어려운 음의(negative)를 포함한 큐레이션된 문장 쌍에서의 대비 정밀조정, (3) 독일어와 영어의 의미적으로 동등한 텍스트가 임베딩 공간의 인접 영역으로 매핑되도록 보장하는 크로스 언어 정렬 학습. 핵심 설계 선택은 편향 최소화 목적함수로, 다국어 모델이 영어 문법 구조를 선호하는 경향을 상쇄합니다 — 이전 다국어 임베딩에서 문서화된 실패 모드입니다. ALiBi를 통한 8,192토큰 윈도우는 절단 없이 두 언어 모두에서 문서 전체를 처리할 수 있게 합니다.
성능
모델은 Microsoft의 E5-base를 능가하면서도 그 크기의 3분의 1 미만이었으며, 7배 작은 데도 E5-large의 성능을 충족했습니다. WikiCLIR(영어에서 독일어로의 검색), STS17/STS22(양방향 시맨틱 유사도), BUCC(이중언어 텍스트 정렬)에서 동일하거나 더 큰 크기의 모델을 일관되게 능가했습니다. 322MB 풋프린트는 표준 하드웨어에서 배포를 가능하게 했습니다. 2026년에 jina-embeddings-v5-text-small이 대부분의 애플리케이션에서 이 모델을 대체하며, 32K 컨텍스트, 89개 언어, 작업별 LoRA 어댑터를 제공합니다. v2-base-de 모델은 8K 컨텍스트가 충분한 독일어-영어 이중언어 파이프라인에서 여전히 유용합니다.
모범 사례
독일어-영어 이중언어 검색에 최적입니다: 제품 검색, 지원 문서, 콘텐츠 관리 등 쿼리와 문서가 서로 다른 언어가 될 수 있는 곳입니다. 8,192토큰을 초과하는 문서에는 시맨틱 청킹 또는 Jina API를 통한 `late_chunking 파라미터를 사용하세요. 모델은 Qdrant, Weaviate, MongoDB, Milvus와 통합됩니다. 두 언어를 넘는 새로운 다국어 프로젝트에는 jina-embeddings-v5-text-small`(89개 언어, 32K 컨텍스트, LoRA 어댑터)을 권장합니다. 프로덕션 처리량을 위해 CUDA 지원 GPU를 권장합니다.









