개요
jina-colbert-v2는 560M 파라미터의 다국어 레이트 인터랙션 검색 모델로, 89개 언어를 지원합니다. 토큰 수준 컴팩트 임베딩(토큰당 64–128차원)을 생성하는 최초의 다국어 ColBERT 유사 모델로, 확장 가능하고 비용 효율적인 다국어 검색을 가능하게 합니다. Matryoshka 표현 학습을 통해 128에서 64로 차원을 줄이면 성능 감소가 단 1.5%에 불과해 저장 요구사항을 절반으로 줄입니다.
방법
모델은 회전 위치 임베딩을 강화하고 Flash Attention으로 최적화된 수정 XLM-RoBERTa 백본(560M 파라미터)을 갖춘 ColBERT 레이트 인터랙션 아키텍처를 기반으로 합니다. 학습은 두 가지 핵심 단계를 포함합니다: (1) 다양한 언어의 다양한 약히 지도된 데이터로 초기 사전학습, (2) 라벨된 트리플렛 데이터와 더 큰 교사 모델로부터의 지도 증류로 정밀조정. 핵심 혁신은 멀티 벡터 임베딩에 Matryoshka 표현 학습을 구현한 것으로, 모델은 단일 학습 프로세스에서 128, 96 또는 64차원의 토큰 수준 벡터를 생성해 재학습 없이 동적 저장 최적화를 가능하게 합니다. 8,192토큰 문서 컨텍스트(12,288까지 확장 가능)와 32토큰 쿼리 한도는 ALiBi 위치 인코딩으로 관리됩니다.
성능
모델은 영어 작업에서 원래 ColBERT-v2 대비 6.5% 개선을 달성하며, 14개 BEIR 벤치마크에 걸쳐 평균 0.521점을 기록합니다. MIRACL 벤치마크에서 테스트된 모든 언어에 걸쳐 전통적인 BM25 기반 검색 방법보다 우수하며, 특히 크로스 링구얼 시나리오에서 강점을 보입니다. 128에서 64차원으로 줄이면 성능 감소는 1.5%에 그치고 저장 요구사항은 절반으로 줄어듭니다 — 예를 들어, 64차원 벡터로 1억 개 문서를 저장하면 AWS에서 월 659.62달러의 비용이 드는 반면, 128차원은 1,319.24달러입니다. 모델의 다국어 커버리지(89개 언어)와 컴팩트 토큰 임베딩은 글로벌 검색 애플리케이션에 특히 적합하게 만듭니다.
모범 사례
모델은 최적의 성능을 위해 CUDA 지원 하드웨어가 필요합니다. 쿼리는 32토큰으로 제한하면서 최대 8,192토큰(12,288까지 확장 가능)의 문서 길이를 지원합니다. 프로덕션 배포를 위해 Jina Search Foundation API, AWS 마켓플레이스, Azure를 통해 사용할 수 있으며, Hugging Face에는 비상용 버전이 있습니다. 구현 시 쿼리나 문서 중 어느 쪽을 임베딩하는지 지정하세요 — 모델은 비대칭 인코딩을 사용합니다. 적절한 인덱싱 없이 극도로 큰 문서 컬렉션을 실시간으로 처리하도록 설계되지 않았으므로, ANN 검색에는 FAISS, Qdrant 또는 Weaviate를 사용하세요. 도메인 특화 작업에는 코퍼스에 대한 정밀조정을 고려하세요. 더 높은 차원의 출력이 필요한 단일 벡터 검색에는 jina-embeddings-v4(멀티 벡터 모드) 또는 jina-embeddings-v5-text-small를 고려하세요.









