개요
jina-reranker-v1-turbo-en는 37.8M 파라미터의 영어 크로스 엔코더 리랭커로, 기본 모델 정확도의 95%를 제공하는 동시에 문서를 3배 빠르게 처리하고 메모리를 75% 적게 사용합니다. 완전한 크로스 엔코더의 품질-레이턴시 트레이드오프가 비현실적이었던 프로덕션 검색 시스템을 위해 설계되어, 대규모 검색 개선의 실용적 경로를 제공합니다.
방법
모델은 기본 리랭커의 12개 레이어 BERT 아키텍처를 37.8M 파라미터(기본은 137M)의 6개 레이어 설계로 압축합니다. 쿼리와 문서 간 토큰 수준 상호작용의 핵심인 BERT 기반 크로스 어텐션 메커니즘을 유지하면서, 레이어 수 축소와 효율적 파라미터 할당으로 속도를 최적화합니다. 학습은 지식 증류를 사용합니다: 더 큰 기본 모델이 교사로 작용하여 turbo 변종이 적은 파라미터로 그 랭킹 동작과 일치하도록 이끕니다. 모델은 ALiBi 위치 인코딩을 통해 최대 8,192토큰 시퀀스를 지원하며, 빠른 추론을 유지하면서 종합적인 문서 분석을 가능하게 합니다.
성능
BEIR에서 turbo 변종은 NDCG@10 49.60을 달성하며, 기본 모델 성능(52.45)의 95%를 유지하는 동시에 bge-reranker-base(47.89, 278M 파라미터)를 능가합니다. RAG 애플리케이션에서는 83.51% 히트 레이트와 0.6498 MRR를 유지합니다. 속도 우위는 상당합니다: 기본 모델의 3배 빠르고, 처리량은 파라미터 수 감소에 거의 선형적으로 확장됩니다. 메모리 요구량은 기본의 550MB에서 turbo의 150MB로 떨어져, 더 작은 인스턴스 배포와 클라우드 환경의 상당한 비용 절감을 가능하게 합니다. 대부분의 작업에서 성능 저하는 최소이며, 뉘앙스가 극도로 중요한 랭킹 시나리오에서는 약간 낮은 점수를 기록합니다.
모범 사례
2단계 파이프라인을 구현하세요: 벡터 검색이 초기 후보를 제공하고, 이 모델이 상위 100–200개를 재랭킹합니다. 대부분의 애플리케이션에서 최적의 지점은 쿼리당 100–200개 후보를 재랭킹하는 것으로, 품질과 속도를 균형 잡습니다. 모델은 영어 전용; 다국어 애플리케이션에는 jina-reranker-v2-base-multilingual 또는 jina-reranker-v3.5를 사용하세요. CUDA 지원 하드웨어가 필요하지만 기본 모델보다 작은 인스턴스에서 동작합니다(GPU 메모리 150MB 대 550MB). Jina Reranker API와 AWS SageMaker에서 사용 가능합니다. 새 프로젝트에는 jina-reranker-v3.5(다국어, 리스트와이즈, 131K 컨텍스트)가 권장 선택입니다. 레이턴시가 주된 제약인 경우, 이 모델의 3배 빠른 속도가 실시간 검색 애플리케이션에 적합합니다.





