개요
jina-reranker-v1-tiny-en는 33M 파라미터의 영어 크로스 엔코더 리랭커 — Jina v1 계열에서 가장 작습니다. 공격적인 지식 증류를 통해 기본 모델 정확도의 92.5%를 유지하면서 문서를 5배 빠르게 처리하고, turbo 변종보다 메모리를 13% 적게 사용합니다. 엄격한 레이턴시 예산을 가진 엣지 컴퓨팅, 모바일 애플리케이션, 고처리량 검색 시스템을 위해 설계되었습니다.
방법
모델은 대칭 양방향 ALiBi 위치 인코딩을 가진 JinaBERT 기반의 간소화된 4개 레이어 아키텍처를 사용합니다. 그 개발은 137M 파라미터의 jina-reranker-v1-base-en에서 지식 증류를 활용하며, 이는 교사 모델로 작용합니다. 학생 모델은 방대한 실제 세계 학습 데이터 없이 최적의 랭킹 동작을 학습하며, 33M 파라미터만으로 교사의 소프트 랭킹 분포에 근접합니다. 4개 레이어 설계와 감소된 은닉 차원은 기본 모델 대비 5배 가속화를 가능하게 합니다. 모델은 긴 문서를 위한 자동 청킹과 함께 1,024토큰 컨텍스트를 지원합니다.
성능
BEIR에서 모델은 NDCG@10 48.54를 달성하며, 기본 모델 성능(52.45)의 92.5%를 유지하면서 그 크기의 4분의 1에 불과합니다. LlamaIndex RAG 벤치마크에서 83.16% 히트 레이트를 유지하며, 문서를 훨씬 빠르게 처리하면서 더 큰 모델에 거의 근접합니다. 처리량은 기본 모델보다 거의 5배 빠르고, turbo 변종보다 메모리 사용이 13% 적습니다. 이 지표들은 mxbai-rerank-base-v1(184M)과 bge-reranker-base(278M) 같은 훨씬 큰 모델과 맞먹거나 초과합니다. 성능-크기 트레이드오프는 리소스 제한 배포에 특히 적합하게 만듭니다.
모범 사례
처리 속도와 리소스 효율성이 결정적인 시나리오를 우선하세요: 엣지 컴퓨팅, 모바일 애플리케이션, 엄격한 레이턴시 예산을 가진 고처리량 검색 시스템. 절대적 최대 랭킹 정밀도를 요구하는 애플리케이션에는 기본 모델 또는 jina-reranker-v3.5가 바람직합니다. 모델은 최적의 성능을 위해 CUDA 지원 GPU가 필요하지만, 더 큰 대응 모델보다 낮은 하드웨어에서 실행됩니다. 주요 벡터 데이터베이스 및 RAG 프레임워크와 통합되며, Jina Reranker API와 AWS SageMaker에서 사용할 수 있습니다. 모델은 영어 전용; 다국어 애플리케이션에는 jina-reranker-v2-base-multilingual 또는 jina-reranker-v3.5를 사용하세요. 특정 도메인에 대한 파인튜닝 시, 성능 특성을 유지하기 위해 학습 데이터 품질과 모델의 컴팩트한 아키텍처를 신중하게 균형 잡으세요.





