I/O 다이어그램 1
I/O 다이어그램 2
값 분포help_outlineAUC 0.9726
코퍼스
번역 쌍
코드
관련81.0%
하드 네거티브10.3%
무관0.8%
차트에 마우스를 올리거나 클릭하면 컷오프가 이동합니다
권장 컷오프
FPR 0.1 · 17.83
FPR 0.01 · 19.14
FPR 0.001 · 21.08
FPR 0.0001 · 23.67
균형 · 18.66
AUC
0.9726
노이즈 상한
21.05
재현율 절벽
16.22
측정 쌍 수
100 / 9,200
순위별 점수help_outline
각 순위 위치의 평균 점수
비교할 모델을 선택하세요
논문 (1)
개요
Jina-ColBERT-v2는 여러 언어에 걸쳐 효율적인 고품질 검색이라는 주요 과제를 해결하는 획기적인 다국어 정보 검색 모델입니다. 컴팩트한 임베딩을 생성하는 최초의 다국어 ColBERT 계열 모델로서 전 세계 애플리케이션에서 확장 가능하고 비용 효율적인 다국어 검색 솔루션에 대한 증가하는 요구를 해결합니다. 전자 상거래 플랫폼에서 콘텐츠 관리 시스템에 이르기까지 다국어 콘텐츠를 다루는 조직은 이 모델을 활용하여 89개 언어로 정확한 검색 결과를 제공하는 동시에 혁신적인 차원 축소 기능을 통해 스토리지 및 컴퓨팅 비용을 크게 줄일 수 있습니다.
방법
이 모델은 ColBERT 아키텍처를 기반으로 하며, 쿼리와 문서를 매칭하는 방식을 근본적으로 바꾸는 정교한 late interaction 메커니즘을 도입합니다. 핵심적으로 5억 6천만 개의 파라미터를 가진 수정된 XLM-RoBERTa 백본을 사용하며, 회전 위치 임베딩으로 강화하고 FlashAttention으로 최적화했습니다. 학습 과정은 두 가지 주요 단계로 구성됩니다. 다양한 언어의 약지도 데이터를 사용한 초기 사전 학습, 그리고 레이블이 지정된 트리플릿 데이터를 사용한 미세 조정과 지도 증류입니다. 이 접근 방식의 고유한 점은 Matryoshka 표현 학습의 구현입니다. 이를 통해 모델은 단일 학습 과정에서 여러 차원(128, 96 또는 64)의 임베딩을 생성할 수 있으므로 재학습 없이도 동적인 스토리지 최적화가 가능합니다.
성능
실제 테스트에서 Jina-ColBERT-v2는 여러 벤치마크에서 뛰어난 성능을 보여주었습니다. 원래 ColBERT-v2에 비해 영어 작업 성능이 6.5% 향상되어 14개 BEIR 벤치마크에서 평균 점수 0.521을 달성했습니다. 더욱 인상적인 점은 MIRACL 벤치마크에서 테스트된 모든 언어에서 기존 BM25 기반 검색 방법보다 성능이 뛰어나며 언어 간 시나리오에서 특별한 강점을 보여줍니다. 모델은 축소된 벡터 차원을 사용하는 경우에도 이러한 높은 성능을 유지합니다. 128차원에서 64차원으로 줄이면 성능 저하가 1.5%에 불과하고 스토리지 요구 사항도 절반으로 줄어듭니다. 이는 생산 비용의 상당한 절감을 나타냅니다. 예를 들어 64차원 벡터를 사용하여 AWS에 1억 개의 문서를 저장하는 데 드는 비용은 월 659.62달러이며, 128차원 벡터의 경우 1,319.24달러입니다.
모범 사례
Jina-ColBERT-v2를 효과적으로 배포하려면 팀은 몇 가지 실용적인 측면을 고려해야 합니다. 이 모델은 최적의 성능을 위해 CUDA 지원 하드웨어가 필요하며 쿼리를 32개 토큰으로 제한하면서 최대 8,192개 토큰(12,288개까지 확장 가능)의 문서 길이를 지원합니다. 프로덕션 배포의 경우 Jina Search Foundation API, AWS Marketplace 및 Azure를 통해 모델을 사용할 수 있으며, Hugging Face를 통해 비상업용 버전을 사용할 수 있습니다. 모델이 비대칭 인코딩을 사용하므로 구현할 때 팀은 임베딩 대상이 쿼리인지 문서인지 명시해야 합니다. 이 모델은 적절한 인덱싱 없이 매우 큰 문서 모음을 실시간으로 처리하도록 설계되지 않았으며, 다국어 검색에서는 뛰어난 성능을 보이지만 해당 도메인에 맞게 미세 조정된 모델에 비해 특수 도메인 작업에서는 성능이 약간 낮을 수 있습니다.
이 모델을 언급하는 블로그









