I/O 다이어그램
값 분포help_outlineAUC 0.8525
코퍼스
번역 쌍
문서 검색
코드
태스크
default
classification
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
separation
text-matching
관련21.8%
하드 네거티브3.0%
무관1.0%
차트에 마우스를 올리거나 클릭하면 컷오프가 이동합니다
권장 컷오프
FPR 0.1 · 0.618
FPR 0.01 · 0.741
FPR 0.001 · 0.797
FPR 0.0001 · 0.824
균형 · 0.597
AUC
0.8525
노이즈 상한
0.791
재현율 절벽
0.385
측정 쌍 수
119 / 11k
벡터 성분help_outline
σ 0.0312 · 244k 개 값
임베딩 기하 구조help_outline
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.496
유효 차원
54 / 1024
차원 절단help_outline
classification · 요청 차원 수에 따른 컷오프
언어 쌍help_outline
쌍 간 컷오프 편차: 0.072
비교할 모델을 선택하세요
논문 (4)
개요
Jina Embeddings v3는 조직이 언어 간 텍스트 이해 및 검색을 처리하는 방식을 바꾸는 획기적인 다국어 텍스트 임베딩 모델입니다. 본질적으로 이는 컴퓨팅 요구 사항을 관리 가능한 수준으로 유지하면서 여러 언어와 작업 전반에 걸쳐 고성능을 유지해야 하는 주요 과제를 해결합니다. 이 모델은 효율성이 중요한 프로덕션 환경에서 특히 탁월합니다. 단 5억 7천만 개의 매개변수만으로 최첨단 성능을 달성하므로 더 큰 모델의 계산 오버헤드를 감당할 수 없는 팀도 활용할 수 있습니다. 확장 가능한 다국어 검색 시스템을 구축하거나 언어 장벽을 넘어 콘텐츠를 분석해야 하는 조직에 특히 유용합니다.
방법
모델의 아키텍처는 24개 계층의 jina-XLM-RoBERTa를 기반으로 구축되고 작업별 LoRA(낮은 순위 적응형) 어댑터로 향상된 벡터 기술의 주요 혁신을 나타냅니다. LoRA 어댑터는 매개변수 수를 크게 늘리지 않고 검색, 분류 또는 클러스터링과 같은 다양한 작업에 대해 모델을 최적화하는 특수 신경망 구성 요소입니다. 전체 매개변수는 3% 미만으로 증가합니다. 이 모델은 Matryoshka Representation Learning(MRL)을 통합하여 성능을 유지하면서 벡터를 1024차원에서 32차원으로 유연하게 줄일 수 있습니다. 훈련에는 89개 언어의 다국어 텍스트에 대한 초기 사전 훈련, 벡터 품질 개선을 위한 쌍으로 된 텍스트의 미세 조정, 작업 최적화를 위한 특수 어댑터 훈련의 세 단계가 포함됩니다. 이 모델은 RoPE(회전 위치 벡터)를 통해 최대 8,192개의 토큰까지 컨텍스트 길이를 지원하고 혁신적인 기본 주파수 조정 기술을 사용하여 짧은 텍스트와 긴 텍스트 모두의 성능을 향상시킵니다.
성능
이 모델은 실제 테스트에서 뛰어난 효율성 대 성능 비율을 보여주었으며, 영어 작업에서 오픈 소스 대안과 OpenAI 및 Cohere의 독점 솔루션을 모두 능가하는 동시에 다국어 시나리오에서도 좋은 성능을 보였습니다. 가장 놀라운 점은 매개변수가 12배 더 많은 e5-mistral-7b-instruct보다 더 나은 결과를 달성하여 뛰어난 효율성을 보여준다는 것입니다. MTEB 벤치마크 평가에서는 전 태스크 평균 65.52점을 달성했으며, 특히 분류 정확도(82.58)와 문장 유사성(85.80)에서 좋은 성적을 거두었습니다. 이 모델은 언어 전반에 걸쳐 일관된 성능을 유지하며 다국어 작업에서 64.44점을 받았습니다. 차원 축소를 위해 MRL을 사용하면 낮은 차원에서도 강력한 성능이 유지됩니다. 예를 들어 64차원은 전체 1024차원에 비해 92%의 검색 성능을 유지합니다.
모범 사례
Jina Embeddings v3를 효과적으로 배포하려면 각 팀은 특정 사용 사례를 고려하여 적절한 작업 어댑터를 선택해야 합니다. 검색 애플리케이션에는 retrieval.query와 retrieval.passage를, 클러스터링 작업에는 separation을, 분류 작업에는 classification을, 의미적 유사성에는 text-matching을 사용합니다. 이 모델은 최상의 성능을 위해 CUDA 지원 하드웨어가 필요하지만, 효율적인 아키텍처 덕분에 대규모 대안보다 훨씬 적은 GPU 메모리를 사용합니다. 프로덕션 배포 시 AWS SageMaker 통합을 통해 확장성을 간소화할 수 있습니다. 이 모델은 다국어 애플리케이션에서는 우수한 성능을 보이지만, 리소스가 부족한 언어의 경우 추가 평가가 필요할 수 있습니다. 최대 8,192개 토큰의 긴 문서를 지원하지만, 매우 긴 텍스트의 경우 late chunking 기능을 사용할 때 최상의 성능을 얻을 수 있습니다. 실시간 생성이나 복잡한 추론이 필요한 작업에는 이 모델을 사용하지 않는 것이 좋습니다. 이 모델은 임베딩 및 검색을 위해 설계되었으며, 텍스트 생성이나 직접적인 질의응답에는 적합하지 않습니다.
이 모델을 언급하는 블로그














