I/O 다이어그램
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
값 분포help_outlineAUC 0.8383
코퍼스
번역 쌍
문서 검색
관련17.6%
하드 네거티브3.0%
무관0.8%
권장 컷오프
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
균형 · 0.365
AUC
0.8383
노이즈 상한
0.774
재현율 절벽
0.163
측정 쌍 수
119 / 11k
벡터 성분help_outline
σ 0.0361 · 183k 개 값
임베딩 기하 구조help_outline
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.326
유효 차원
51 / 768
언어 쌍help_outline
쌍 간 컷오프 편차: 0.315
비교할 모델을 선택하세요
논문 (1)
개요
Jina Embeddings v2 Base Spanish는 스페인어와 영어 콘텐츠 간의 언어 간 정보 검색 및 분석이라는 중요한 문제를 해결하는 획기적인 이중 언어 텍스트 임베딩 모델입니다. 특정 언어에 편향되는 경우가 많은 기존의 다국어 모델과 달리 이 모델은 스페인어와 영어 모두에서 진정으로 균형 잡힌 성능을 제공합니다. 이는 스페인어 사용 시장에서 활동하거나 이중 언어 콘텐츠를 다루는 조직에 필수적입니다. 이 모델의 가장 눈에 띄는 특징은 기하학적으로 정렬된 임베딩을 생성하는 능력입니다. 스페인어와 영어 텍스트가 동일한 의미를 표현하는 경우 해당 벡터 표현이 임베딩 공간에서 자연스럽게 함께 군집을 이루어 원활한 언어 간 검색 및 분석이 가능합니다.
방법
모델의 중심에는 전통적인 위치 벡터 없이도 최대 8,192개의 토큰 시퀀스를 처리할 수 있는 정교한 접근 방식인 대칭 양방향 ALiBi(Attention with Linear Bias)를 기반으로 하는 혁신적인 아키텍처가 있습니다. 이 모델은 GLU(Gated Linear Unit)와 특수 레이어 정규화 기술을 결합하여 161M 매개변수를 갖춘 수정된 BERT 아키텍처를 사용합니다. 훈련은 3단계 프로세스를 따릅니다. 먼저 대규모 텍스트 코퍼스에 대한 사전 훈련, 신중하게 선택한 텍스트 쌍을 사용하여 미세 조정, 마지막으로 유사하지만 의미상 다른 콘텐츠의 차별성을 강화하기 위한 하드 네거티브 훈련입니다. 768차원 벡터와 결합된 이 접근 방식을 통해 모델은 계산 효율성을 유지하면서 미묘한 의미 관계를 포착할 수 있습니다.
성능
포괄적인 벤치마크 평가에서 이 모델은 크기가 15~30%에 불과함에도 불구하고 E5 및 BGE-M3와 같은 최신 대규모 다국어 모델을 능가하는 뛰어난 기능을 보여주었습니다. 이 모델은 검색 및 클러스터링 작업에서 잘 수행되며 언어 전체에서 의미상 동일한 콘텐츠를 일치시키는 데 탁월합니다. MTEB 벤치마크에서는 분류, 클러스터링, 의미 유사성 등 다양한 작업에서 좋은 성능을 발휘합니다. 8,192개 토큰의 확장된 컨텍스트 창은 긴 문서 처리에 특히 유용하며, 문서가 여러 페이지에 걸쳐 있는 경우에도 일관된 성능을 제공합니다. 이는 대부분의 경쟁 모델에는 부족한 기능입니다.
모범 사례
이 모델을 효과적으로 활용하려면 조직은 최적의 성능을 위해 CUDA 지원 GPU 인프라에 액세스할 수 있는지 확인해야 합니다. 이 모델은 MongoDB, Qdrant, Weaviate, Haystack을 포함한 주요 벡터 데이터베이스 및 RAG 프레임워크와 원활하게 통합되므로 프로덕션 환경에 쉽게 배포할 수 있습니다. 이중 언어 문서 검색, 콘텐츠 추천 시스템, 언어 간 문서 분석과 같은 애플리케이션에 탁월합니다. 이 모델은 잘 작동하지만 특히 스페인어-영어 이중 언어 시나리오에 최적화되어 있으며 단일 언어 애플리케이션이나 다른 언어 쌍이 포함된 시나리오에는 최선의 선택이 아닐 수도 있습니다. 최상의 결과를 얻으려면 입력 텍스트의 형식이 스페인어 또는 영어로 적절하게 지정되어야 하지만 모델은 혼합 언어 콘텐츠를 효과적으로 처리할 수 있습니다. 이 모델은 도메인별 애플리케이션에 대한 미세 조정을 지원하지만 훈련 데이터의 품질과 분포를 신중하게 고려해야 합니다.
이 모델을 언급하는 블로그




