I/O 다이어그램 1
I/O 다이어그램 2
I/O 다이어그램 3
I/O 다이어그램 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
값 분포help_outlineAUC 0.8269
코퍼스
번역 쌍
문서 검색
코드
이미지 / 배너
이미지 / 로고
태스크
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
관련10.9%
하드 네거티브2.1%
무관0.9%
권장 컷오프
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
균형 · 0.697
AUC
0.8269
노이즈 상한
0.855
재현율 절벽
0.566
측정 쌍 수
119 / 11k
이 모델은 jina-embeddings-v5-text-small과 텍스트 타워를 공유합니다. 여기 표시된 분포는 해당 모델의 것이며, fp16 전송 정밀도 수준에서 일치합니다.
벡터 성분help_outline
σ 0.0313 · 244k 개 값
임베딩 기하 구조help_outline
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.300
유효 차원
70 / 1024
차원 절단help_outline
text-matching · 요청 차원 수에 따른 컷오프
언어 쌍help_outline
쌍 간 컷오프 편차: 0.024
비교할 모델을 선택하세요
논문 (1)
개요
jina-embeddings-v5-omni-small(약 17억 4천만 파라미터)은 텍스트, 이미지, 비디오, 오디오를 입력받아 jina-embeddings-v5-text-small과 정렬된 공유 벡터 공간에 임베딩을 생성하는 멀티모달 임베딩 모델입니다. 텍스트로 인덱싱하고 임의의 모달리티로 쿼리하거나 그 반대로도, 재인덱싱 없이 수행할 수 있습니다. 멀티모달 학습 과정에서 텍스트 백본과 네 가지 작업별 LoRA 어댑터(검색, 텍스트 매칭, 클러스터링, 분류)는 모두 고정되므로, 텍스트 전용 출력은 jina-embeddings-v5-text-small과 비트 단위로 동일합니다. 이 모델은 1024차원 임베딩을 생성하며 Matryoshka 절단으로 32차원까지 축소할 수 있고, 32K 토큰의 컨텍스트 길이를 지원합니다.
방법
jina-embeddings-v5-text-small을 확장하는 세 번째 단계에서 학습됩니다. 텍스트 백본과 네 가지 작업별 LoRA 어댑터는 모두 고정되며, 크로스 모달 프로젝터만 새로 학습됩니다. SigLIP2 So400m 비전 인코더가 이미지와 비디오(균일하게 샘플링된 32개 프레임)를 처리하고, Whisper-large-v3 오디오 인코더가 오디오 입력을 처리합니다. PDF 페이지는 이미지로 렌더링되어 비전 경로를 통해 처리됩니다. 학습에는 기존 텍스트 임베딩 공간에 시각 및 오디오 표현을 정렬하기 위해 크로스 모달 하드 네거티브를 사용하는 대조 손실을 적용합니다.
성능
텍스트 전용 성능은 jina-embeddings-v5-text-small과 비트 단위로 동일합니다. 멀티모달 학습 과정에서 텍스트 백본과 LoRA 어댑터는 전혀 변경되지 않기 때문입니다. 크로스 모달 검색에서 이 모델은 텍스트-이미지, 텍스트-오디오, 텍스트-비디오 작업 전반에 걸쳐 강력한 정렬을 보여줍니다. PDF 페이지 검색은 비전 경로를 통해 처리됩니다. omni-small 모델은 서버 배포용 Jina 멀티모달 임베딩 모델 중 정확도와 효율성의 균형이 가장 뛰어납니다.
모범 사례
이 모델은 v5-text-small과 동일한 4개의 LoRA 어댑터(retrieval, text-matching, clustering, classification)를 사용합니다. API를 통해 전달되는 멀티모달 입력의 경우, 이미지 URL, 오디오 파일 URL, 비디오 파일 URL 또는 PDF URL을 직접 전달할 수 있으며, 모델은 각 모달리티에 맞는 인코더로 데이터를 라우팅합니다. 지원되는 오디오 형식은 WAV, MP3, FLAC, OGG, M4A, Opus입니다. 비디오 입력은 균일하게 샘플링된 32개 프레임으로 처리됩니다. 다양한 모달리티를 하나의 배치에 자유롭게 혼합하여 사용할 수 있으며, 임베딩 공간은 모든 모달리티에서 공유됩니다. 비교에는 코사인 유사도를 사용하십시오. 1024차원에서 32차원으로의 마트료시카 절단이 지원됩니다. 텍스트 전용 임베딩은 jina-embeddings-v5-text-small과 완전히 호환되므로 업그레이드 시 재인덱싱이 필요하지 않습니다.
이 모델을 언급하는 블로그



