I/O 다이어그램 1

텍스트

jina-embeddings-v5-omni-nano

이미지

작업

벡터

I/O 다이어그램 2

텍스트

jina-embeddings-v5-omni-nano

오디오

작업

벡터

I/O 다이어그램 3

텍스트

jina-embeddings-v5-omni-nano

동영상

작업

벡터

I/O 다이어그램 4

다중

벡터

텍스트

jina-embeddings-v5-omni-nano

PDF

작업

파레토 프론트
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…파라미터 수(로그)score
이 모델
프론트에 있음
Jina AI
기타
MAEB
49.69
매개변수
986M
점수 순위
6 / 21
파레토 프론트
프론트에
값 분포
AUC 0.8242
코퍼스
번역 쌍
문서 검색
코드
이미지 / 배너
이미지 / 로고
작업
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
관련20.2%
하드 네거티브1.7%
무관1.1%
권장 컷오프
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
균형 · 0.678
AUC
0.8242
노이즈 상한
0.840
재현율 절벽
0.557
측정 쌍 수
119 / 11k
이 모델은 jina-embeddings-v5-text-nano과 텍스트 타워를 공유합니다. 여기 표시된 분포는 해당 모델의 것이며, fp16 전송 정밀도 수준에서 일치합니다.
벡터 성분
-0.180.000.19
σ 0.0361 · 183k 개 값
임베딩 기하 구조
0768
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.288
유효 차원
69 / 768
차원 절단
3264128256512768
text-matching · 요청 차원 수에 따른 컷오프
언어 쌍
de-ruen-deen-koen-zhja-ko
쌍 간 컷오프 편차: 0.027
비교할 모델을 선택하세요
논문 (1)

개요

jina-embeddings-v5-omni-nano는 약 1.04B 파라미터의 멀티모달 임베딩 모델로, 텍스트, 이미지, 영상, 오디오를 받아들여 공유 벡터 공간에서 임베딩을 생성합니다. v5-omni 계보의 컴팩트한 변형으로, GPU가 사용 불가능한 엣지 및 보급형 하드웨어를 위해 설계되었습니다. 텍스트 전용 출력은 jina-embeddings-v5-text-nano와 비트 동일하여, 재인덱싱 없이 텍스트 전용에서 멀티모달로의 드롭인 업그레이드를 가능하게 합니다.

방법

모델은 jina-embeddings-v5-text-nano에 세 번째 학습 단계로 멀티모달 기능을 확장합니다. EuroBERT-210M 텍스트 백본과 네 개의 태스크별 LoRA 어댑터는 동결되며, 새롭게 학습되는 것은 크로스모달 프로젝터만입니다. SigLIP2 Base 비전 인코더가 이미지와 영상을 처리하고(영상당 32프레임 균일 샘플링), Whisper-large-v3 오디오 인코더가 오디오 입력을 처리합니다. PDF 페이지는 이미지로 렌더링되어 시각 경로를 통해 처리됩니다. 학습은 크로스모달 하드 네거티브를 사용한 대비 손실을 사용해, 시각·오디오 표현을 기존 텍스트 임베딩 공간으로 정렬합니다. 768차원 출력 공간은 32차원까지 Matryoshka 절단을 지원합니다. 8K 토큰 컨텍스트 윈도우가 텍스트 입력을 커버하며, 이미지·오디오 입력은 각각의 인코더를 통해 처리됩니다.

성능

텍스트 전용 성능은 jina-embeddings-v5-text-nano(MMTEB 태스크 레벨 평균 65.5, 영어 MTEB 71.0)과 비트 동일합니다. 멀티모달 성능은 임베딩 공간이 768차원(1024 대비)으로 좁고 텍스트 백본이 작아 jina-embeddings-v5-omni-small보다 약간 낮지만, 텍스트-이미지, 텍스트-오디오, 텍스트-영상 검색 전반에 강한 크로스모달 정렬을 유지합니다. 모델은 더 큰 omni-small 모델이 효율적으로 실행되지 않는 CPU 및 엣지 하드웨어를 위해 최적화되었습니다. 크로스모달 검색 품질은 그 크기 등급에서 경쟁력이 있습니다.

모범 사례

jina-embeddings-v5-omni-small와 동일한 사용 패턴입니다: 적절한 LoRA 어댑터(retrieval, text-matching, clustering, classification)를 선택하고 API를 통해 이미지 URL, 오디오 파일 URL, 영상 파일 URL, 또는 PDF URL을 직접 전달하세요 — 모델은 각 모달리티를 적절한 인코더로 라우팅합니다. 지원되는 오디오 형식: WAV, MP3, FLAC, OGG, M4A, Opus. 영상 입력은 32프레임 균일 샘플링으로 처리됩니다. 단일 배치 내에서 모달리티를 자유롭게 혼합할 수 있습니다; 임베딩 공간은 모든 모달리티 간에 공유됩니다. 비교에는 코사인 유사도를 사용하세요. 768에서 32차원으로의 Matryoshka 절단은 지원됩니다. 텍스트 전용 임베딩은 jina-embeddings-v5-text-nano와 드롭인 호환됩니다 — 업그레이드 시 재인덱싱이 필요 없습니다. 더 높은 정확도가 필요한 서버 배포에는 jina-embeddings-v5-omni-small(1024차원, 더 큰 백본)을 사용하세요.

이 모델을 언급하는 블로그