Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
Embeddings
copyright CC BY-NC 4.0
open_in_new 릴리스 포스트

jina-embeddings-v5-omni-small

텍스트, 이미지, 오디오, 비디오 및 PDF를 위한 멀티모달 벡터입니다.
라이선스
copyright CC-BY-NC-4.0
출시일
calendar_month
2026-05-07
입력
abc
텍스트
image
이미지
audiotrack
오디오
videocam
동영상
picture_as_pdf
PDF
arrow_forward
출력
more_horiz
벡터
Matryoshka 차원 help_outline
32
64
128
256
512
768
1024
모델 세부정보
매개변수: 1.7B
입력 토큰 길이: 32K
출력 크기: 1024
기본 모델 help_outline
link
jina-embeddings-v5-text-small
open_in_new
SigLIP2 Large
open_in_new
Whisper-large-v3
훈련된 언어 help_outline
32 언어
지원되는 언어 help_outline
93 언어
양자화 help_outline
GGUF
Apple Silicon 지원 help_outline
MLX
관련 모델
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
지원되는 작업
search 검색
compare_arrows 텍스트 일치
bubble_chart 클러스터링
label 분류
다음을 통해 이용 가능
Elastic Inference Service
Jina API
AWS SageMaker
Hugging Face
망분리
I/O 다이어그램 1

텍스트

jina-embeddings-v5-omni-small

이미지

작업

벡터

I/O 다이어그램 2

텍스트

jina-embeddings-v5-omni-small

오디오

작업

벡터

I/O 다이어그램 3

텍스트

jina-embeddings-v5-omni-small

동영상

작업

벡터

I/O 다이어그램 4

다중

벡터

텍스트

jina-embeddings-v5-omni-small

PDF

작업

파레토 프론트help_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…파라미터 수(로그)score
이 모델
프론트에 있음
Jina AI
기타
MAEB
49.96
매개변수
1.6B
점수 순위
5 / 21
파레토 프론트
프론트에
값 분포help_outline
AUC 0.8269
코퍼스
번역 쌍
문서 검색
코드
이미지 / 배너
이미지 / 로고
작업
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
관련10.9%
하드 네거티브2.1%
무관0.9%
권장 컷오프
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
균형 · 0.697
AUC
0.8269
노이즈 상한
0.855
재현율 절벽
0.566
측정 쌍 수
119 / 11k
이 모델은 jina-embeddings-v5-text-small과 텍스트 타워를 공유합니다. 여기 표시된 분포는 해당 모델의 것이며, fp16 전송 정밀도 수준에서 일치합니다.
벡터 성분help_outline
-0.160.010.18
σ 0.0313 · 244k 개 값
임베딩 기하 구조help_outline
01024
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.300
유효 차원
70 / 1024
차원 절단help_outline
32641282565121024
text-matching · 요청 차원 수에 따른 컷오프
언어 쌍help_outline
de-ruen-deen-koen-zhja-ko
쌍 간 컷오프 편차: 0.024
비교할 모델을 선택하세요
논문 (1)
SIGIR 2026
5월 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

개요

jina-embeddings-v5-omni-small는 약 1.74B 파라미터의 멀티모달 임베딩 모델로, 텍스트, 이미지, 영상, 오디오, PDF를 받아들여 공유 1024차원 벡터 공간에서 임베딩을 생성합니다. Jina API의 기본 임베딩 모델이며, Jina의 멀티모달 임베딩 모델 중 최고의 정확도-효율 트레이드오프를 제공합니다. 텍스트 전용 출력은 jina-embeddings-v5-text-small과 비트 동일하여, 재인덱싱 없이 텍스트 전용에서 멀티모달로의 매끄러운 이관을 가능하게 합니다.

방법

모델은 jina-embeddings-v5-text-small을 확장하는 세 번째 단계에서 학습됩니다. 멀티모달 학습 중 Qwen3-0.6B-Base 텍스트 백본과 네 개의 태스크별 LoRA 어댑터 모두 동결되며, 새롭게 학습되는 것은 크로스모달 프로젝터만입니다. SigLIP2 Large 비전 인코더가 이미지와 영상을 처리하고(영상당 32프레임 균일 샘플링), Whisper-large-v3 오디오 인코더가 오디오 입력을 처리합니다. PDF 페이지는 이미지로 렌더링되어 시각 경로를 통해 처리됩니다. 학습은 크로스모달 하드 네거티브를 사용한 대비 손실을 사용해, 시각·오디오 표현을 기존 텍스트 임베딩 공간으로 정렬합니다. 1024차원 출력은 32차원까지 Matryoshka 절단을 지원합니다. 32K 토큰 컨텍스트 윈도우가 텍스트 입력을 커버합니다. 모델은 Apple Silicon을 위한 양자화 및 MLX 추론을 지원합니다.

성능

텍스트 전용 성능은 jina-embeddings-v5-text-small(MMTEB 태스크 레벨 평균 67.0, 영어 MTEB 71.7)과 비트 동일합니다 — 멀티모달 학습 중 텍스트 백본과 LoRA 어댑터에는 손을 대지 않습니다. 크로스모달 검색에서, 모델은 텍스트-이미지, 텍스트-오디오, 텍스트-영상 태스크 전반에 강한 정렬을 보여줍니다. PDF 페이지 검색은 시각 경로를 통해 처리됩니다. omni-small 모델은 서버 배포를 위해 Jina 멀티모달 임베딩 모델 중 최고의 정확도-효율 트레이드오프를 제공하며, 1024차원 임베딩은 768차원 omni-nano 변형보다 높은 판별력을 제공합니다.

모범 사례

적절한 LoRA 어댑터를 선택하세요: retrieval, text-matching, clustering 또는 classification. API를 통한 멀티모달 입력의 경우, 이미지 URL, 오디오 파일 URL, 영상 파일 URL, 또는 PDF URL을 직접 전달하세요 — 모델은 각 모달리티를 적절한 인코더로 라우팅합니다. 지원되는 오디오 형식에는 WAV, MP3, FLAC, OGG, M4A, Opus가 포함됩니다. 영상 입력은 32프레임 균일 샘플링으로 처리됩니다. 단일 배치 내에서 모달리티를 자유롭게 혼합할 수 있습니다: 임베딩 공간은 모든 모달리티 간에 공유됩니다. 비교에는 코사인 유사도를 사용하세요. 1024에서 32차원으로의 Matryoshka 절단은 지원됩니다. 텍스트 전용 임베딩은 jina-embeddings-v5-text-small과 드롭인 호환됩니다 — 업그레이드 시 재인덱싱이 필요 없습니다. GPU가 없는 엣지 배포에는 대신 jina-embeddings-v5-omni-nano를 사용하세요.

이 모델을 언급하는 블로그
5월 12, 2026 • 7 분 소요
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트와 모든 관련 콘텐츠, 소프트웨어, 제품 및 서비스는 전문 목적 사용을 위한 것입니다. 소비자 사용은 의도되지 않았습니다.