Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
Elastic Inference Service
Jina 모델을 Elasticsearch에서 네이티브 방식으로 실행하세요.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
아키텍처
시작하기
학습
결론
star
추천
보도 자료
5월 12, 2026

jina-embeddings-v5-omni: 텍스트, 이미지, 오디오 및 비디오를 위한 벡터 모델(Embeddings)

하나의 모델, 네 가지 모달리티: 텍스트, 이미지, 오디오, 비디오. 1.6B 및 0.9B 크기의 동급 최강 옴니 向量模型(Embeddings).
Han Xiao
Han Xiao • 7 분 소요
jina-embeddings-v5-omni - a jinaai Collection
jina-embeddings-v5-text-* 와 정렬된 멀티모달(텍스트 + 이미지 + 비디오 + 오디오) 向量模型. 두 가지 크기, 각각 네 가지 작업 변형 제공.
a jinaai Collection
jina-embeddings-v5-omni: Text-Geometry-Preserving Multimodal Embeddings via Frozen-Tower Composition
본 연구에서는 멀티모달 向量模型에 대한 새로운 접근 방식인 frozen-encoder 모델 구성을 소개합니다. 우리는 비텍스트 인코더가 대규모 언어 모델(LLM)을 위한 입력을 생성하도록 조정되고, 이 모델이 모든 종류의 입력에 대한 임베딩을 생성하는 VLM 스타일의 아키텍처를 기반으로 합니다. 그 결과물로 텍스트, 이미지, 오디오, 비디오 입력을 단일 의미론적 임베딩 공간으로 인코딩하는 모델 쌍인 jina-embeddings-v5-omni 제품군을 제시합니다. 우리의 방법은 기존의 두 Jina Embeddings v5 Text 모델을 확장하여 이미지와 오디오를 위한 인코더를 추가함으로써 추가적인 미디어를 지원하는 것입니다. 백본 텍스트 向量模型과 추가된 비텍스트 미디어 인코더는 frozen 상태로 유지됩니다. 우리는 결합된 모델의 전체 가중치 중 0.35%에 해당하는 연결 구성 요소만 학습시켰습니다. 따라서 학습은 전체 매개변수 재학습보다 훨씬 효율적입니다. 또한, 언어 모델은 사실상 변경되지 않은 상태로 유지되어, 텍스트 입력에 대해 Jina Embeddings v5 Text 모델과 완전히 동일한 임베딩을 생성합니다. 평가 결과, 이 접근 방식은 더 큰 규모의 멀티모달 向量模型과 거의 대등한 성능을 보이며 최신 기술(SOTA) 수준의 결과를 산출함을 보여줍니다.
arXiv.orgFlorian Hönicke

우리는 v5-text 向量模型을 이미지, 오디오, 비디오까지 확장한 jina-embeddings-v5-omni를 출시합니다. 두 모델 모두 v5-text와 동일한 frozen 텍스트 백본을 공유하므로 텍스트 임베딩 결과가 완벽하게 동일하며, 따라서 인덱스를 재구축할 필요가 없습니다. jina-embeddings-v5-omni-small은 4개 모달리티 평균 점수에서 53.93점을 기록하여, 5.7배 더 적은 매개변수로 LCO-7B(54.43점)와 대등한 성능을 보입니다. 또한 jina-embeddings-v5-omni-nano는 단 0.95B의 매개변수로 경쟁력 있는 문서 검색 성능을 제공합니다.

Pareto frontier
모든 오픈 가중치 옴니 向量模型(텍스트, 이미지, 오디오, 비디오 지원)의 파레토 프론티어. jina-embeddings-v5-omni-small(1.57B)은 5.7배 적은 매개변수를 사용하면서도 LCO-7B(8.93B)의 평균 점수와 대등합니다. jina-embeddings-v5-omni-nano(0.95B)은 LanguageBind(1.14B)보다 8.9점 더 높은 성능을 보입니다. 기준 모델: LanguageBind, Omni-Embed-Nemotron-3B, LCO-Embedding-Omni-3B, LCO-Embedding-Omni-7B.
Per-modality scores
텍스트(MMTEB), 이미지(MIEB), 비디오(MMEB-Video), 오디오(MAEB)별 모달리티 상세 점수. jina-embeddings-v5-omni-small은 텍스트 부문에서 67.0점으로 모든 옴니 모델 중 선두를 달리며, jina-embeddings-v5-text-small의 전체 품질을 그대로 계승합니다. 이미지 부문(56.05)에서는 분류(68.55) 및 클러스터링(84.57, 전체 모델 중 최고) 작업에서 뛰어난 성능을 보입니다. 오디오(51.46)는 LCO-7B(52.37)에 근접하며, 최고의 오디오 분류 점수(55.89)를 달성했습니다. 비디오(41.20)는 LCO-7B(47.41)와의 격차가 존재하는데, 이는 시계열적 추론이 엔드 투 엔드 학습에 더 큰 영향을 받기 때문입니다.
Task breakdown
13가지 작업 유형에 대한 성능 분석. 금색 별은 jina-embeddings-v5-omni-small이 최고의 오픈 가중치 기준 모델(3-9배 더 큼)보다 우수한 작업을 표시합니다. 주요 성과: 이미지 분류(68.55 vs 64.30), 이미지 클러스터링(84.57 vs 83.24), 오디오 분류(55.89 vs 53.39). 주요 격차: 비디오 검색(27.82 vs 58.73) 및 구성적/VQA(44.23 vs 53.40).
Document retrieval
문서 검색(ViDoRe-in-MIEB). 0.92B 활성 텍스트+이미지 매개변수를 가진 jina-embeddings-v5-omni-small은 79.08점을 기록하여 LCO-3B(4.07B 매개변수로 78.24점)를 능가합니다. jina-embeddings-v5-omni-nano는 단 0.31B의 활성 매개변수로 70.05점을 기록하여 LanguageBind(37.33점)보다 훨씬 뛰어난 성능을 보입니다. Nemotron-3B가 85.64점으로 선두를 달리고 있으나, 5.1배 더 많은 매개변수를 사용합니다.

tag아키텍처

v5-omni는 v5-text 백본을 완전히 frozen 상태로 유지하며, 작은 학습 가능 투영기(projectors)를 통해 연결된 사전 학습된 비전 및 오디오 인코더를 추가합니다.

  • 비전: 2x2 공간 병합(4x 词元 축소)을 포함한 Qwen3.5 비전 인코더(SigLIP2 기반). 텍스트 백본의 은닉 차원으로 매핑되는 무작위 초기화 레이어로 대체된 최종 투영 레이어(fc_vision_2)를 제외한 모든 부분을 고정합니다.
  • 오디오: Qwen2.5-Omni 인코더(Whisper-large-v3 기반). 단일 무작위 초기화 fc_audio 레이어가 1280차원 출력을 텍스트 백본으로 투영합니다.
  • 비디오: 시각적 프레임의 시퀀스로 처리되며, 선택적으로 추출된 오디오 세그먼트가 앞에 붙습니다.

모델은 v5-text의 4가지 작업별 LoRA 어댑터(검색, 텍스트 매칭, 분류, 클러스터링)를 상속받으며, 각 작업 변형에 대해 별도의 투영기 가중치를 학습합니다. 이 아키텍처는 완전히 모듈화되어 있습니다. 텍스트 전용 배포 시 비전이나 오디오 가중치를 로드하지 않으며(v5-text와 동일한 점유 공간), 이미지 전용일 경우 오디오를 건너뛰고, 전체 옴니 모드에서는 모든 것을 로드합니다.

Architecture
v5-omni 아키텍처. 고정된 비전 및 오디오 인코더가 학습 가능한 투영기를 통해 고정된 텍스트 백본으로 입력값을 전달합니다. 투영기(전체 가중치의 0.35%)만 학습됩니다. 작업별 LoRA 어댑터가 검색, 분류, 클러스터링, 텍스트 매칭을 처리합니다.
기능jina-embeddings-v5-omni-smalljina-embeddings-v5-omni-nano
기본 텍스트 모델jina-embeddings-v5-text-small (Qwen3-0.6B)jina-embeddings-v5-text-nano (EuroBERT-210m)
총 매개변수~1.56B~1.04B
모달리티텍스트, 이미지, 오디오, 비디오, PDF텍스트, 이미지, 오디오, 비디오, PDF
임베딩 차원1024768
Matryoshka 차원32, 64, 128, 256, 512, 768, 102432, 64, 128, 256, 512, 768
최대 시퀀스 길이32768 词元8192 词元
비전 인코더Qwen3.5-2B ViT (SigLIP2)SigLIP2 Base
오디오 인코더Whisper-large-v3Whisper-large-v3
작업검색, 텍스트 매칭, 분류, 클러스터링검색, 텍스트 매칭, 분류, 클러스터링
텍스트 호환성jina-embeddings-v5-text-small와 동일jina-embeddings-v5-text-nano와 동일
jina-embeddings-v5-text-nano 학습 가능한 파라미터~18M 프로젝터 (0.35%)~7M 프로젝터 (0.35%) 풀링(Pooling)마지막 词元 (Last-token)마지막 词元 (Last-token) 라이선스CC BY-NC 4.0CC BY-NC 4.0

tag시작하기

tagElasticsearch (Elastic Inference Service)

이미 Elasticsearch에서 jina-embeddings-v5-text를 사용 중이라면, 기존 텍스트 인덱스를 v5-omni에서 바로 사용할 수 있습니다. Omni 모델은 v5-text와 동일한 텍스트 입력에 대해 동일한 向量模型(벡터)을 생성하며, 바이트 단위까지 일치합니다. 텍스트 인덱스를 다시 임베딩하거나 재구축할 필요가 없습니다. 기존 텍스트 데이터와 함께 이미지, 오디오, 비디오 검색을 시작하려면 v5-omni를 사용하여 새 인덱스를 만들고 멀티모달 콘텐츠를 추가하기만 하면 됩니다.

v5-omni를 추론 엔드포인트로 설정하여 semantic_text 인덱스를 생성합니다. EIS는 인덱싱 및 검색을 위해 올바른 LoRA 어댑터를 자동으로 선택합니다:

PUT multimodal-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-omni-small"
      }
    }
  }
}

텍스트, 이미지(base64 데이터 URI), 오디오, 비디오를 같은 필드, 같은 인덱스에 넣습니다:

// 텍스트 추가
POST multimodal-semantic-index/_doc
{
  "content": "'Kraft Dinner' is what Canadians call macaroni and cheese when prepared from a kit."
}

// 이미지 추가 (base64)
POST multimodal-semantic-index/_doc
{
  "content": "data:image/png;base64,iVBORw0KGgoAAAAN..."
}

단일 텍스트 쿼리로 모든 모달리티를 검색합니다:

GET multimodal-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "Was bedeutet 'Kraft Dinner' für Kanadier?"
    }
  }
}

tagJina Embedding API

curl https://api.jina.ai/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "jina-embeddings-v5-omni-small",
    "task": "retrieval.query",
    "dimensions": 1024,
    "input": ["What does this image show?"],
    "images": ["data:image/png;base64,..."]
  }'

tagHugging Face

from sentence_transformers import SentenceTransformer
import torch

model = SentenceTransformer(
    "jinaai/jina-embeddings-v5-omni-small-retrieval",
    model_kwargs={"dtype": torch.bfloat16},
)

# 텍스트 向量模型(임베딩) (v5-text와 동일)
text_emb = model.encode("What is knowledge distillation?", prompt_name="query")

# 이미지 向量模型(임베딩)
from PIL import Image
img = Image.open("photo.jpg")
img_emb = model.encode(img)

# 교차 모달 유사도
similarity = model.similarity(text_emb, img_emb)

tag학습

핵심 아이디어는 동결된 인코더 모델 구성(frozen-encoder model composition)입니다. 강력한 텍스트 向量模型(임베딩) 모델을 가져와 사전 학습된 비전 및 오디오 인코더를 추가하고, 이를 작은 학습 가능한 프로젝터로 연결한 뒤 프로젝터를 제외한 나머지를 모두 동결합니다. 전체 가중치의 0.35%만 학습함으로써 세 가지 이점을 얻습니다. (1) 텍스트 정체성 유지 - 백본이 수정되지 않아 동일한 입력이 동일한 출력을 생성함; (2) 학습 효율성 - 프로젝터만 학습하므로 1.8~3.9배 빠르고 GPU 메모리 사용량이 42~64% 감소함; (3) 모듈성 - 타워를 독립적으로 로드할 수 있음.

Training efficiency
4x H100 GPU에서의 프로젝터 전용 학습 vs 전체 학습 비교 (배치 크기 256, 15K 스텝). 오디오 프로젝터 학습이 특히 효율적임: small 모델은 3.2배 빠르고(154분 vs 497분), nano 모델은 3.9배 빠름(112분 vs 441분). 42~64%의 메모리 절감은 동결된 인코더의 그래디언트와 옵티마이저 상태를 저장하지 않음으로써 발생함.

v5-omni는 v5-text의 Matryoshka 차원 지원을 상속합니다. 이미지와 오디오 向量模型(임베딩)은 차원 축소 시 대부분의 품질을 유지하지만, 비디오는 작은 차원에서 성능 저하가 더 큽니다.

Radar summary
요약: v5-omni와 강력한 기준 모델들의 모달리티별 프로필. jina-embeddings-v5-omni-small(1.57B)은 텍스트, 이미지, 오디오를 경쟁력 있게 커버하며, 비디오 부문이 향후 해결해야 할 격차로 남아 있음.

tag결론

멀티모달 向量模型(임베딩)을 위해서는 전체 모델을 처음부터 끝까지 학습시켜야 한다는 것이 통념이었습니다. 우리는 이에 동의하지 않습니다. v5-omni는 텍스트 백본을 동결하고 가중치의 0.35%만 학습하여, 자신보다 5~7배 큰 모델들과 대등한 성능을 냅니다. 교훈은 다음과 같습니다. 재학습보다 구성(Composition)이 낫습니다. 강력한 텍스트 인코더를 만드는 것이 가장 어렵지만, 일단 그것을 갖추면 가벼운 프로젝터를 통해 비전과 오디오를 연결하는 것은 거의 비용이 들지 않습니다.

이는 프로덕션 환경에서 중요합니다. 기존 v5-text 인덱스는 그대로 유지됩니다. 동일한 쿼리, 동일한 向量模型(벡터), 바이트 단위로 일치합니다. 문서를 재임베딩할 필요 없이 이미지, 오디오, 비디오 검색 기능을 바로 얻을 수 있습니다. 이것이 바로 마이그레이션 프로젝트가 아닌, 드롭인(drop-in) 업그레이드로서의 진정한 멀티모달 검색 혁신입니다.

jina-embeddings-v5-omni-small은 2B 파라미터 미만에서 가장 뛰어난 성능을 보이는 오픈 가중치 Omni 向量模型(임베딩) 모델입니다. jina-embeddings-v5-omni-nano는 0.9B 파라미터로 이를 수행합니다. 두 모델 모두 현재 Hugging Face, Jina Search Foundation API에서 사용할 수 있으며, Elasticsearch의 네이티브 추론 엔드포인트로도 이용 가능합니다.

범주:
star
추천
보도 자료
rss_feed

자세히 보기
8월 03, 2026 • 11 분 소요
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
2월 19, 2026 • 7 분 소요
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
12월 04, 2025 • 7 분 소요
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.