

우리는 v5-text 向量模型을 이미지, 오디오, 비디오까지 확장한 jina-embeddings-v5-omni를 출시합니다. 두 모델 모두 v5-text와 동일한 frozen 텍스트 백본을 공유하므로 텍스트 임베딩 결과가 완벽하게 동일하며, 따라서 인덱스를 재구축할 필요가 없습니다. jina-embeddings-v5-omni-small은 4개 모달리티 평균 점수에서 53.93점을 기록하여, 5.7배 더 적은 매개변수로 LCO-7B(54.43점)와 대등한 성능을 보입니다. 또한 jina-embeddings-v5-omni-nano는 단 0.95B의 매개변수로 경쟁력 있는 문서 검색 성능을 제공합니다.




tag아키텍처
v5-omni는 v5-text 백본을 완전히 frozen 상태로 유지하며, 작은 학습 가능 투영기(projectors)를 통해 연결된 사전 학습된 비전 및 오디오 인코더를 추가합니다.
- 비전: 2x2 공간 병합(4x 词元 축소)을 포함한 Qwen3.5 비전 인코더(SigLIP2 기반). 텍스트 백본의 은닉 차원으로 매핑되는 무작위 초기화 레이어로 대체된 최종 투영 레이어(
fc_vision_2)를 제외한 모든 부분을 고정합니다. - 오디오: Qwen2.5-Omni 인코더(Whisper-large-v3 기반). 단일 무작위 초기화
fc_audio레이어가 1280차원 출력을 텍스트 백본으로 투영합니다. - 비디오: 시각적 프레임의 시퀀스로 처리되며, 선택적으로 추출된 오디오 세그먼트가 앞에 붙습니다.
모델은 v5-text의 4가지 작업별 LoRA 어댑터(검색, 텍스트 매칭, 분류, 클러스터링)를 상속받으며, 각 작업 변형에 대해 별도의 투영기 가중치를 학습합니다. 이 아키텍처는 완전히 모듈화되어 있습니다. 텍스트 전용 배포 시 비전이나 오디오 가중치를 로드하지 않으며(v5-text와 동일한 점유 공간), 이미지 전용일 경우 오디오를 건너뛰고, 전체 옴니 모드에서는 모든 것을 로드합니다.

| 기능 | jina-embeddings-v5-omni-small | jina-embeddings-v5-omni-nano |
|---|---|---|
| 기본 텍스트 모델 | jina-embeddings-v5-text-small (Qwen3-0.6B) | jina-embeddings-v5-text-nano (EuroBERT-210m) |
| 총 매개변수 | ~1.56B | ~1.04B |
| 모달리티 | 텍스트, 이미지, 오디오, 비디오, PDF | 텍스트, 이미지, 오디오, 비디오, PDF |
| 임베딩 차원 | 1024 | 768 |
| Matryoshka 차원 | 32, 64, 128, 256, 512, 768, 1024 | 32, 64, 128, 256, 512, 768 |
| 최대 시퀀스 길이 | 32768 词元 | 8192 词元 |
| 비전 인코더 | Qwen3.5-2B ViT (SigLIP2) | SigLIP2 Base |
| 오디오 인코더 | Whisper-large-v3 | Whisper-large-v3 |
| 작업 | 검색, 텍스트 매칭, 분류, 클러스터링 | 검색, 텍스트 매칭, 분류, 클러스터링 |
| 텍스트 호환성 | jina-embeddings-v5-text-small와 동일 | jina-embeddings-v5-text-nano와 동일 |
tag시작하기
tagElasticsearch (Elastic Inference Service)
이미 Elasticsearch에서 jina-embeddings-v5-text를 사용 중이라면, 기존 텍스트 인덱스를 v5-omni에서 바로 사용할 수 있습니다. Omni 모델은 v5-text와 동일한 텍스트 입력에 대해 동일한 向量模型(벡터)을 생성하며, 바이트 단위까지 일치합니다. 텍스트 인덱스를 다시 임베딩하거나 재구축할 필요가 없습니다. 기존 텍스트 데이터와 함께 이미지, 오디오, 비디오 검색을 시작하려면 v5-omni를 사용하여 새 인덱스를 만들고 멀티모달 콘텐츠를 추가하기만 하면 됩니다.
v5-omni를 추론 엔드포인트로 설정하여 semantic_text 인덱스를 생성합니다. EIS는 인덱싱 및 검색을 위해 올바른 LoRA 어댑터를 자동으로 선택합니다:
PUT multimodal-semantic-index
{
"mappings": {
"properties": {
"content": {
"type": "semantic_text",
"inference_id": ".jina-embeddings-v5-omni-small"
}
}
}
}텍스트, 이미지(base64 데이터 URI), 오디오, 비디오를 같은 필드, 같은 인덱스에 넣습니다:
// 텍스트 추가
POST multimodal-semantic-index/_doc
{
"content": "'Kraft Dinner' is what Canadians call macaroni and cheese when prepared from a kit."
}
// 이미지 추가 (base64)
POST multimodal-semantic-index/_doc
{
"content": "data:image/png;base64,iVBORw0KGgoAAAAN..."
}단일 텍스트 쿼리로 모든 모달리티를 검색합니다:
GET multimodal-semantic-index/_search
{
"query": {
"semantic": {
"field": "content",
"query": "Was bedeutet 'Kraft Dinner' für Kanadier?"
}
}
}tagJina Embedding API
curl https://api.jina.ai/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "jina-embeddings-v5-omni-small",
"task": "retrieval.query",
"dimensions": 1024,
"input": ["What does this image show?"],
"images": ["data:image/png;base64,..."]
}'tagHugging Face
from sentence_transformers import SentenceTransformer
import torch
model = SentenceTransformer(
"jinaai/jina-embeddings-v5-omni-small-retrieval",
model_kwargs={"dtype": torch.bfloat16},
)
# 텍스트 向量模型(임베딩) (v5-text와 동일)
text_emb = model.encode("What is knowledge distillation?", prompt_name="query")
# 이미지 向量模型(임베딩)
from PIL import Image
img = Image.open("photo.jpg")
img_emb = model.encode(img)
# 교차 모달 유사도
similarity = model.similarity(text_emb, img_emb)tag학습
핵심 아이디어는 동결된 인코더 모델 구성(frozen-encoder model composition)입니다. 강력한 텍스트 向量模型(임베딩) 모델을 가져와 사전 학습된 비전 및 오디오 인코더를 추가하고, 이를 작은 학습 가능한 프로젝터로 연결한 뒤 프로젝터를 제외한 나머지를 모두 동결합니다. 전체 가중치의 0.35%만 학습함으로써 세 가지 이점을 얻습니다. (1) 텍스트 정체성 유지 - 백본이 수정되지 않아 동일한 입력이 동일한 출력을 생성함; (2) 학습 효율성 - 프로젝터만 학습하므로 1.8~3.9배 빠르고 GPU 메모리 사용량이 42~64% 감소함; (3) 모듈성 - 타워를 독립적으로 로드할 수 있음.

v5-omni는 v5-text의 Matryoshka 차원 지원을 상속합니다. 이미지와 오디오 向量模型(임베딩)은 차원 축소 시 대부분의 품질을 유지하지만, 비디오는 작은 차원에서 성능 저하가 더 큽니다.

tag결론
멀티모달 向量模型(임베딩)을 위해서는 전체 모델을 처음부터 끝까지 학습시켜야 한다는 것이 통념이었습니다. 우리는 이에 동의하지 않습니다. v5-omni는 텍스트 백본을 동결하고 가중치의 0.35%만 학습하여, 자신보다 5~7배 큰 모델들과 대등한 성능을 냅니다. 교훈은 다음과 같습니다. 재학습보다 구성(Composition)이 낫습니다. 강력한 텍스트 인코더를 만드는 것이 가장 어렵지만, 일단 그것을 갖추면 가벼운 프로젝터를 통해 비전과 오디오를 연결하는 것은 거의 비용이 들지 않습니다.
이는 프로덕션 환경에서 중요합니다. 기존 v5-text 인덱스는 그대로 유지됩니다. 동일한 쿼리, 동일한 向量模型(벡터), 바이트 단위로 일치합니다. 문서를 재임베딩할 필요 없이 이미지, 오디오, 비디오 검색 기능을 바로 얻을 수 있습니다. 이것이 바로 마이그레이션 프로젝트가 아닌, 드롭인(drop-in) 업그레이드로서의 진정한 멀티모달 검색 혁신입니다.
jina-embeddings-v5-omni-small은 2B 파라미터 미만에서 가장 뛰어난 성능을 보이는 오픈 가중치 Omni 向量模型(임베딩) 모델입니다. jina-embeddings-v5-omni-nano는 0.9B 파라미터로 이를 수행합니다. 두 모델 모두 현재 Hugging Face, Jina Search Foundation API에서 사용할 수 있으며, Elasticsearch의 네이티브 추론 엔드포인트로도 이용 가능합니다.






