

우리는 向量模型 제품군의 5세대 모델인 jina-embeddings-v5-text를 출시합니다. 이 모델은 1B 미만 다국어 向量模型의 품질과 효율성 측면에서 한계를 넓혔습니다:
- jina-embeddings-v5-text-small (677M 파라미터): MMTEB 67.0, MTEB English 71.7
- jina-embeddings-v5-text-nano (239M 파라미터): MMTEB 65.5, MTEB English 71.0
small 모델은 32K 词元 컨텍스트(nano는 8K)를 지원하며, 4가지 작업별 LoRA 어댑터(검색, 텍스트 매칭, 분류, 클러스터링)와 1024에서 32까지의 Matryoshka 차원 축소를 지원합니다. 239M 파라미터의 nano 모델은 두 배 더 큰 파라미터를 가진 모델들의 검색 품질과 맞먹는 성능을 보여줍니다.
이전 세대와 비교하면: v5-text-small은 검색 성능 면에서 jina-embeddings-v4(3.8B)와 대등하면서도 크기는 5.6배 더 작으며, 비슷한 파라미터 수를 가진 jina-embeddings-v3(572M)보다 모든 작업에서 더 뛰어난 성능을 보입니다.
| 기능 | v5-text-small | v5-text-nano |
|---|---|---|
| 베이스 모델 | Qwen3-0.6B-Base | EuroBERT-210m |
| 파라미터 | 677M | 239M |
| 向量模型 차원 | 1024 | 768 |
| 컨텍스트 길이 | 32,768 | 8,192 |
| 지원 언어 | 119 (Qwen3 词元 분석기) | 15+ (EuroBERT 词元 분석기) |
| 풀링 | Last-token | Last-token |
| LoRA 어댑터 | 4 (검색, 텍스트 매칭, 분류, 클러스터링) | |
| Matryoshka 차원 | 32-1024 | 32-768 |
| MMTEB 점수 | 67.0 | 65.5 |
| MTEB English | 71.7 | 71.0 |
| 라이선스 | CC BY-NC 4.0 |
v5-text-small은 MMTEB(9개 작업 유형 내 131개 작업의 평균)에서 67.0점을 획득하여, 다음으로 성능이 좋은 1B 미만 모델(지시사항 포함 Qwen3-0.6B, 64.3점)보다 +2.7점 앞섰습니다. 239M 파라미터의 nano 모델은 65.5점을 기록하며 두 배 많은 파라미터를 가진 모델들을 능가했습니다.v5-text-small은 71.7점(7개 작업 유형 내 41개 작업의 평균)으로 모든 1B 미만 다국어 모델 중 선두를 달리고 있으며, KaLM-mini-v2.5(71.3)와 v5-text-nano(71.0)가 그 뒤를 바짝 따르고 있습니다. 239M nano 모델은 절반도 안 되는 크기로 494M KaLM 모델과 동등한 성능을 달성했습니다.v5-text-small은 5개 검색 벤치마크(MTEB Multilingual, MTEB English, RTEB, BEIR, LongEmbed)에서 4B 미만 모델 중 가장 높은 작업 수준 평균(63.28)을 달성했으며, 이는 jina-embeddings-v4(3.8B, 63.62)와 대등하면서도 5.6배 더 작습니다.
jina-embeddings-v5-small(0.6B 파라미터, 8위)은 MTEB Multilingual v2에서 1B 파라미터 미만 중 가장 강력한 向量模型이며, 모든 지표에서 Qwen3-Embedding-0.6b보다 뛰어난 성능을 보입니다. jina-embeddings-v5-nano(0.2B 파라미터, 11위)는 압도적으로 작은 크기로 11위 수준의 성능을 제공하며, 이 파라미터 클래스의 다른 어떤 모델도 이에 필적하지 못합니다.tag아키텍처

v5-text는 평균 풀링 대신 마지막 词元 풀링을 사용하는 디코더 전용 백본을 사용합니다. 각 트랜스포머 레이어에는 4개의 경량 LoRA 어댑터가 삽입되어 검색, 텍스트 매칭, 분류, 클러스터링을 독립적으로 처리합니다. 사용자는 추론 시 적절한 어댑터를 선택합니다. 검색의 경우 질의어에는 "Query:" 접두사가, 문서에는 "Document:" 접두사가 붙습니다. 컨텍스트 길이는 small 모델의 경우 32K 词元(nano 모델의 경우 8K)이며, 이는 v3보다 4배 증가한 수치입니다.
tag시작하기
tagElastic Inference Service
프로덕션 환경에서 v5-text를 사용하는 가장 빠른 방법입니다. Elastic Inference Service(EIS)는 내장된 스케일링 기능을 갖춘 관리형 向量模型 추론을 제공하므로, 인프라를 관리할 필요 없이 Elastic 배포 환경 내에서 직접 向量模型을 생성할 수 있습니다.
PUT _inference/text_embedding/jina-v5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-embeddings-v5-text-small"
}
}
설정 세부 정보는 EIS 문서를 참조하십시오.
tagJina Embedding API
词元당 요금이 부과되는 호스팅 API입니다. 작업 선택, 차원 축소 및 배치 처리를 기본적으로 지원합니다. GPU는 필요하지 않습니다.
curl https://api.jina.ai/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "jina-embeddings-v5-text-small",
"task": "retrieval.query",
"dimensions": 1024,
"input": ["What is knowledge distillation?"]
}'
jina.ai/embeddings 에서 API 키를 받으세요.
tagHugging Face + sentence-transformers
추론을 완전히 제어하며 로컬에서 실행하세요. 가중치는 Hugging Face에서 제공되며, sentence-transformers와 즉시 통합하여 사용할 수 있습니다.
from sentence_transformers import SentenceTransformer
import torch
model = SentenceTransformer(
"jinaai/jina-embeddings-v5-text-small-retrieval",
model_kwargs={"dtype": torch.bfloat16},
)
query_emb = model.encode("What is knowledge distillation?", prompt_name="query")
doc_embs = model.encode(["Knowledge distillation transfers...", "Venus is..."], prompt_name="document")
similarity = model.similarity(query_emb, doc_embs)
tagvLLM
프로덕션 워크로드를 위한 고성능 처리. vLLM은 마지막 词元(Token) 풀링을 통해 v5-text를 기본적으로 지원합니다.
from vllm import LLM
from vllm.config.pooler import PoolerConfig
model = LLM(
model="jinaai/jina-embeddings-v5-text-small-retrieval",
dtype="float16",
runner="pooling",
pooler_config=PoolerConfig(seq_pooling_type="LAST", normalize=True),
)
outputs = model.encode(["Query: climate change impacts"], pooling_task="embed")
llama.cpp 및 MLX를 통한 최적화된 로컬 추론을 위해, 각 작업 어댑터의 LoRA 가중치는 기본 모델에 병합되어 독립적인 가중치 파일로 생성됩니다. 이것이 각 작업(검색, 텍스트 매칭, 분류, 클러스터링)별로 별도의 저장소가 존재하는 이유입니다. 각 저장소에는 추론 시 LoRA 오버헤드 없이 바로 로드할 수 있는 전체 병합 가중치가 포함되어 있습니다.
tagllama.cpp (GGUF)
CPU 또는 엣지 디바이스에서 양자화된 모델을 실행하세요. 각 모델에 대해 F16부터 IQ1_S까지 14개의 GGUF 양자화 변형을 제공합니다.
llama-server -hf jinaai/jina-embeddings-v5-text-small-retrieval-GGUF:Q4_K_M \
--embedding --pooling last -ub 32768
tagMLX
MLX를 통한 네이티브 Apple Silicon 추론. 모든 작업 어댑터에 대해 전체 정밀도, 4비트 및 8비트 양자화 모델을 사용할 수 있습니다.
import mlx.core as mx
from tokenizers import Tokenizer
from model import JinaEmbeddingModel
import json
with open("config.json") as f:
config = json.load(f)
model = JinaEmbeddingModel(config)
weights = mx.load("model-4bit.safetensors") # 또는 model.safetensors, model-8bit.safetensors
model.load_weights(list(weights.items()))
tokenizer = Tokenizer.from_file("tokenizer.json")
texts = ["Query: What is machine learning?"]
embeddings = model.encode(texts, tokenizer)
Hugging Face에서 다운로드: jinaai/jina-embeddings-v5-text-small-retrieval-mlx (텍스트 매칭, 분류 및 클러스터링 어댑터용으로도 제공됩니다).
tag학습
두 모델 모두 훨씬 더 큰 학습된 向量模型(Embedding)인 Qwen3-Embedding-4B로부터 증류되었습니다. 소형 변형은 Qwen3-0.6B-Base를 백본으로 사용하며, 나노 버전은 EuroBERT-210m을 사용합니다. 학습 과정은 두 가지 상호 보완적인 신호를 결합합니다.
- 코사인 유사도 손실(cosine similarity loss)을 통한 4B 교사 모델로부터의 向量模型(Embedding) 증류. 학생 모델은 지시 사항(instruction) 형태의 提示词(Prompt) 없이도 교사 모델의 벡터 공간을 근사화하는 방법을 학습합니다. 이는 레이블이 지정된 데이터가 부족한 언어나 작업에 특히 효과적입니다.
- 하드 네거티브 마이닝(hard negative mining) 및 배치 내 네거티브(in-batch negatives)를 사용하는 레이블 지정된 쿼리-문서 쌍에 대한 작업별 대조 손실(
InfoNCE). 증류된 백본을 고정한 후, 각 작업 범주별로 별도의 LoRA 어댑터를 학습시킵니다.
절제 연구(ablation studies) 결과, 이 결합 방식이 어느 한 방법만 단독으로 사용하는 것보다 일관되게 더 나은 성능을 보이는 것으로 나타났습니다. MTEB 영어 검색 성능에서 이 결합 방식은 60.1 nDCG@10을 달성한 반면, 동일 백본에서 증류만 사용한 경우는 58.6, 대조 학습만 사용한 경우는 54.3을 기록했습니다.
또한 학습 중에 GOR (Generalized Orthogonal Regularization)을 적용하여 向量模型(Embedding) 구성 요소가 보다 균일하게 분포되도록 유도했습니다. 이는 표준 벤치마크 점수를 획기적으로 향상시키지는 않지만, 이진 양자화를 거의 무손실로 만들어 메모리가 제한된 환경에 배포할 때 매우 중요한 이점이 됩니다.
학습 과정에서 주목할 만한 몇 가지 관찰 사항은 다음과 같습니다.
- 증류와 대조 학습은 초기에 예상하지 못했던 방식으로 상호 보완적입니다.
- 손실 조합에서 단일 구성 요소를 제거하면 전반적인 성능이 저하됩니다.
- 작업별 LoRA 어댑터는 무시할 수 있는 수준의 파라미터 오버헤드로 다중 작업 학습보다 뛰어난 성능을 보입니다.
- GOR 정규화는 이진 양자화를 거의 무손실로 만드는데, 이는 미세한 전체 정밀도 향상보다 배포 환경에서 더 중요합니다.
tag결론
向量模型(Embedding)은 점점 더 대규모 시스템 내의 도구 체인 구성 요소로 사용되고 있습니다. LLM 에이전트는 에이전트 워크플로우의 일부로 검색, 메모리 및 분류를 위해 向量模型(Embedding) API를 호출합니다. OpenClaw나 OpenViking 같은 프로젝트는 向量模型(Embedding)을 독립적인 검색 엔드포인트가 아닌, 에이전트 컨텍스트 관리를 위한 핵심 인프라 계층으로 취급합니다. 이러한 환경에서는 호출당 추론 비용과 지연 시간이 벤치마크 점수만큼 중요하며, 소형 모델이 자연스러운 선택이 됩니다.
더 작은 向量模型(Embedding)을 향한 트렌드는 더 넓은 변화를 반영합니다. 온디바이스 검색, 브라우저 기반 검색, 엣지 배포 모두 제한된 메모리 예산에 맞는 모델을 요구합니다. Matryoshka 차원 지원을 통해 단일 모델로 재학습 없이 고정밀 검색과 초고속 근사 검색을 모두 수행할 수 있습니다. 1~2비트까지의 GGUF 양자화와 결합하면 프로덕션 向量模型(Embedding) 서비스의 유효 메모리 사용량이 한 자릿수 이상 감소합니다.
현재 시각 및 교차 모달 검색으로 동일한 아키텍처를 확장하는 jina-embeddings-v5-multimodal을 작업 중입니다. 초기 결과에 따르면 텍스트 성능을 저하시키지 않으면서 시각 인코더와 미세 조정된 텍스트 向量模型(Embedding)을 정렬하는 것이 가능합니다. 계속 지켜봐 주세요.






