Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
Elastic Inference Service
Jina 모델을 Elasticsearch에서 네이티브 방식으로 실행하세요.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
아키텍처
시작하기
학습
결론
star
추천
보도 자료
2월 19, 2026

jina-embeddings-v5-text: 새로운 SOTA 소형 다국어 임베딩(Embeddings)

최고 수준의 성능을 자랑하는 1B 미만의 다국어 向量模型 두 가지가 Elastic Inference Service, Llama.cpp 및 MLX에서 제공됩니다.
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Han Xiao
Han Xiao • 7 분 소요
jina-embeddings-v5-text: Task-Targeted Embedding Distillation
텍스트 向量模型은 정보 검색, 클러스터링, 분류 등 의미론적 유사도 작업에 널리 사용됩니다. 범용 모델은 일반적으로 대조 손실 함수를 사용하는 단일 또는 다단계 프로세스로 학습됩니다. 우리는 모델 증류 기술과 작업별 대조 손실을 결합하여 작고 고성능인 向量模型을 생성하는 새로운 학습 체계를 도입합니다. 연구 결과에 따르면 이 접근 방식은 순수 대조 학습이나 증류 기반 학습 방식보다 SLM 학습에 더 효과적입니다. 결과물인 jina-embeddings-v5-text-small 및 jina-embeddings-v5-text-nano 모델의 벤치마크 점수는 유사한 크기의 최신 모델 수준을 뛰어넘거나 대등한 수준을 보여줍니다. jina-embeddings-v5-text 모델은 다국어를 지원하며 긴 텍스트(small 모델의 경우 최대 32K 词元, nano 모델의 경우 8K)를 처리할 수 있고, 잘림(truncation) 및 이진 양자화 상태에서도 강력한 向量模型을 생성합니다. 모델 가중치는 공개되어 있으며, 向量模型 개발에 있어 향후 더 큰 진전을 이룰 수 있는 영감이 되기를 바랍니다.
arXiv.orgMohammad Kalim Akram
jina-embeddings-v5-text - a jinaai Collection
5세대 向量模型: 검색, 매칭, 클러스터링 및 분류 작업에서 SOTA 성능을 자랑하는 두 가지 경량 다국어 모델입니다.
a jinaai Collection

우리는 向量模型 제품군의 5세대 모델인 jina-embeddings-v5-text를 출시합니다. 이 모델은 1B 미만 다국어 向量模型의 품질과 효율성 측면에서 한계를 넓혔습니다:

  • jina-embeddings-v5-text-small (677M 파라미터): MMTEB 67.0, MTEB English 71.7
  • jina-embeddings-v5-text-nano (239M 파라미터): MMTEB 65.5, MTEB English 71.0

small 모델은 32K 词元 컨텍스트(nano는 8K)를 지원하며, 4가지 작업별 LoRA 어댑터(검색, 텍스트 매칭, 분류, 클러스터링)와 1024에서 32까지의 Matryoshka 차원 축소를 지원합니다. 239M 파라미터의 nano 모델은 두 배 더 큰 파라미터를 가진 모델들의 검색 품질과 맞먹는 성능을 보여줍니다.

이전 세대와 비교하면: v5-text-small은 검색 성능 면에서 jina-embeddings-v4(3.8B)와 대등하면서도 크기는 5.6배 더 작으며, 비슷한 파라미터 수를 가진 jina-embeddings-v3(572M)보다 모든 작업에서 더 뛰어난 성능을 보입니다.

기능v5-text-smallv5-text-nano
베이스 모델Qwen3-0.6B-BaseEuroBERT-210m
파라미터677M239M
向量模型 차원1024768
컨텍스트 길이32,7688,192
지원 언어119 (Qwen3 词元 분석기)15+ (EuroBERT 词元 분석기)
풀링Last-tokenLast-token
LoRA 어댑터4 (검색, 텍스트 매칭, 분류, 클러스터링)
Matryoshka 차원32-102432-768
MMTEB 점수67.065.5
MTEB English71.771.0
라이선스CC BY-NC 4.0
MMTEB Multilingual Benchmark
v5-text-small은 MMTEB(9개 작업 유형 내 131개 작업의 평균)에서 67.0점을 획득하여, 다음으로 성능이 좋은 1B 미만 모델(지시사항 포함 Qwen3-0.6B, 64.3점)보다 +2.7점 앞섰습니다. 239M 파라미터의 nano 모델은 65.5점을 기록하며 두 배 많은 파라미터를 가진 모델들을 능가했습니다.
MTEB English Benchmark
영어 전용 평가에서 v5-text-small은 71.7점(7개 작업 유형 내 41개 작업의 평균)으로 모든 1B 미만 다국어 모델 중 선두를 달리고 있으며, KaLM-mini-v2.5(71.3)와 v5-text-nano(71.0)가 그 뒤를 바짝 따르고 있습니다. 239M nano 모델은 절반도 안 되는 크기로 494M KaLM 모델과 동등한 성능을 달성했습니다.
Retrieval Benchmark Results
v5-text-small은 5개 검색 벤치마크(MTEB Multilingual, MTEB English, RTEB, BEIR, LongEmbed)에서 4B 미만 모델 중 가장 높은 작업 수준 평균(63.28)을 달성했으며, 이는 jina-embeddings-v4(3.8B, 63.62)와 대등하면서도 5.6배 더 작습니다.
Table showing multilingual MTEB model performance metrics, rankings, and evaluations across various tasks and language benchm
2026/02/21 기준 MTEB 리더보드에 따르면, jina-embeddings-v5-small(0.6B 파라미터, 8위)은 MTEB Multilingual v2에서 1B 파라미터 미만 중 가장 강력한 向量模型이며, 모든 지표에서 Qwen3-Embedding-0.6b보다 뛰어난 성능을 보입니다. jina-embeddings-v5-nano(0.2B 파라미터, 11위)는 압도적으로 작은 크기로 11위 수준의 성능을 제공하며, 이 파라미터 클래스의 다른 어떤 모델도 이에 필적하지 못합니다.

tag아키텍처

<code>jina-embeddings-v5-text</code> 아키텍처

v5-text는 평균 풀링 대신 마지막 词元 풀링을 사용하는 디코더 전용 백본을 사용합니다. 각 트랜스포머 레이어에는 4개의 경량 LoRA 어댑터가 삽입되어 검색, 텍스트 매칭, 분류, 클러스터링을 독립적으로 처리합니다. 사용자는 추론 시 적절한 어댑터를 선택합니다. 검색의 경우 질의어에는 "Query:" 접두사가, 문서에는 "Document:" 접두사가 붙습니다. 컨텍스트 길이는 small 모델의 경우 32K 词元(nano 모델의 경우 8K)이며, 이는 v3보다 4배 증가한 수치입니다.

tag시작하기

tagElastic Inference Service

프로덕션 환경에서 v5-text를 사용하는 가장 빠른 방법입니다. Elastic Inference Service(EIS)는 내장된 스케일링 기능을 갖춘 관리형 向量模型 추론을 제공하므로, 인프라를 관리할 필요 없이 Elastic 배포 환경 내에서 직접 向量模型을 생성할 수 있습니다.

PUT _inference/text_embedding/jina-v5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-embeddings-v5-text-small"
  }
}

설정 세부 정보는 EIS 문서를 참조하십시오.

tagJina Embedding API

词元당 요금이 부과되는 호스팅 API입니다. 작업 선택, 차원 축소 및 배치 처리를 기본적으로 지원합니다. GPU는 필요하지 않습니다.

curl https://api.jina.ai/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "jina-embeddings-v5-text-small",
    "task": "retrieval.query",
    "dimensions": 1024,
    "input": ["What is knowledge distillation?"]
  }'

jina.ai/embeddings 에서 API 키를 받으세요.

tagHugging Face + sentence-transformers

추론을 완전히 제어하며 로컬에서 실행하세요. 가중치는 Hugging Face에서 제공되며, sentence-transformers와 즉시 통합하여 사용할 수 있습니다.

from sentence_transformers import SentenceTransformer
import torch

model = SentenceTransformer(
    "jinaai/jina-embeddings-v5-text-small-retrieval",
    model_kwargs={"dtype": torch.bfloat16},
)

query_emb = model.encode("What is knowledge distillation?", prompt_name="query")
doc_embs = model.encode(["Knowledge distillation transfers...", "Venus is..."], prompt_name="document")
similarity = model.similarity(query_emb, doc_embs)

tagvLLM

프로덕션 워크로드를 위한 고성능 처리. vLLM은 마지막 词元(Token) 풀링을 통해 v5-text를 기본적으로 지원합니다.

from vllm import LLM
from vllm.config.pooler import PoolerConfig

model = LLM(
    model="jinaai/jina-embeddings-v5-text-small-retrieval",
    dtype="float16",
    runner="pooling",
    pooler_config=PoolerConfig(seq_pooling_type="LAST", normalize=True),
)
outputs = model.encode(["Query: climate change impacts"], pooling_task="embed")

llama.cpp 및 MLX를 통한 최적화된 로컬 추론을 위해, 각 작업 어댑터의 LoRA 가중치는 기본 모델에 병합되어 독립적인 가중치 파일로 생성됩니다. 이것이 각 작업(검색, 텍스트 매칭, 분류, 클러스터링)별로 별도의 저장소가 존재하는 이유입니다. 각 저장소에는 추론 시 LoRA 오버헤드 없이 바로 로드할 수 있는 전체 병합 가중치가 포함되어 있습니다.

tagllama.cpp (GGUF)

CPU 또는 엣지 디바이스에서 양자화된 모델을 실행하세요. 각 모델에 대해 F16부터 IQ1_S까지 14개의 GGUF 양자화 변형을 제공합니다.

llama-server -hf jinaai/jina-embeddings-v5-text-small-retrieval-GGUF:Q4_K_M \
  --embedding --pooling last -ub 32768

tagMLX

MLX를 통한 네이티브 Apple Silicon 추론. 모든 작업 어댑터에 대해 전체 정밀도, 4비트 및 8비트 양자화 모델을 사용할 수 있습니다.

import mlx.core as mx
from tokenizers import Tokenizer
from model import JinaEmbeddingModel
import json

with open("config.json") as f:
    config = json.load(f)

model = JinaEmbeddingModel(config)
weights = mx.load("model-4bit.safetensors")  # 또는 model.safetensors, model-8bit.safetensors
model.load_weights(list(weights.items()))

tokenizer = Tokenizer.from_file("tokenizer.json")
texts = ["Query: What is machine learning?"]
embeddings = model.encode(texts, tokenizer)

Hugging Face에서 다운로드: jinaai/jina-embeddings-v5-text-small-retrieval-mlx (텍스트 매칭, 분류 및 클러스터링 어댑터용으로도 제공됩니다).

tag학습

두 모델 모두 훨씬 더 큰 학습된 向量模型(Embedding)인 Qwen3-Embedding-4B로부터 증류되었습니다. 소형 변형은 Qwen3-0.6B-Base를 백본으로 사용하며, 나노 버전은 EuroBERT-210m을 사용합니다. 학습 과정은 두 가지 상호 보완적인 신호를 결합합니다.

  1. 코사인 유사도 손실(cosine similarity loss)을 통한 4B 교사 모델로부터의 向量模型(Embedding) 증류. 학생 모델은 지시 사항(instruction) 형태의 提示词(Prompt) 없이도 교사 모델의 벡터 공간을 근사화하는 방법을 학습합니다. 이는 레이블이 지정된 데이터가 부족한 언어나 작업에 특히 효과적입니다.
  2. 하드 네거티브 마이닝(hard negative mining) 및 배치 내 네거티브(in-batch negatives)를 사용하는 레이블 지정된 쿼리-문서 쌍에 대한 작업별 대조 손실(InfoNCE). 증류된 백본을 고정한 후, 각 작업 범주별로 별도의 LoRA 어댑터를 학습시킵니다.

절제 연구(ablation studies) 결과, 이 결합 방식이 어느 한 방법만 단독으로 사용하는 것보다 일관되게 더 나은 성능을 보이는 것으로 나타났습니다. MTEB 영어 검색 성능에서 이 결합 방식은 60.1 nDCG@10을 달성한 반면, 동일 백본에서 증류만 사용한 경우는 58.6, 대조 학습만 사용한 경우는 54.3을 기록했습니다.

또한 학습 중에 GOR (Generalized Orthogonal Regularization)을 적용하여 向量模型(Embedding) 구성 요소가 보다 균일하게 분포되도록 유도했습니다. 이는 표준 벤치마크 점수를 획기적으로 향상시키지는 않지만, 이진 양자화를 거의 무손실로 만들어 메모리가 제한된 환경에 배포할 때 매우 중요한 이점이 됩니다.

학습 과정에서 주목할 만한 몇 가지 관찰 사항은 다음과 같습니다.

  • 증류와 대조 학습은 초기에 예상하지 못했던 방식으로 상호 보완적입니다.
  • 손실 조합에서 단일 구성 요소를 제거하면 전반적인 성능이 저하됩니다.
  • 작업별 LoRA 어댑터는 무시할 수 있는 수준의 파라미터 오버헤드로 다중 작업 학습보다 뛰어난 성능을 보입니다.
  • GOR 정규화는 이진 양자화를 거의 무손실로 만드는데, 이는 미세한 전체 정밀도 향상보다 배포 환경에서 더 중요합니다.

tag결론

向量模型(Embedding)은 점점 더 대규모 시스템 내의 도구 체인 구성 요소로 사용되고 있습니다. LLM 에이전트는 에이전트 워크플로우의 일부로 검색, 메모리 및 분류를 위해 向量模型(Embedding) API를 호출합니다. OpenClaw나 OpenViking 같은 프로젝트는 向量模型(Embedding)을 독립적인 검색 엔드포인트가 아닌, 에이전트 컨텍스트 관리를 위한 핵심 인프라 계층으로 취급합니다. 이러한 환경에서는 호출당 추론 비용과 지연 시간이 벤치마크 점수만큼 중요하며, 소형 모델이 자연스러운 선택이 됩니다.

더 작은 向量模型(Embedding)을 향한 트렌드는 더 넓은 변화를 반영합니다. 온디바이스 검색, 브라우저 기반 검색, 엣지 배포 모두 제한된 메모리 예산에 맞는 모델을 요구합니다. Matryoshka 차원 지원을 통해 단일 모델로 재학습 없이 고정밀 검색과 초고속 근사 검색을 모두 수행할 수 있습니다. 1~2비트까지의 GGUF 양자화와 결합하면 프로덕션 向量模型(Embedding) 서비스의 유효 메모리 사용량이 한 자릿수 이상 감소합니다.

현재 시각 및 교차 모달 검색으로 동일한 아키텍처를 확장하는 jina-embeddings-v5-multimodal을 작업 중입니다. 초기 결과에 따르면 텍스트 성능을 저하시키지 않으면서 시각 인코더와 미세 조정된 텍스트 向量模型(Embedding)을 정렬하는 것이 가능합니다. 계속 지켜봐 주세요.

범주:
star
추천
보도 자료
rss_feed

자세히 보기
8월 03, 2026 • 11 분 소요
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
5월 12, 2026 • 7 분 소요
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
12월 04, 2025 • 7 분 소요
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.