Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
Elastic Inference Service
Jina 모델을 Elasticsearch에서 네이티브 방식으로 실행하세요.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
모델 아키텍처
시작하기
결론
star
추천
보도 자료
10월 03, 2025

Jina Reranker v3: SOTA 다국어 검색을 위한 0.6B Listwise 재정렬기

쿼리 및 모든 후보 문서를 단일 컨텍스트 창에서 고려하는 새로운 0.6B 파라미터 목록별 재정렬기(Reranker)입니다.
Jina AI • 7 분 소요
jinaai/jina-reranker-v3 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
jina-reranker-v3: Last but Not Late Interaction for Document Reranking
jina-reranker-v3 is a 0.6B parameter multilingual document reranker that introduces a novel last but not late interaction. Unlike late interaction models such as ColBERT that perform separate encoding followed by multi-vector matching, our approach conducts causal self-attention between query and documents within the same context window, enabling rich cross-document interactions before extracting contextual embeddings from the last token of each document. This compact architecture achieves state-of-the-art BEIR performance with 61.94 nDCG@10 while being ten times smaller than generative listwise rerankers.
arXiv.orgFeng Wang

저희는 최신 세대인 jina-reranker-v3 를 출시하게 되어 매우 기쁩니다. 이 모델은 다국어 검색 벤치마크에서 최첨단 성능을 제공하는 재정렬기입니다. 0.6B개의 파라미터를 가진 이 문서 재정렬기는 기존 방식과는 근본적으로 다른 새로운 last but not late 상호 작용을 도입했습니다. jina-reranker-v3 는 listwise 방식으로 작동합니다. 즉, 단일 컨텍스트 창 내에서 쿼리와 모든 후보 문서 간에 인과적 어텐션을 적용하여 각 문서의 마지막 토큰에서 컨텍스트 向量模型을 추출하기 전에 풍부한 교차 문서 상호 작용을 가능하게 합니다. 저희의 새로운 모델은 BEIR에서 61.94 nDCG@10을 달성하여 Qwen3-Reranker-4B 보다 6배 더 작은 크기로 더 나은 성능을 보입니다.

Model Size BEIR MIRACL MKQA CoIR
jina-reranker-v3 0.6B 61.94 66.83 67.92 70.64
jina-reranker-v2 0.3B 57.06 63.65 67.90 56.14
jina-reranker-m0 2.4B 58.95 66.75 68.19 63.55
bge-reranker-v2-m3 0.6B 56.51 69.32 67.88 36.28
mxbai-rerank-base-v2 0.5B 58.40 55.32 64.24 65.71
mxbai-rerank-large-v2 1.5B 61.44 57.94 67.06 70.87
Qwen3-Reranker-0.6B 0.6B 56.28 57.70 65.34 65.18
Qwen3-Reranker-4B 4.0B 61.16 67.52 67.52 73.91
jina-code-embeddings-0.5b 0.5B - - - 73.94
BEIR에서의 영어 검색 성능 (nDCG@10으로 측정). 모든 점수는 첫 번째 단계 검색기로서의 jina-embeddings-v3 에서 얻은 상위 100개의 결과를 기반으로 한 저희의 실행 결과입니다. jina-reranker-v3 의 세 가지 변형 (내림차순 관련성 점수, 오름차순 점수, 임의 순열로 정렬된 문서)을 평가합니다. 평가는 v3가 다양한 입력 순서에서 비교적 안정적인 성능을 유지하며, 이는 초기 배열에 관계없이 문서를 효과적으로 처리할 수 있는 강력한 자체 주의 메커니즘을 시사합니다.
18개의 다양한 언어에 걸친 MIRACL 평가는 jina-reranker-v3 의 컴팩트한 아키텍처에도 불구하고 다국어 일관성을 보여줍니다. 저희가 평가하는 언어에는 영어, 중국어, 스페인어, 아랍어, 프랑스어, 러시아어, 독일어, 일본어, 인도네시아어, 힌디어, 벵골어, 한국어, 스와힐리어, 텔루구어, 태국어, 페르시아어/파르시어, 요루바어, 핀란드어가 포함됩니다.
MKQA에서의 다국어 검색 성능 (Recall@10으로 측정). 저희가 평가하는 언어에는 영어, 중국어 (간체), 스페인어, 아랍어, 포르투갈어, 러시아어, 일본어, 독일어, 프랑스어, 한국어, 베트남어, 이탈리아어, 터키어, 폴란드어, 태국어, 네덜란드어, 말레이어, 중국어 (번체), 스웨덴어, 히브리어, 헝가리어, 중국어 (홍콩), 덴마크어, 노르웨이어, 핀란드어, 크메르어가 포함됩니다.

tag모델 아키텍처

jina-reranker-v3 는 인과적 자체 주의를 사용하는 디코더 전용 변환기 모델인 Qwen3-0.6B 백본을 기반으로 구축되었습니다. 이 모델은 여러 문서와 쿼리를 동시에 처리하고 효율적인 유사성 계산을 위해 지정된 토큰 위치에서 컨텍스트 向量模型을 추출합니다.

向量模型 추출을 위한 특수 토큰 위치를 가진 변환기 백본을 보여주는 jina-reranker-v3 의 아키텍처. 이 모델은 하나의 컨텍스트 창에서 여러 문서와 쿼리를 처리하고 유사성 계산을 위해 지정된 토큰 위치에서 컨텍스트 向量模型을 추출합니다.
Parameter Value
Total Parameters 0.6B
Non-Embedding Parameters 0.44B
Hidden Size 1,024
Number of Layers 28
Attention Heads (Q/KV) 16/8 (GQA)
Context Length 131,072
MLP Projector 1024→512→256
Final Embedding Size 256

쿼리 및 후보 문서 집합이 주어지면 jina-reranker-v3 는 단일 순방향 패스 내에서 교차 문서 상호 작용을 가능하게 하는 특수 Prompt 템플릿을 사용하여 재정렬 작업을 처리합니다. 입력 구성은 다음과 같은 특정 형식을 따릅니다.

<|im_start|>system
You are a search relevance expert who can determine
a ranking of passages based on their relevance to the query.
<|im_end|>

<|im_start|>user
I will provide you with k passages, each indicated by a numerical identifier.
Rank the passages based on their relevance to query: [QUERY]

<passage id="1">
[DOCUMENT_1]<|doc_emb|>
</passage>
</passage>
<passage id="2">
[DOCUMENT_2]<|doc_emb|>
</passage>
...
<passage id="k">
[DOCUMENT_k]<|doc_emb|>
</passage>

<query>
[QUERY]<|query_emb|>
</query>
<|im_end|>

<|im_start|>assistant
<think></think>

각 문서는 순차적 ID가 있는 구절 태그로 래핑되어 공유 컨텍스트 창 내에서 명확한 문서 경계를 가능하게 합니다. 이 모델은 131K 토큰 컨텍스트 용량 내에서 최대 64개의 문서를 동시에 처리합니다. 더 큰 문서 모음의 경우, 일괄 처리 간에 쿼리 일관성을 유지하면서 일괄 처리로 진행됩니다.

쿼리는 입력 구조에 두 번 나타납니다. 한 번은 작업 지침을 위해 시작 부분에, 다른 한 번은 최종 주의 처리를 위해 끝 부분에 나타납니다. 이러한 이중 배치를 통해 최종 쿼리 위치는 인과적 주의를 통해 이전의 모든 문서에 주의를 기울일 수 있습니다. 두 개의 중요한 특수 토큰이 向量模型 추출 위치를 표시합니다. <|doc_emb|> 토큰은 각 문서 뒤에 배치되어 문서 向量模型 추출 지점을 표시하고, <|query_emb|> 토큰은 최종 쿼리 뒤에 배치되어 쿼리 向量模型 추출 지점을 표시합니다. 이러한 向量模型은 공유 인과적 자체 주의 메커니즘을 통해 로컬 문서 의미와 글로벌 교차 문서 컨텍스트를 모두 캡처합니다.

저희는 이러한 쿼리-문서 상호 작용을 "last but not late"라고 부릅니다. <|doc_emb|> 가 각 문서의 마지막 토큰으로 배치되기 때문에 "last"입니다. ColBERT와 같은 후기 상호 작용 모델 과 달리 다중 벡터 매칭 전에 문서를 별도로 인코딩하는 대신 순방향 패스 동안 동일한 컨텍스트 창 내에서 쿼리-문서 및 문서-문서 상호 작용을 가능하게 하기 때문에 "not late"입니다.

마지막으로 ReLU 활성화 함수를 사용하는 2계층 MLP 프로젝터는 1024차원 숨겨진 상태를 256차원 순위 공간에 매핑합니다. 관련성 점수는 투영된 쿼리 벡터 모델과 각 투영된 문서 벡터 모델 간의 코사인 유사성을 사용하여 계산됩니다. 이렇게 하면 입력 세트의 각 문서에 대한 관련성 점수가 생성됩니다.

tag시작하기

tagAPI를 통해

jina-reranker-v3를 사용하는 가장 쉬운 방법은 Search Foundation API를 이용하는 것입니다.

curl -X POST \
  https://api.jina.ai/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer JINA_API_KEY" \
  -d '{
  "model": "jina-reranker-v3",
  "query": "slm markdown",
  "documents": [
    ...
  ],
  "return_documents": false
}'
{
  "model":"jina-reranker-v3",
  "usage": {
    "total_tokens":2813
  },
  "results":[
    {
      "index":1,
      "relevance_score":0.9310624287463884
    },
    {
      "index":4,
      "relevance_score":0.8982678574191957
    },
    {
      "index":0,
      "relevance_score":0.890233167219021
    },
    ...
  ]
}

relevance_score 필드는 각 문서와 쿼리의 관련성을 나타내며, 점수가 높을수록 관련성이 높습니다.

tagtransformers를 통해

from transformers import AutoModel

model = AutoModel.from_pretrained(
    'jinaai/jina-reranker-v3',
    dtype="auto",
    trust_remote_code=True,
)
model.eval()

이제 모델의 rerank 함수를 사용하여 쿼리 및 문서 목록에 대한 관련성 점수를 계산할 수 있습니다.

query = "What are the health benefits of green tea?"
documents = [
    "Green tea contains antioxidants called catechins that may help reduce inflammation and protect cells from damage.",
    "El precio del café ha aumentado un 20% este año debido a problemas en la cadena de suministro.",
    "Studies show that drinking green tea regularly can improve brain function and boost metabolism.",
    "Basketball is one of the most popular sports in the United States.",
    "绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险,还有助于控制体重。",
    "Le thé vert est riche en antioxydants et peut améliorer la fonction cérébrale.",
]

# Rerank documents
results = model.rerank(query, documents)

# Results are sorted by relevance score (highest first)
for result in results:
    print(f"Score: {result['relevance_score']:.4f}")
    print(f"Document: {result['document'][:100]}...")
    print()

tag결론

jina-reranker-v3는 효율적인 문서 재정렬을 위해 마지막이지만 늦지 않은 상호 작용을 도입한 새로운 0.6B 파라미터 다국어 리스트와이즈 재정렬기입니다. 문서는 인코딩 중에 서로 주의를 기울여 최종 순위를 결정하는 상호 작용을 설정할 수 있습니다.

주요 관심사 중 하나는 이러한 상호 작용이 입력 순열에 탄력적인지, 즉 입력 순서를 섞으면 순위가 동일하게 유지되는지 여부입니다. 무작위 순열을 사용하여 110개의 후보 문서에 대한 쿼리로 이를 테스트하고 아래 그림에서 각 순위 위치에서 분산을 플로팅했습니다.

순위 안정성 그래프는 1,000개의 무작위 입력 순열에서 문서가 특정 순위 위치에 얼마나 일관되게 나타나는지 시각화합니다. y축은 백분율로 안정성 분산을 나타내며, 0%는 완벽한 안정성(정확히 동일한 문서가 항상 이 순위에 나타남)을 나타내고 100%는 최대 분산(거의 모든 문서가 순열에서 이 순위에 나타남)을 나타냅니다. x축은 1부터 110까지의 순위 위치를 보여줍니다.

중요한 발견은 최상위 순위 위치가 뛰어난 안정성을 보인다는 것입니다. 순위 1-10은 최소 분산을 나타내며, 가장 관련성이 높은 문서는 입력 순서에 관계없이 일관되게 최상위에 랭크됩니다. 이는 nDCG@10 및 유사한 상위 k 메트릭에 매우 중요합니다. 관련 없는 문서는 일관되게 맨 아래에 머물러 관련 있는 콘텐츠와 관련 없는 콘텐츠 간에 명확한 분리를 만듭니다.

중간 섹션은 상당한 위치 스와핑을 보여주는데, 이는 예상되고 허용됩니다. 이 모델은 인과적 자기 주의를 사용하고 시퀀스에서 이전에 나타나는 내용에 따라 다른 컨텍스트 정보를 인코딩합니다.

실제로 가장 중요한 상위 결과에 신경 쓰는 경우 이러한 동작은 완전히 허용됩니다. 당사의 평가는 jina-reranker-v3가 jina-reranker-v2-base-multilingual 및 jina-colbert-v2를 포함한 이전 세대와 Qwen3-Reranker-4B 및 jina-reranker-m0와 같은 훨씬 더 큰 대안보다 성능이 우수함을 보여 주어 이를 더욱 확인합니다.

범주:
star
추천
보도 자료
rss_feed

자세히 보기
8월 03, 2026 • 11 분 소요
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
5월 12, 2026 • 7 분 소요
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
2월 19, 2026 • 7 분 소요
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.