저희는 최신 세대인 jina-reranker-v3 를 출시하게 되어 매우 기쁩니다. 이 모델은 다국어 검색 벤치마크에서 최첨단 성능을 제공하는 재정렬기입니다. 0.6B개의 파라미터를 가진 이 문서 재정렬기는 기존 방식과는 근본적으로 다른 새로운 last but not late 상호 작용을 도입했습니다. jina-reranker-v3 는 listwise 방식으로 작동합니다. 즉, 단일 컨텍스트 창 내에서 쿼리와 모든 후보 문서 간에 인과적 어텐션을 적용하여 각 문서의 마지막 토큰에서 컨텍스트 向量模型을 추출하기 전에 풍부한 교차 문서 상호 작용을 가능하게 합니다. 저희의 새로운 모델은 BEIR에서 61.94 nDCG@10을 달성하여 Qwen3-Reranker-4B 보다 6배 더 작은 크기로 더 나은 성능을 보입니다.
| Model | Size | BEIR | MIRACL | MKQA | CoIR |
|---|---|---|---|---|---|
| jina-reranker-v3 | 0.6B | 61.94 | 66.83 | 67.92 | 70.64 |
| jina-reranker-v2 | 0.3B | 57.06 | 63.65 | 67.90 | 56.14 |
| jina-reranker-m0 | 2.4B | 58.95 | 66.75 | 68.19 | 63.55 |
| bge-reranker-v2-m3 | 0.6B | 56.51 | 69.32 | 67.88 | 36.28 |
| mxbai-rerank-base-v2 | 0.5B | 58.40 | 55.32 | 64.24 | 65.71 |
| mxbai-rerank-large-v2 | 1.5B | 61.44 | 57.94 | 67.06 | 70.87 |
| Qwen3-Reranker-0.6B | 0.6B | 56.28 | 57.70 | 65.34 | 65.18 |
| Qwen3-Reranker-4B | 4.0B | 61.16 | 67.52 | 67.52 | 73.91 |
| jina-code-embeddings-0.5b | 0.5B | - | - | - | 73.94 |



tag모델 아키텍처
jina-reranker-v3 는 인과적 자체 주의를 사용하는 디코더 전용 변환기 모델인 Qwen3-0.6B 백본을 기반으로 구축되었습니다. 이 모델은 여러 문서와 쿼리를 동시에 처리하고 효율적인 유사성 계산을 위해 지정된 토큰 위치에서 컨텍스트 向量模型을 추출합니다.
| Parameter | Value |
|---|---|
| Total Parameters | 0.6B |
| Non-Embedding Parameters | 0.44B |
| Hidden Size | 1,024 |
| Number of Layers | 28 |
| Attention Heads (Q/KV) | 16/8 (GQA) |
| Context Length | 131,072 |
| MLP Projector | 1024→512→256 |
| Final Embedding Size | 256 |
쿼리 및 후보 문서 집합이 주어지면 jina-reranker-v3 는 단일 순방향 패스 내에서 교차 문서 상호 작용을 가능하게 하는 특수 Prompt 템플릿을 사용하여 재정렬 작업을 처리합니다. 입력 구성은 다음과 같은 특정 형식을 따릅니다.
<|im_start|>system
You are a search relevance expert who can determine
a ranking of passages based on their relevance to the query.
<|im_end|>
<|im_start|>user
I will provide you with k passages, each indicated by a numerical identifier.
Rank the passages based on their relevance to query: [QUERY]
<passage id="1">
[DOCUMENT_1]<|doc_emb|>
</passage>
</passage>
<passage id="2">
[DOCUMENT_2]<|doc_emb|>
</passage>
...
<passage id="k">
[DOCUMENT_k]<|doc_emb|>
</passage>
<query>
[QUERY]<|query_emb|>
</query>
<|im_end|>
<|im_start|>assistant
<think></think>각 문서는 순차적 ID가 있는 구절 태그로 래핑되어 공유 컨텍스트 창 내에서 명확한 문서 경계를 가능하게 합니다. 이 모델은 131K 토큰 컨텍스트 용량 내에서 최대 64개의 문서를 동시에 처리합니다. 더 큰 문서 모음의 경우, 일괄 처리 간에 쿼리 일관성을 유지하면서 일괄 처리로 진행됩니다.
쿼리는 입력 구조에 두 번 나타납니다. 한 번은 작업 지침을 위해 시작 부분에, 다른 한 번은 최종 주의 처리를 위해 끝 부분에 나타납니다. 이러한 이중 배치를 통해 최종 쿼리 위치는 인과적 주의를 통해 이전의 모든 문서에 주의를 기울일 수 있습니다. 두 개의 중요한 특수 토큰이 向量模型 추출 위치를 표시합니다. <|doc_emb|> 토큰은 각 문서 뒤에 배치되어 문서 向量模型 추출 지점을 표시하고, <|query_emb|> 토큰은 최종 쿼리 뒤에 배치되어 쿼리 向量模型 추출 지점을 표시합니다. 이러한 向量模型은 공유 인과적 자체 주의 메커니즘을 통해 로컬 문서 의미와 글로벌 교차 문서 컨텍스트를 모두 캡처합니다.
저희는 이러한 쿼리-문서 상호 작용을 "last but not late"라고 부릅니다. <|doc_emb|> 가 각 문서의 마지막 토큰으로 배치되기 때문에 "last"입니다. ColBERT와 같은 후기 상호 작용 모델 과 달리 다중 벡터 매칭 전에 문서를 별도로 인코딩하는 대신 순방향 패스 동안 동일한 컨텍스트 창 내에서 쿼리-문서 및 문서-문서 상호 작용을 가능하게 하기 때문에 "not late"입니다.
마지막으로 ReLU 활성화 함수를 사용하는 2계층 MLP 프로젝터는 1024차원 숨겨진 상태를 256차원 순위 공간에 매핑합니다. 관련성 점수는 투영된 쿼리 벡터 모델과 각 투영된 문서 벡터 모델 간의 코사인 유사성을 사용하여 계산됩니다. 이렇게 하면 입력 세트의 각 문서에 대한 관련성 점수가 생성됩니다.
tag시작하기
tagAPI를 통해
jina-reranker-v3를 사용하는 가장 쉬운 방법은 Search Foundation API를 이용하는 것입니다.
curl -X POST \
https://api.jina.ai/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer JINA_API_KEY" \
-d '{
"model": "jina-reranker-v3",
"query": "slm markdown",
"documents": [
...
],
"return_documents": false
}'{
"model":"jina-reranker-v3",
"usage": {
"total_tokens":2813
},
"results":[
{
"index":1,
"relevance_score":0.9310624287463884
},
{
"index":4,
"relevance_score":0.8982678574191957
},
{
"index":0,
"relevance_score":0.890233167219021
},
...
]
}relevance_score 필드는 각 문서와 쿼리의 관련성을 나타내며, 점수가 높을수록 관련성이 높습니다.
tagtransformers를 통해
from transformers import AutoModel
model = AutoModel.from_pretrained(
'jinaai/jina-reranker-v3',
dtype="auto",
trust_remote_code=True,
)
model.eval()이제 모델의 rerank 함수를 사용하여 쿼리 및 문서 목록에 대한 관련성 점수를 계산할 수 있습니다.
query = "What are the health benefits of green tea?"
documents = [
"Green tea contains antioxidants called catechins that may help reduce inflammation and protect cells from damage.",
"El precio del café ha aumentado un 20% este año debido a problemas en la cadena de suministro.",
"Studies show that drinking green tea regularly can improve brain function and boost metabolism.",
"Basketball is one of the most popular sports in the United States.",
"绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险,还有助于控制体重。",
"Le thé vert est riche en antioxydants et peut améliorer la fonction cérébrale.",
]
# Rerank documents
results = model.rerank(query, documents)
# Results are sorted by relevance score (highest first)
for result in results:
print(f"Score: {result['relevance_score']:.4f}")
print(f"Document: {result['document'][:100]}...")
print()
tag결론
jina-reranker-v3는 효율적인 문서 재정렬을 위해 마지막이지만 늦지 않은 상호 작용을 도입한 새로운 0.6B 파라미터 다국어 리스트와이즈 재정렬기입니다. 문서는 인코딩 중에 서로 주의를 기울여 최종 순위를 결정하는 상호 작용을 설정할 수 있습니다.
주요 관심사 중 하나는 이러한 상호 작용이 입력 순열에 탄력적인지, 즉 입력 순서를 섞으면 순위가 동일하게 유지되는지 여부입니다. 무작위 순열을 사용하여 110개의 후보 문서에 대한 쿼리로 이를 테스트하고 아래 그림에서 각 순위 위치에서 분산을 플로팅했습니다.

중요한 발견은 최상위 순위 위치가 뛰어난 안정성을 보인다는 것입니다. 순위 1-10은 최소 분산을 나타내며, 가장 관련성이 높은 문서는 입력 순서에 관계없이 일관되게 최상위에 랭크됩니다. 이는 nDCG@10 및 유사한 상위 k 메트릭에 매우 중요합니다. 관련 없는 문서는 일관되게 맨 아래에 머물러 관련 있는 콘텐츠와 관련 없는 콘텐츠 간에 명확한 분리를 만듭니다.
중간 섹션은 상당한 위치 스와핑을 보여주는데, 이는 예상되고 허용됩니다. 이 모델은 인과적 자기 주의를 사용하고 시퀀스에서 이전에 나타나는 내용에 따라 다른 컨텍스트 정보를 인코딩합니다.
실제로 가장 중요한 상위 결과에 신경 쓰는 경우 이러한 동작은 완전히 허용됩니다. 당사의 평가는 jina-reranker-v3가 jina-reranker-v2-base-multilingual 및 jina-colbert-v2를 포함한 이전 세대와 Qwen3-Reranker-4B 및 jina-reranker-m0와 같은 훨씬 더 큰 대안보다 성능이 우수함을 보여 주어 이를 더욱 확인합니다.








