Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
Elastic Inference Service
Jina 모델을 Elasticsearch에서 네이티브 방식으로 실행하세요.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
아키텍처
실험 결과
시작하기
결론
star
추천
보도 자료
8월 03, 2026

jina-reranker-v3.5: 하이브리드 어텐션과 자기 증류를 통한 더 빠른 리스트와이즈(Listwise) 재순위화(Reranker)

BEIR 벤치마크에서 Qwen3-Reranker-4B를 능가하고, v3 대비 최대 1.56배 빠른 속도로 재순위화(reranking)하며, 반정형 데이터 검색에서 9.6 nDCG@10 향상을 달성한 0.6B 규모의 리스트와이즈(listwise) 재순위화 모델(Reranker)입니다.
Jina AI
Jina AI • 11 분 소요
jinaai/jina-reranker-v3.5 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
jina-reranker-v3.5: An Efficient Listwise Reranker with Hybrid Attention and Self-Distillation
Listwise rerankers are the discriminative core of agentic retrieval pipelines, yet production deployment demands efficiency, domain robustness, and fluency on semi-structured data at the same time. We present jina-reranker-v3.5, a 0.6B-parameter listwise reranker that meets these demands together without sacrificing the cross-document comparison that makes its predecessor jina-reranker-v3 effective. jina-reranker-v3.5 keeps the last-but-not-late (LBNL) interaction of jina-reranker-v3 and reworks it along three axes. It replaces uniform global attention with a hybrid schedule of three sliding-window layers followed by two global layers, pinning the terminal layer to global as LBNL readout requires. It trains on a curated multi-domain mixture that spans legal, medical, financial, multilingual, and structured retrieval. It transfers quality through a three-stage self-distillation recipe in which a full-attention teacher sets an upper bound that a sparse-attention student then recovers under a staged adaptation protocol. jina-reranker-v3.5 reaches 63.20 nDCG@10 on BEIR, matching a 4B model at roughly 7x fewer parameters, and improves over jina-reranker-v3 on MIRACL and RTEB as well. Its largest gains come on semi-structured retrieval, where it lifts nDCG@10 by 9.6 points over jina-reranker-v3 and leads all rerankers of comparable size. The hybrid schedule further cuts listwise inference latency by up to 1.56x. We release the model weights on Hugging Face under a non-commercial license.
arXiv.orgChristina Nasika

오늘 우리는 0.6B 파라미터 리스트와이즈(listwise) 재정렬 모델인 jina-reranker-v3.5를 출시합니다. 이 모델은 jina-reranker-v3의 last but not late(LBNL) 상호작용 방식을 유지하면서도, 실제 기업 환경에서 검색하는 데이터에 대해 훨씬 빠르고 뛰어난 성능을 보여줍니다. 이 모델은 BEIR 벤치마크에서 63.20 nDCG@10을 기록하여 Qwen3-Reranker-4B보다 약 7배 적은 파라미터로 더 높은 성능을 달성했으며, 긴 문서에 대해 v3보다 최대 1.56배 더 빠르게 재정렬을 수행합니다. 특히 반구조화된(semi-structured) 데이터 검색에서 가장 큰 향상을 보였는데, 필드 제약이 있는 레코드에서 v3 대비 +9.6 nDCG@10의 성능 향상을 기록했습니다.

이번 업데이트는 세 가지 변경 사항을 통해 이루어졌습니다. 첫째, 대부분의 글로벌 레이어를 슬라이딩 윈도우로 대체하되 최종 레이어는 글로벌로 고정하는 하이브리드 어텐션 스케줄을 도입했습니다. 둘째, 법률, 의료, 금융, 다국어 및 구조화된 검색의 실패 사례를 중심으로 선별된 학습 데이터 조합을 사용했습니다. 셋째, 교사와 학생 모델의 크기는 같되 어텐션 패턴만 다른 3단계 자가 증류(self-distillation) 레시피를 적용했습니다.

4가지 벤치마크 영역에서 파라미터 수 대비 품질을 비교한 결과입니다. jina-reranker-v3.5는 4가지 영역 모두에서 파레토 최적(Pareto front)에 위치하며, 평가한 모델 중 이보다 크기가 작으면서 더 성능이 좋은 모델은 없습니다.

Scatter plot of nDCG@10 against parameter count on BEIR with a Pareto frontier line
13개 데이터셋에 대한 BEIR 영어 제로샷 검색 성능으로, jina-embeddings-v5-text-small이 도출한 상위 100개 후보를 재정렬한 후의 nDCG@10 수치입니다. 빨간 선은 파레토 최적선을 나타내며, 음영 영역은 다른 모델에 의해 지배되는 영역입니다(해당 영역 내의 모든 모델은 더 작거나, 더 좋거나, 혹은 둘 다인 다른 모델이 존재함을 의미). jina-reranker-v3.5는 63.20점을 기록하며 최적선 상에 위치하며, 이는 1.5B 크기의 mxbai-rerank-large-v2(62.45점)와 4B 크기의 Qwen3-Reranker-4B(62.28점)를 상회합니다. 평가한 더 큰 규모의 모델들 중 이보다 BEIR 성능이 뛰어난 모델은 없습니다.
Scatter plot of nDCG@10 against parameter count on MIRACL with a Pareto frontier line
18개 언어에 대한 MIRACL 다국어 검색 성능, 동일한 상위 100개 후보 재정렬 프로토콜을 사용했습니다. jina-reranker-v3.5는 74.11점으로 컴팩트 모델 중 최고의 점수를 기록하며 최적선의 0.6B 구간을 차지했고, Qwen3-Reranker-4B는 76.56점으로 4B 구간을 차지했습니다. jina-reranker-v3 대비 언어별 가장 큰 성능 향상은 요루바어(+4.4), 페르시아어(+3.1), 프랑스어(+3.0)에서 나타났습니다.
Scatter plot of nDCG@10 against parameter count on RTEB with a Pareto frontier line
법률, 금융, 프로그래밍 및 의료 말뭉치를 포함한 RTEB 전문 도메인 검색 성능입니다. jina-reranker-v3.5는 70.95점을 기록하여 같은 크기의 Qwen3-Reranker-0.6B(68.41점)와 1.5B 모델인 mxbai-rerank-large-v2(70.81점)를 모두 넘어섰습니다. 77.68점을 기록한 Qwen3-Reranker-4B와의 성능 차이는 일부 법률 및 의료 과제에 집중되어 있습니다.
Scatter plot of nDCG@10 against parameter count on Struct-IR with a Pareto frontier line
제어된 후보 풀 환경에서의 Struct-IR 반구조화 검색 성능입니다. 모든 정답 문서와 30개의 가장 어려운 1단계 방해 요소를 함께 주입하여, 측정 결과가 검색 커버리지가 아닌 필드 제약 기반의 판별력만을 격리하도록 했습니다. jina-reranker-v3.5는 48.3점을 기록하여 jina-reranker-v3 대비 9.6점 향상되었으며, 이는 이번 릴리스에서 가장 큰 단일 성능 향상입니다. 참고로 이 프로토콜은 SSRB 검색 리더보드와 직접 비교할 수 없습니다.

tag아키텍처

리스트와이즈 재정렬은 단일 순전파(forward pass)로 모든 후보의 점수를 매기므로, 100개 문서 리스트에 대한 전체 셀프 어텐션은 2차 함수적으로 증가하여 KV 캐시를 팽창시킵니다. 이에 대한 명확한 해결책은 슬라이딩 윈도우 어텐션입니다. 하지만 LBNL 상호작용 방식에서 이를 단순히 적용하면 모델 성능이 저하됩니다.

LBNL에서 질의(query)와 모든 후보는 하나의 인과적 시퀀스를 형성하며, 질의 벡터 모델 词元은 맨 마지막에 위치합니다. 이 질의는 문서 간 정보를 인식하는 표현을 구축하기 위해 첫 번째 후보까지 거슬러 올라가 어텐션을 수행해야 합니다. 유한한 윈도우는 이러한 의존성을 끊어버립니다. 따라서 우리는 최종 레이어를 항상 글로벌로 고정하여, 질의와 문서 벡터 모델 词元이 추출 시점에 전체 후보 컨텍스트를 관찰할 수 있도록 했습니다. 해당 레이어 하나만 글로벌로 유지하고 나머지를 슬라이딩 윈도우로 대체함으로써, 전체 글로벌 스택을 사용하지 않고도 공동 인코딩을 보존할 수 있었습니다.

나머지 27개 레이어에 대해서는 1L1G, 1L2G, 3L2G 및 5L1G 스케줄을 실험했습니다. 그 결과 3L2G가 최적의 선택으로 나타났습니다. 3개의 슬라이딩 윈도우 레이어와 2개의 글로벌 레이어를 반복하여 총 17개의 로컬 레이어와 11개의 글로벌 레이어를 구성했고, 1,024개 词元의 윈도우를 설정했습니다. 로컬 레이어는 어텐션 비용을 O(L²)에서 O(L·w)로 절감하며, 3단계마다 배치된 글로벌 레이어는 모든 깊이에서 장거리 후보 간 신호를 새로 고칩니다. 더 밀도가 높은 스케줄은 처리량 향상을 가져오지 못했으며, 더 공격적인 5L1G는 복잡한 다중 문서 작업에서 성능이 떨어지는 경향을 보였습니다.

Architecture diagram showing LBNL listwise encoding with a 3L2G hybrid backbone and the three-stage self-distillation pipeline
왼쪽: 3L2G 하이브리드 Qwen3-0.6B 백본 기반의 LBNL 리스트와이즈(listwise) 인코딩. 쿼리와 모든 후보는 하나의 인과적 컨텍스트를 공유하며, L 레이어는 1,024 词元 슬라이딩 윈도우를 사용하고, G 레이어는 글로벌하게 작동합니다. 마지막 레이어인 G*는 고정된 글로벌 레이어로, 후행 쿼리 向量模型이 전체 리스트를 확인할 수 있게 합니다. MLP가 공유 공간으로 투영하고 코사인 유사도가 순위를 결정합니다. 오른쪽: 3단계 레시피로, 1단계에서 완전 주의(full-attention) 교사 모델이 고정된 상태로 3단계를 가이드합니다.

tag어텐션 간극을 넘는 자기 증류(Self-distillation)

이곳의 증류 방식은 독특합니다. 우리는 대규모 모델을 소형 모델로 축소하는 것이 아닙니다. 교사 모델과 학생 모델 모두 0.6B이며, 오직 어텐션 패턴에서만 차이가 있습니다. 교사 모델은 이차 비용으로 전체 어텐션을 실행하고, 학생 모델은 3L2G를 실행합니다.

학생 모델에게 어텐션 마스크를 전환하도록 강제하면서 동시에 교사 모델의 출력을 맞추도록 하면 두 가지 모두에서 실패하게 됩니다. 따라서 이 레시피는 두 가지 압력을 분리합니다:

  • 1단계 — 완전 어텐션 교사 모델. 공개된 jina-reranker-v3 체크포인트에서 시작하여, 전체 v3.5 혼합 데이터셋에 대해 슬라이딩 윈도우 제한 없이 교사 모델을 완전히 미세 조정합니다. 이는 해당 파라미터 예산 내에서 품질의 상한선을 설정합니다.
  • 2단계 — 희소 어텐션(sparse-attention) 적응. 학생 모델은 1단계 가중치로 초기화하고 3L2G를 활성화합니다. 먼저 다른 모든 것을 고정한 채 어텐션 투영만 학습시켜, 완전 어텐션 하에서 학습된 표현을 방해하지 않으면서 정보 경로를 지정하도록 희소 마스크를 가르칩니다. 그다음 모든 가중치를 해제하여 학생 모델이 새로운 어텐션 기하구조에 재정렬되도록 합니다. 이 단계에서 학생 모델은 이미 배포 가능하고 더 빠르지만, BEIR, RTEB-legal 및 MIRACL에서는 교사 모델과의 간극이 여전히 존재합니다.
  • 3단계 — 교사 가이드 증류. 교사 모델을 고정한 상태에서 학생 모델을 네 가지 레벨로 동시에 정렬합니다: 소프트맥스로 정규화된 점수 분포에 대한 리스트와이즈 KL, 절대 점수에 대한 MSE, 마지막 레이어 은닉 상태에 대한 MSE, 투영된 向量模型에 대한 코사인 손실, 그리고 컨텍스트 내 유사도 및 분산 정규화 항목을 추가합니다.

순서가 중요합니다. 2단계만 수행하면 눈에 띄는 격차가 남는데, 이는 학생 모델이 교사 모델의 점수와 상태를 안전하게 모방하기 전에 더 약한 마스크 하에서 라우팅을 변경해야 하기 때문입니다. 3단계는 그 격차의 대부분을 복구하며, 이는 일단 기하구조가 적응되면 완전 어텐션의 용량이 희소 학생 모델로 전달될 수 있음을 시사합니다. 이 레시피는 3L2G를 위해 작성되었지만, 이 개요는 다른 어텐션 스케줄 불일치 문제에도 일반화될 수 있습니다.

tag학습 데이터

v3 혼합 데이터는 일반적인 검색은 잘 다루었지만 특수 도메인에는 취약했습니다. 데이터를 추가하는 대신 RTEB 및 STARK 개발 세트에 대해 오류 분석을 수행하고, 일반 모델이 실패하는 검색 패턴을 정확히 다루도록 각 새로운 샤드(shard)를 구축했습니다. 하드 네거티브(Hard negative)는 여러 검색기(BM25, Jina, BGE, GTE, E5, ColBERT)에서 동시에 추출하여 모델이 특정 검색기의 지름길을 학습하지 못하도록 했습니다.

법률 샤드는 EUR-Lex 다국어 데이터, CLERC, AILA, 캐나다 판례법, 스위스 사례 요약 및 EuroVoc를 결합했습니다. 법률 텍스트는 인용이 밀집되어 있고 길기 때문에 오버샘플링했습니다. 의료 샤드는 임상 용어와 엔티티가 많은 구절을 대상으로 합니다. 금융 샤드는 수치적 주장, 규제 언어 및 표를 인식하는 구절을 우선시합니다. 다국어 커버리지는 50개 이상의 언어로 된 WebFAQ, SWIM-IR 교차 언어 네거티브 및 Ruri-v3 일본어 쌍을 포함하여 MIRACL 및 mMARCO를 넘어 확장됩니다.

구조화된 데이터는 표준 벤치마크가 가정하는 자유 텍스트 분포 밖에 있기 때문에 가장 높은 샘플링 가중치를 부여받았습니다. 레코드와 표에 대한 관련성은 어휘적 중첩이 아니라 평등성, 수치 및 날짜 범위, 리스트 멤버십, 필드 간 논리적 조합에 달려 있습니다. 초기 실행에서 이 부분이 가장 뒤처졌기에 제약 조건이 많은 쌍을 직접 합성했습니다.

Pipeline diagram for generating constraint-heavy synthetic training data for structured retrieval
필드 제약 검색을 위한 합성 지도 데이터 생성 파이프라인. 앵커 레코드에서 유형이 지정된 제약 조건을 샘플링하고 대규모 모델(LLM)이 이를 쿼리로 의역하게 합니다. 그런 다음 제약이 있는 필드를 한두 개 변경하여 표면 형태는 동일하지만 제약을 위반하는 근사 중복 하드 네거티브를 구축합니다. 덴스 마이닝(Dense mining)은 추가 후보를 더하고, 대규모 모델(LLM) 판사가 진정한 일치를 승격시키고, 지나치게 광범위한 쿼리를 개선하며, 모호한 사례를 폐기하여 쿼리 생성에 다시 피드백합니다. 오른쪽 예시는 왜 어휘적 중첩이 여기서 쓸모없는지 보여줍니다: 긍정 사례와 하드 네거티브가 단일 필드를 제외하고는 동일한 문자열입니다.

tag실험 결과

모든 수치는 jina-embeddings-v5-text-small로부터 상위 100개 후보를 단일 통합 MTEB v2 파이프라인 하에서 重排器(Reranker)한 결과이므로, 벤더가 보고한 수치와는 약간 다를 수 있습니다. 데이터셋별 및 언어별 전체 표는 논문에 나와 있습니다.

모델파라미터BEIRMIRACLRTEBStruct-IR
jina-embeddings-v5-text-small (1단계)0.5B56.2665.1564.60–
mxbai-rerank-base-v20.5B59.5864.9061.4430.4
Qwen3-Reranker-0.6B0.6B56.9467.1268.4141.9
mxbai-rerank-large-v21.5B62.4569.6570.8143.0
Qwen3-Reranker-4B4.0B62.2876.5677.6855.6
jina-reranker-v30.6B62.1072.2068.0138.7
<strong>jina-reranker-v3.5</strong>0.6B63.2074.1170.9548.3

v3.5는 동일한 파라미터 수에서 모든 벤치마크 제품군에 걸쳐 v3보다 향상되었으며, 반구조화된 검색에서 가장 큰 이득을 보였습니다.

RTEB 이득은 혼합 데이터가 목표로 했던 분야에 집중되어 있습니다: AILA-Statute는 14.0 포인트, AILA-Case는 v3 대비 11.7 포인트 향상되었으며, FinQA는 테스트된 모델 중 최고치인 86.91을 달성했습니다. STARK에서 v3.5는 v3 대비 3가지 공식 지표 모두에서 향상되었으며 전체적으로 최고의 Hit@5를 기록했습니다.

Struct-IR에 대한 프로토콜 참고 사항입니다. 이 벤치마크는 스키마당 수백만 개의 객체를 인덱싱하며, 1단계 스키마 내 Recall@5는 약 0.04입니다. 따라서 종단간(end-to-end) 검색 후 重排器(Reranker) 과정은 거의 전적으로 재현율(recall)에 제한되어 있어 重排器(Reranker) 성능을 제대로 변별하지 못합니다. 대신 1단계에서 가장 어려운 30개의 방해 요소와 함께 모든 골드 문서를 삽입하여, 검색 커버리지로부터 필드 제약 식별력을 분리했습니다. 해당 풀에서의 수치는 SSRB 검색 리더보드와 비교할 수 없습니다.

tag효율성

단일 NVIDIA A100, 배치 크기 1, 상위 100개 리스트와이즈 입력, FlashAttention-2 기준으로 측정되었습니다.

Bar chart comparing mean listwise reranking latency of v3 and v3.5 on BEIR Natural Questions
단기 컨텍스트 체계, BEIR Natural Questions, 254개의 시간 측정 쿼리에 대해 평균 쿼리 및 문서 길이는 각각 10.3 词元과 145.5 词元입니다. 상위 100개 리스트와이즈 重排器(Reranker)의 평균 지연 시간은 371ms에서 305ms로 감소하여 1.22배 속도 향상을 보였으며, 문서 처리량은 초당 270개에서 328개로 증가했습니다.
Bar chart comparing mean listwise reranking latency of v3 and v3.5 on RTEB AILACasedocs
장기 컨텍스트 체계, RTEB AILACasedocs, 48개의 시간 측정 쿼리에 대해 평균 쿼리 및 문서 길이는 각각 689.8 词元과 1,904.0 词元입니다. 평균 지연 시간은 16.1초에서 10.3초로 감소하여 1.56배 속도 향상을 보였으며, 프리필(prefill) 처리량은 초당 11.9k 词元에서 18.6k 词元으로 증가했습니다. 하이브리드 어텐션은 후보 구절이 길 때 가장 효과적입니다.

운영 환경에서의 리스트와이즈 重排器(Reranker)는 새로운 후보 세트에 대한 단일 프리필 작업이 지배적이므로, 이러한 지연 시간 감소는 고정된 서빙 예산 내에서 더 긴 후보 리스트와 더 큰 문서를 처리할 수 있음을 의미합니다.

tag시작하기

tagJina Search Foundation API를 통한 방법

curl -X POST \
  https://api.jina.ai/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ***" \
  -d '{
  "model": "jina-reranker-v3.5",
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "documents": [
    "...",
    "..."
  ],
  "return_documents": false
}'

tagElastic Inference Service를 통한 방법

jina-reranker-v3.5는 Stack 9.3부터 Elastic Inference Service(EIS)에서 사용할 수 있으므로, 모델을 직접 호스팅할 필요 없이 관리형 GPU에서 重排器(Reranker)를 수행할 수 있습니다. 모델을 참조하는 추론 엔드포인트를 생성한 다음, 다른 rerank 작업과 마찬가지로 호출하면 됩니다.

PUT _inference/rerank/eis-jina-reranker-v3-5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-reranker-v3.5"
  }
}
POST _inference/rerank/eis-jina-reranker-v3-5
{
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "input": [
    "...",
    "..."
  ]
}

응답은 관련성 순으로 정렬된 rerank 배열을 반환하며, 각 항목은 후보의 원래 인덱스와 점수를 포함합니다. 이는 표준 추론 엔드포인트이므로, inference_id는 검색 쿼리에서 text_similarity_reranker 검색기에서 직접 참조할 수 있습니다.

tagTransformers를 통한 방법

from transformers import AutoModel

model = AutoModel.from_pretrained(
    'jinaai/jina-reranker-v3.5',
    dtype="auto",
    trust_remote_code=True,
)
model.eval()

query = "What are the health benefits of green tea?"
documents = [
    "Green tea contains catechins that may help reduce inflammation.",
    "El precio del cafe ha aumentado un 20% este ano.",
    "绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
    "Le the vert est riche en antioxydants.",
]

for r in model.rerank(query, documents):
    print(f"{r['relevance_score']:.4f}  {r['document'][:70]}")

tag결론

jina-reranker-v3.5의 실질적인 장점은 명확하고 검증 가능합니다. 0.6B 파라미터 규모에서 타겟팅된 학습을 통해 4B 규모의 범용 재순위기(Reranker)와의 성능 격차를 대부분 해소했으며, BEIR 벤치마크에서는 그 격차를 완전히 메우는 동시에 기존 모델보다 더 빠른 속도를 제공합니다. 기업용 검색 시스템의 경우, 단순히 가장 큰 모델을 기본값으로 사용하기보다는 소형 백본 모델에 집중적인 지도 학습을 수행하는 것이 유리하다는 점을 시사합니다.

두 가지 한계점을 분명히 밝힙니다. 리스트 방식(Listwise) 재순위기는 포인트 방식(Pointwise)이나 후기 상호작용(Late-interaction) 모델이 피하는 입력 제약 사항, 특히 후보 개수와 전체 후보 길이에 대한 고정된 상한선을 여전히 가지고 있습니다. 또한 RTEB의 법률 및 의료 분야 작업, 통제된 풀(Controlled-pool) 환경의 Struct-IR, 그리고 리소스가 부족한 MIRACL 언어 분야에서는 4B Qwen 모델과의 유의미한 성능 격차가 남아 있습니다. 이러한 부분은 해결하기 어려운 사례들이며, 평균적인 수치 뒤에 숨기지 않고 명확히 명시하고자 합니다.

범주:
star
추천
보도 자료
rss_feed

자세히 보기
5월 12, 2026 • 7 분 소요
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
2월 19, 2026 • 7 분 소요
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
12월 04, 2025 • 7 분 소요
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.