Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Arquitectura del modelo
Empezando
Conclusión
star
Presentado
presione soltar
octubre 03, 2025

Jina Reranker v3: Reranker Listwise de 0.6B para la recuperación multilingüe SOTA

Nuevo reranker listwise de 0.6B parámetros que considera la consulta y todos los documentos candidatos en una sola ventana de contexto.
Jina AI • 7 minutos de lectura
jinaai/jina-reranker-v3 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
jina-reranker-v3: Last but Not Late Interaction for Document Reranking
jina-reranker-v3 is a 0.6B parameter multilingual document reranker that introduces a novel last but not late interaction. Unlike late interaction models such as ColBERT that perform separate encoding followed by multi-vector matching, our approach conducts causal self-attention between query and documents within the same context window, enabling rich cross-document interactions before extracting contextual embeddings from the last token of each document. This compact architecture achieves state-of-the-art BEIR performance with 61.94 nDCG@10 while being ten times smaller than generative listwise rerankers.
arXiv.orgFeng Wang

Nos complace anunciar el lanzamiento de jina-reranker-v3, nuestro 重排器 de última generación que ofrece un rendimiento de vanguardia en los puntos de referencia de recuperación multilingüe. Este 重排器 de documentos de 0.6B parámetros introduce una nueva interacción última pero no tardía que adopta un enfoque fundamentalmente diferente al de los métodos existentes. jina-reranker-v3 funciona listwise: aplica atención causal entre la consulta y todos los documentos candidatos dentro de una única ventana de contexto, lo que permite interacciones ricas entre documentos antes de extraer los 向量模型 contextuales del token final de cada documento. Nuestro nuevo modelo alcanza 61.94 nDCG@10 en BEIR, superando a Qwen3-Reranker-4B y siendo 6 veces más pequeño.

Modelo Tamaño BEIR MIRACL MKQA CoIR
jina-reranker-v3 0.6B 61.94 66.83 67.92 70.64
jina-reranker-v2 0.3B 57.06 63.65 67.90 56.14
jina-reranker-m0 2.4B 58.95 66.75 68.19 63.55
bge-reranker-v2-m3 0.6B 56.51 69.32 67.88 36.28
mxbai-rerank-base-v2 0.5B 58.40 55.32 64.24 65.71
mxbai-rerank-large-v2 1.5B 61.44 57.94 67.06 70.87
Qwen3-Reranker-0.6B 0.6B 56.28 57.70 65.34 65.18
Qwen3-Reranker-4B 4.0B 61.16 67.52 67.52 73.91
jina-code-embeddings-0.5b 0.5B - - - 73.94
Rendimiento de la recuperación en inglés en BEIR, medido por nDCG@10. Todas las puntuaciones son nuestras ejecuciones basadas en los 100 mejores resultados de jina-embeddings-v3 como el recuperador de primera etapa. Evaluamos tres variantes de jina-reranker-v3: documentos ordenados por puntuaciones de relevancia descendentes, puntuaciones ascendentes y permutación aleatoria. La evaluación muestra que v3 mantiene un rendimiento relativamente estable en diferentes ordenamientos de entrada, lo que sugiere mecanismos de autoatención robustos que pueden procesar eficazmente los documentos independientemente de su disposición inicial.
La evaluación de MIRACL en 18 idiomas diversos demuestra la consistencia multilingüe de jina-reranker-v3 a pesar de su arquitectura compacta. Los idiomas que evaluamos incluyen inglés, chino, español, árabe, francés, ruso, alemán, japonés, indonesio, hindi, bengalí, coreano, swahili, telugu, tailandés, persa/farsi, yoruba y finlandés.
Rendimiento de la recuperación multilingüe en el MKQA, medido por Recall@10. Los idiomas que evaluamos incluyen inglés, chino (simplificado), español, árabe, portugués, ruso, japonés, alemán, francés, coreano, vietnamita, italiano, turco, polaco, tailandés, holandés, malayo, chino (tradicional), sueco, hebreo, húngaro, chino (Hong Kong), danés, noruego, finlandés y jemer.

tagArquitectura del modelo

jina-reranker-v3 está construido sobre la base de Qwen3-0.6B, un modelo transformador de solo decodificador con autoatención causal. El modelo procesa varios documentos y consultas simultáneamente, extrayendo 向量模型 contextuales en las posiciones de token designadas para un cálculo eficiente de la similitud.

Arquitectura de jina-reranker-v3 que muestra la base del transformador con posiciones de token especiales para la extracción de 向量模型. El modelo procesa varios documentos y consultas en una ventana de contexto, extrayendo 向量模型 contextuales en las posiciones de token designadas para el cálculo de la similitud.
Parámetro Valor
Parámetros totales 0.6B
Parámetros sin 向量模型 0.44B
Tamaño oculto 1,024
Número de capas 28
Cabezales de atención (Q/KV) 16/8 (GQA)
Longitud del contexto 131,072
Proyector MLP 1024→512→256
Tamaño final de 向量模型 256

Dada una consulta y un conjunto de documentos candidatos, jina-reranker-v3 procesa la tarea de 重排 con una plantilla de 提示词 especializada que permite interacciones entre documentos dentro de una sola pasada hacia adelante. La construcción de la entrada sigue un formato específico:

<|im_start|>system
You are a search relevance expert who can determine
a ranking of passages based on their relevance to the query.
<|im_end|>

<|im_start|>user
I will provide you with k passages, each indicated by a numerical identifier.
Rank the passages based on their relevance to query: [QUERY]

<passage id="1">
[DOCUMENT_1]<|doc_emb|>
</passage>
<passage id="2">
[DOCUMENT_2]<|doc_emb|>
</passage>
...
<passage id="k">
[DOCUMENT_k]<|doc_emb|>
</passage>

<query>
[QUERY]<|query_emb|>
</query>
<|im_end|>

<|im_start|>assistant
<think></think>

Cada documento está envuelto en etiquetas de pasaje con ID secuenciales, lo que permite límites claros entre documentos dentro de la ventana de contexto compartido. El modelo procesa hasta 64 documentos simultáneamente dentro de su capacidad de contexto de 131K tokens. Para colecciones de documentos más grandes, el procesamiento se realiza en lotes manteniendo la coherencia de la consulta entre lotes.

La consulta aparece dos veces en la estructura de entrada: una vez al principio para las instrucciones de la tarea y otra al final para el procesamiento final de la atención. Esta doble colocación permite que la posición final de la consulta atienda a todos los documentos precedentes a través de la atención causal. Dos tokens especiales críticos marcan las posiciones de extracción de 向量模型: el token <|doc_emb|> se coloca después de cada documento para marcar los puntos de extracción de 向量模型 del documento, mientras que el token <|query_emb|> se coloca después de la consulta final para marcar el punto de extracción de 向量模型 de la consulta. Estos 向量模型 capturan tanto la semántica local del documento como el contexto global entre documentos a través del mecanismo compartido de autoatención causal.

Llamamos a esta interacción consulta-documento "última pero no tardía". Es "última" porque <|doc_emb|> se coloca como el token final de cada documento. Es "no tardía" porque, a diferencia de modelos de interacción tardía como ColBERT que codifican por separado los documentos antes de la coincidencia multivectorial, permitimos interacciones consulta-documento y documento-documento dentro de la misma ventana de contexto durante el paso hacia adelante.

Finalmente, un proyector MLP de dos capas con activación ReLU mapea los estados ocultos de 1024 dimensiones a un espacio de clasificación de 256 dimensiones. La puntuación de relevancia se calcula utilizando la similitud del coseno entre el vector modelo de consulta proyectado y cada vector modelo de documento proyectado. Esto produce una puntuación de relevancia para cada documento en el conjunto de entrada.

tagEmpezando

tagA través de la API

La forma más sencilla de usar jina-reranker-v3 es a través de nuestra API Search Foundation.

curl -X POST \
  https://api.jina.ai/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer JINA_API_KEY" \
  -d '{
  "model": "jina-reranker-v3",
  "query": "slm markdown",
  "documents": [
    ...
  ],
  "return_documents": false
}'
{
  "model":"jina-reranker-v3",
  "usage": {
    "total_tokens":2813
  },
  "results":[
    {
      "index":1,
      "relevance_score":0.9310624287463884
    },
    {
      "index":4,
      "relevance_score":0.8982678574191957
    },
    {
      "index":0,
      "relevance_score":0.890233167219021
    },
    ...
  ]
}

El campo relevance_score indica la relevancia de cada documento para la consulta, con puntuaciones más altas que indican una mayor relevancia.

tagA través de transformers

from transformers import AutoModel

model = AutoModel.from_pretrained(
    'jinaai/jina-reranker-v3',
    dtype="auto",
    trust_remote_code=True,
)
model.eval()

Ahora puede usar la función rerank del modelo para calcular las puntuaciones de relevancia de una consulta y una lista de documentos:

query = "What are the health benefits of green tea?"
documents = [
    "Green tea contains antioxidants called catechins that may help reduce inflammation and protect cells from damage.",
    "El precio del café ha aumentado un 20% este año debido a problemas en la cadena de suministro.",
    "Studies show that drinking green tea regularly can improve brain function and boost metabolism.",
    "Basketball is one of the most popular sports in the United States.",
    "绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险,还有助于控制体重。",
    "Le thé vert est riche en antioxydants et peut améliorer la fonction cérébrale.",
]

# Rerank documents
results = model.rerank(query, documents)

# Results are sorted by relevance score (highest first)
for result in results:
    print(f"Score: {result['relevance_score']:.4f}")
    print(f"Document: {result['document'][:100]}...")
    print()

tagConclusión

jina-reranker-v3 es un nuevo重排器multilingüe listwise de 0.6B parámetros que introduce la interacción last but not late para una重排器de documentos eficiente. Los documentos pueden atenderse entre sí durante la codificación, estableciendo una interacción que informa la clasificación final.

Una de las principales preocupaciones es si tal interacción es resistente a la permutación de entrada; es decir, si barajamos el orden de entrada, ¿se mantendrán las clasificaciones igual? Probamos esto con una consulta contra 110 documentos candidatos usando permutación aleatoria y trazamos la varianza en cada posición de rango en la figura a continuación.

El gráfico de estabilidad de rango visualiza la consistencia con la que los documentos aparecen en posiciones de rango específicas a través de 1,000 permutaciones de entrada aleatorias. El eje y representa la varianza de estabilidad como un porcentaje, donde 0% indica una estabilidad perfecta (el mismo documento siempre aparece en este rango) y 100% indica la varianza máxima (casi todos los documentos aparecieron en este rango a través de permutaciones). El eje x muestra las posiciones de rango de 1 a 110.

El hallazgo crítico es que las posiciones de rango superior muestran una excelente estabilidad. Los rangos 1-10 exhiben una varianza mínima, con los documentos más relevantes clasificados consistentemente en la parte superior independientemente del orden de entrada. Esto es crucial para nDCG@10 y métricas top-k similares. Los documentos irrelevantes permanecen consistentemente en la parte inferior, creando una clara separación entre el contenido relevante e irrelevante.

La sección central muestra un intercambio de posición significativo, que es esperado y aceptable. El modelo utiliza autoatención causal y codifica diferente información contextual basada en lo que aparece antes de ellos en la secuencia.

En la práctica, donde nos preocupamos por los resultados superiores, tal comportamiento es completamente aceptable. Nuestra evaluación muestra que jina-reranker-v3 supera a nuestras generaciones anteriores, incluyendo jina-reranker-v2-base-multilingual y jina-colbert-v2, así como alternativas mucho más grandes como Qwen3-Reranker-4B y jina-reranker-m0 confirmando aún más esto.

Categorías:
star
Presentado
presione soltar
rss_feed

Leer más
agosto 03, 2026 • 11 minutos de lectura
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
mayo 12, 2026 • 7 minutos de lectura
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
febrero 19, 2026 • 7 minutos de lectura
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.