Nos complace anunciar el lanzamiento de jina-reranker-v3, nuestro 重排器 de última generación que ofrece un rendimiento de vanguardia en los puntos de referencia de recuperación multilingüe. Este 重排器 de documentos de 0.6B parámetros introduce una nueva interacción última pero no tardía que adopta un enfoque fundamentalmente diferente al de los métodos existentes. jina-reranker-v3 funciona listwise: aplica atención causal entre la consulta y todos los documentos candidatos dentro de una única ventana de contexto, lo que permite interacciones ricas entre documentos antes de extraer los 向量模型 contextuales del token final de cada documento. Nuestro nuevo modelo alcanza 61.94 nDCG@10 en BEIR, superando a Qwen3-Reranker-4B y siendo 6 veces más pequeño.
| Modelo | Tamaño | BEIR | MIRACL | MKQA | CoIR |
|---|---|---|---|---|---|
| jina-reranker-v3 | 0.6B | 61.94 | 66.83 | 67.92 | 70.64 |
| jina-reranker-v2 | 0.3B | 57.06 | 63.65 | 67.90 | 56.14 |
| jina-reranker-m0 | 2.4B | 58.95 | 66.75 | 68.19 | 63.55 |
| bge-reranker-v2-m3 | 0.6B | 56.51 | 69.32 | 67.88 | 36.28 |
| mxbai-rerank-base-v2 | 0.5B | 58.40 | 55.32 | 64.24 | 65.71 |
| mxbai-rerank-large-v2 | 1.5B | 61.44 | 57.94 | 67.06 | 70.87 |
| Qwen3-Reranker-0.6B | 0.6B | 56.28 | 57.70 | 65.34 | 65.18 |
| Qwen3-Reranker-4B | 4.0B | 61.16 | 67.52 | 67.52 | 73.91 |
| jina-code-embeddings-0.5b | 0.5B | - | - | - | 73.94 |



tagArquitectura del modelo
jina-reranker-v3 está construido sobre la base de Qwen3-0.6B, un modelo transformador de solo decodificador con autoatención causal. El modelo procesa varios documentos y consultas simultáneamente, extrayendo 向量模型 contextuales en las posiciones de token designadas para un cálculo eficiente de la similitud.
| Parámetro | Valor |
|---|---|
| Parámetros totales | 0.6B |
| Parámetros sin 向量模型 | 0.44B |
| Tamaño oculto | 1,024 |
| Número de capas | 28 |
| Cabezales de atención (Q/KV) | 16/8 (GQA) |
| Longitud del contexto | 131,072 |
| Proyector MLP | 1024→512→256 |
| Tamaño final de 向量模型 | 256 |
Dada una consulta y un conjunto de documentos candidatos, jina-reranker-v3 procesa la tarea de 重排 con una plantilla de 提示词 especializada que permite interacciones entre documentos dentro de una sola pasada hacia adelante. La construcción de la entrada sigue un formato específico:
<|im_start|>system
You are a search relevance expert who can determine
a ranking of passages based on their relevance to the query.
<|im_end|>
<|im_start|>user
I will provide you with k passages, each indicated by a numerical identifier.
Rank the passages based on their relevance to query: [QUERY]
<passage id="1">
[DOCUMENT_1]<|doc_emb|>
</passage>
<passage id="2">
[DOCUMENT_2]<|doc_emb|>
</passage>
...
<passage id="k">
[DOCUMENT_k]<|doc_emb|>
</passage>
<query>
[QUERY]<|query_emb|>
</query>
<|im_end|>
<|im_start|>assistant
<think></think>Cada documento está envuelto en etiquetas de pasaje con ID secuenciales, lo que permite límites claros entre documentos dentro de la ventana de contexto compartido. El modelo procesa hasta 64 documentos simultáneamente dentro de su capacidad de contexto de 131K tokens. Para colecciones de documentos más grandes, el procesamiento se realiza en lotes manteniendo la coherencia de la consulta entre lotes.
La consulta aparece dos veces en la estructura de entrada: una vez al principio para las instrucciones de la tarea y otra al final para el procesamiento final de la atención. Esta doble colocación permite que la posición final de la consulta atienda a todos los documentos precedentes a través de la atención causal. Dos tokens especiales críticos marcan las posiciones de extracción de 向量模型: el token <|doc_emb|> se coloca después de cada documento para marcar los puntos de extracción de 向量模型 del documento, mientras que el token <|query_emb|> se coloca después de la consulta final para marcar el punto de extracción de 向量模型 de la consulta. Estos 向量模型 capturan tanto la semántica local del documento como el contexto global entre documentos a través del mecanismo compartido de autoatención causal.
Llamamos a esta interacción consulta-documento "última pero no tardía". Es "última" porque <|doc_emb|> se coloca como el token final de cada documento. Es "no tardía" porque, a diferencia de modelos de interacción tardía como ColBERT que codifican por separado los documentos antes de la coincidencia multivectorial, permitimos interacciones consulta-documento y documento-documento dentro de la misma ventana de contexto durante el paso hacia adelante.
Finalmente, un proyector MLP de dos capas con activación ReLU mapea los estados ocultos de 1024 dimensiones a un espacio de clasificación de 256 dimensiones. La puntuación de relevancia se calcula utilizando la similitud del coseno entre el vector modelo de consulta proyectado y cada vector modelo de documento proyectado. Esto produce una puntuación de relevancia para cada documento en el conjunto de entrada.
tagEmpezando
tagA través de la API
La forma más sencilla de usar jina-reranker-v3 es a través de nuestra API Search Foundation.
curl -X POST \
https://api.jina.ai/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer JINA_API_KEY" \
-d '{
"model": "jina-reranker-v3",
"query": "slm markdown",
"documents": [
...
],
"return_documents": false
}'{
"model":"jina-reranker-v3",
"usage": {
"total_tokens":2813
},
"results":[
{
"index":1,
"relevance_score":0.9310624287463884
},
{
"index":4,
"relevance_score":0.8982678574191957
},
{
"index":0,
"relevance_score":0.890233167219021
},
...
]
}El campo relevance_score indica la relevancia de cada documento para la consulta, con puntuaciones más altas que indican una mayor relevancia.
tagA través de transformers
from transformers import AutoModel
model = AutoModel.from_pretrained(
'jinaai/jina-reranker-v3',
dtype="auto",
trust_remote_code=True,
)
model.eval()Ahora puede usar la función rerank del modelo para calcular las puntuaciones de relevancia de una consulta y una lista de documentos:
query = "What are the health benefits of green tea?"
documents = [
"Green tea contains antioxidants called catechins that may help reduce inflammation and protect cells from damage.",
"El precio del café ha aumentado un 20% este año debido a problemas en la cadena de suministro.",
"Studies show that drinking green tea regularly can improve brain function and boost metabolism.",
"Basketball is one of the most popular sports in the United States.",
"绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险,还有助于控制体重。",
"Le thé vert est riche en antioxydants et peut améliorer la fonction cérébrale.",
]
# Rerank documents
results = model.rerank(query, documents)
# Results are sorted by relevance score (highest first)
for result in results:
print(f"Score: {result['relevance_score']:.4f}")
print(f"Document: {result['document'][:100]}...")
print()
tagConclusión
jina-reranker-v3 es un nuevo重排器multilingüe listwise de 0.6B parámetros que introduce la interacción last but not late para una重排器de documentos eficiente. Los documentos pueden atenderse entre sí durante la codificación, estableciendo una interacción que informa la clasificación final.
Una de las principales preocupaciones es si tal interacción es resistente a la permutación de entrada; es decir, si barajamos el orden de entrada, ¿se mantendrán las clasificaciones igual? Probamos esto con una consulta contra 110 documentos candidatos usando permutación aleatoria y trazamos la varianza en cada posición de rango en la figura a continuación.

El hallazgo crítico es que las posiciones de rango superior muestran una excelente estabilidad. Los rangos 1-10 exhiben una varianza mínima, con los documentos más relevantes clasificados consistentemente en la parte superior independientemente del orden de entrada. Esto es crucial para nDCG@10 y métricas top-k similares. Los documentos irrelevantes permanecen consistentemente en la parte inferior, creando una clara separación entre el contenido relevante e irrelevante.
La sección central muestra un intercambio de posición significativo, que es esperado y aceptable. El modelo utiliza autoatención causal y codifica diferente información contextual basada en lo que aparece antes de ellos en la secuencia.
En la práctica, donde nos preocupamos por los resultados superiores, tal comportamiento es completamente aceptable. Nuestra evaluación muestra que jina-reranker-v3 supera a nuestras generaciones anteriores, incluyendo jina-reranker-v2-base-multilingual y jina-colbert-v2, así como alternativas mucho más grandes como Qwen3-Reranker-4B y jina-reranker-m0 confirmando aún más esto.








