

Hoy lanzamos jina-reranker-v3.5, un reordenador (reranker) listwise de 0,6 mil millones de parámetros que mantiene la interacción last but not late (la última pero no tardía) de jina-reranker-v3 y lo hace más rápido y mucho más capaz en los datos que las empresas realmente buscan. Alcanza 63,20 nDCG@10 en BEIR, superando a Qwen3-Reranker-4B con aproximadamente 7 veces menos parámetros, y reordena hasta 1,56 veces más rápido que la v3 en documentos largos. Su mayor salto se encuentra en la recuperación semiestructurada: +9,6 nDCG@10 sobre la v3 en registros con restricciones de campo.
Tres cambios nos han permitido lograrlo. Un esquema de atención híbrido que sustituye la mayoría de las capas globales por ventanas deslizantes mientras fija la capa terminal como global. Una mezcla de entrenamiento curada a partir de los fallos en recuperación legal, médica, financiera, multilingüe y estructurada. Y una receta de auto-destilación de tres etapas donde el profesor y el estudiante tienen el mismo tamaño y solo difieren en el patrón de atención.
Calidad frente al recuento de parámetros en los cuatro regímenes de referencia. jina-reranker-v3.5 se encuentra en la frontera de Pareto en los cuatro: ningún modelo que hayamos evaluado es a la vez más pequeño y mejor.

mxbai-rerank-large-v2 de 1,5 mil millones a 62,45 y el Qwen3-Reranker-4B de 4 mil millones a 62,28. Ningún modelo más grande que hayamos evaluado aporta una calidad superior en BEIR.
Qwen3-Reranker-4B ocupa la esquina de 4 mil millones en 76,56. Las mayores ganancias por idioma sobre jina-reranker-v3 se obtienen en yoruba (+4,4), farsi (+3,1) y francés (+3,0).
Qwen3-Reranker-0.6B de igual tamaño en 68,41 como al mxbai-rerank-large-v2 de 1,5 mil millones en 70,81, operando a 0,6 mil millones. La distancia restante hasta el Qwen3-Reranker-4B en 77,68 se concentra en un puñado de tareas legales y médicas.
tagArquitectura
El reordenamiento (reranking) listwise puntúa a cada candidato en una única pasada directa (forward pass), por lo que la auto-atención completa sobre una lista de 100 documentos crece de forma cuadrática e infla la caché KV. La solución obvia es la atención de ventana deslizante. Bajo la interacción LBNL, la solución obvia rompe el modelo.
En LBNL, la consulta y todos los candidatos forman una secuencia causal, y el token de incrustación (向量模型) de la consulta se sitúa al final. Tiene que atender hasta el primer candidato para construir una representación consciente entre documentos. Una ventana finita corta esa dependencia. Por lo tanto, fijamos la capa final como global en todo momento, de modo que los tokens de incrustación de consulta y documentos observen todo el contexto de los candidatos en el punto de extracción. Sustituir esa única capa por una ventana deslizante degrada severamente el reordenamiento listwise; mantener solo esa capa global preserva la codificación conjunta sin una pila totalmente global.
Para las 27 capas restantes, exploramos los esquemas 1L1G, 1L2G, 3L2G y 5L1G. Ganó 3L2G: tres capas de ventana deslizante seguidas de dos capas globales, repetidas, dando 17 capas locales y 11 globales con una ventana de 1.024 词元. Las capas locales reducen el coste de atención de O(L²) a O(L·w), mientras que las capas globales cada tres pasos refrescan la señal a largo plazo entre candidatos en cada profundidad. Los esquemas más densos no aportaron mayor rendimiento; la tendencia de 5L1G fue peor en tareas complejas de múltiples documentos.

tagAutodestilación a través de un vacío de atención
La destilación aquí es inusual. No reducimos un modelo grande a uno pequeño. Tanto el profesor como el alumno son de 0.6B y solo difieren en el patrón de atención. El profesor ejecuta atención completa a un costo cuadrático; el alumno ejecuta 3L2G.
Forzar a un alumno a cambiar las máscaras de atención y hacer coincidir las salidas del profesor al mismo tiempo hace que falle en ambos, por lo que la receta desacopla ambas presiones:
- Etapa I — Profesor de atención completa. Partiendo del checkpoint público de jina-reranker-v3, ajustamos completamente a un profesor sin restricciones de ventana deslizante en la mezcla v3.5 completa. Esto establece el límite de calidad con este presupuesto de parámetros.
- Etapa II — Adaptación de atención dispersa. El alumno se inicializa a partir de los pesos de la Etapa I y activa 3L2G. Primero entrenamos solo las proyecciones de atención con todo lo demás congelado, enseñando a las máscaras dispersas a enrutar la información sin alterar las representaciones aprendidas bajo atención completa. Luego descongelamos todo para que el alumno se realinee con la nueva geometría de atención. El alumno ya es desplegable y más rápido aquí, pero persiste una brecha constante con respecto al profesor en BEIR, RTEB-legal y MIRACL.
- Etapa III — Destilación guiada por el profesor. Con el profesor congelado, alineamos al alumno en cuatro niveles simultáneamente: un KL listwise sobre distribuciones de puntuación normalizadas por softmax, un MSE sobre puntuaciones absolutas, un MSE sobre los estados ocultos de la última capa y una pérdida de coseno sobre los embeddings proyectados, además de regularizadores de similitud y dispersión en el contexto.
El orden importa. La Etapa II por sí sola deja una brecha notable porque el alumno debe cambiar su enrutamiento bajo una máscara más débil antes de poder imitar de forma segura las puntuaciones y estados del profesor. La Etapa III recupera entonces la mayor parte de esa brecha, lo que indica que la capacidad de atención completa se transfiere a un alumno disperso una vez que la geometría se ha adaptado. La receta está escrita para 3L2G, pero el esquema se generaliza a otros desajustes en el cronograma de atención.
tagDatos de entrenamiento
La mezcla v3 cubría bien la recuperación general pero mal los dominios especializados. En lugar de añadir más datos, realizamos un análisis de errores en los conjuntos de desarrollo de RTEB y STARK y construimos cada nuevo fragmento para cubrir exactamente los patrones de recuperación en los que fallan los modelos generales. Los ejemplos negativos difíciles (hard negatives) provienen de varios recuperadores a la vez (BM25, Jina, BGE, GTE, E5, ColBERT) para que el modelo no pueda aprender los atajos de un solo recuperador.
El fragmento legal combina EUR-Lex multilingüe, CLERC, AILA, jurisprudencia canadiense, resumen de casos suizos y EuroVoc, sobremuestreados porque el texto legal es denso en citas y extenso. El fragmento médico se centra en la redacción clínica y los pasajes cargados de entidades. El fragmento financiero prioriza las afirmaciones numéricas, el lenguaje regulatorio y los pasajes que comprenden tablas. La cobertura multilingüe se extiende más allá de MIRACL y mMARCO con WebFAQ en más de 50 idiomas, negativos translingüísticos de SWIM-IR y pares en japonés de Ruri-v3.
Los datos estructurados obtuvieron el mayor peso de muestreo, ya que se sitúan fuera de la distribución de texto libre que asumen los benchmarks estándar. La relevancia sobre registros y tablas depende de la igualdad, límites numéricos y de fecha, pertenencia a listas y combinaciones lógicas entre campos, no de la superposición léxica. Las primeras ejecuciones tuvieron un peor desempeño aquí, por lo que sintetizamos pares con restricciones complejas directamente.

tagResultados experimentales
Todas las cifras reordenan (rerank) los 100 mejores candidatos de jina-embeddings-v5-text-small bajo un pipeline unificado de MTEB v2, por lo que pueden diferir ligeramente de las cifras reportadas por el proveedor. Las tablas completas por dataset y por idioma se encuentran en el artículo.
| Modelo | Parámetros | BEIR | MIRACL | RTEB | Struct-IR |
|---|---|---|---|---|---|
| jina-embeddings-v5-text-small (1ª etapa) | 0.5B | 56.26 | 65.15 | 64.60 | – |
| mxbai-rerank-base-v2 | 0.5B | 59.58 | 64.90 | 61.44 | 30.4 |
| Qwen3-Reranker-0.6B | 0.6B | 56.94 | 67.12 | 68.41 | 41.9 |
| mxbai-rerank-large-v2 | 1.5B | 62.45 | 69.65 | 70.81 | 43.0 |
| Qwen3-Reranker-4B | 4.0B | 62.28 | 76.56 | 77.68 | 55.6 |
| jina-reranker-v3 | 0.6B | 62.10 | 72.20 | 68.01 | 38.7 |
| <strong>jina-reranker-v3.5</strong> | 0.6B | 63.20 | 74.11 | 70.95 | 48.3 |
v3.5 mejora a v3 en toda la familia de benchmarks con el mismo número de parámetros, siendo la mayor ganancia en la recuperación semiestructurada.
Las ganancias en RTEB se concentran donde se dirigió la mezcla: AILA-Statute mejora 14.0 puntos y AILA-Case 11.7 sobre v3, y FinQA alcanza 86.91, el mejor de todos los modelos probados. En STARK, v3.5 mejora a v3 en las tres métricas oficiales y obtiene el mejor Hit@5 en general.
Una nota de protocolo sobre Struct-IR. El benchmark indexa millones de objetos por esquema y el Recall@5 de primera etapa en el esquema es de alrededor de 0.04, por lo que la recuperación de extremo a extremo está casi totalmente limitada por el recall y distingue mal a los Re-rankers. En su lugar, inyectamos todos los documentos correctos (gold) junto con los 30 distractores más difíciles de la primera etapa, lo que aísla la discriminación restringida por campos de la cobertura de recuperación. Las cifras bajo ese grupo no son comparables con la tabla de clasificación de recuperación SSRB.
tagEficiencia
Medido en una sola NVIDIA A100, tamaño de lote 1, entradas listwise de 100, FlashAttention-2.


Debido a que el reordenamiento listwise en producción está dominado por un solo prefill sobre un nuevo conjunto de candidatos, estas reducciones se traducen directamente en listas de candidatos más largas y documentos más grandes con un presupuesto de servicio fijo.
tagPrimeros pasos
tagA través de la API de Jina Search Foundation
curl -X POST \
https://api.jina.ai/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ***" \
-d '{
"model": "jina-reranker-v3.5",
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"documents": [
"...",
"..."
],
"return_documents": false
}'tagA través de Elastic Inference Service
jina-reranker-v3.5 está disponible en Elastic Inference Service (EIS) a partir de Stack 9.3, por lo que puede realizar reordenamiento en GPUs gestionadas sin alojar el modelo usted mismo. Cree un endpoint de inferencia que haga referencia al modelo y, a continuación, llámelo como cualquier otra tarea de rerank.
PUT _inference/rerank/eis-jina-reranker-v3-5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-reranker-v3.5"
}
}POST _inference/rerank/eis-jina-reranker-v3-5
{
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"input": [
"...",
"..."
]
}La respuesta devuelve una matriz rerank ordenada por relevancia, donde cada entrada contiene el índice original del candidato y su puntuación. Debido a que es un endpoint de inferencia estándar, el inference_id puede ser referenciado directamente desde un recuperador text_similarity_reranker en una consulta de búsqueda.
tagA través de transformers
from transformers import AutoModel
model = AutoModel.from_pretrained(
'jinaai/jina-reranker-v3.5',
dtype="auto",
trust_remote_code=True,
)
model.eval()
query = "What are the health benefits of green tea?"
documents = [
"Green tea contains catechins that may help reduce inflammation.",
"El precio del cafe ha aumentado un 20% este ano.",
"绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
"Le the vert est riche en antioxydants.",
]
for r in model.rerank(query, documents):
print(f"{r['relevance_score']:.4f} {r['document'][:70]}")tagConclusión
La propuesta práctica de jina-reranker-v3.5 es específica y comprobable: con 0,6 mil millones de parámetros, el entrenamiento dirigido cierra la mayor parte de la brecha respecto a un reranker generalista de 4 mil millones, y en BEIR la cierra por completo, mientras funciona más rápido que el modelo al que reemplaza. Para la recuperación de información empresarial, esto justifica invertir en una supervisión enfocada sobre una estructura compacta en lugar de recurrir por defecto al modelo más grande disponible.
Vale la pena señalar claramente dos limitaciones. Los rerankers a nivel de lista (listwise) siguen teniendo restricciones de entrada que los modelos a nivel de punto (pointwise) y de interacción tardía evitan, en particular límites superiores fijos en el recuento de candidatos y la longitud total de los mismos. Además, persisten brechas importantes respecto al modelo Qwen de 4 mil millones en tareas legales y médicas de RTEB, en Struct-IR de grupo controlado y en idiomas de bajos recursos en MIRACL. Esos son los casos difíciles, y los mencionamos en lugar de ocultarlos detrás de un promedio.






