Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Arquitectura
Resultados experimentales
Primeros pasos
Conclusión
star
Presentado
presione soltar
agosto 03, 2026

jina-reranker-v3.5: Reclasificación listwise más rápida con atención híbrida y auto-destilación

Un Reranker listwise de 0.6B que supera a Qwen3-Reranker-4B en BEIR, realiza el proceso de reranking hasta 1.56 veces más rápido que la v3 y obtiene una mejora de 9.6 en nDCG@10 en recuperación semiestructurada.
Jina AI
Jina AI • 11 minutos de lectura
jinaai/jina-reranker-v3.5 · Hugging Face
Estamos en un viaje para avanzar y democratizar la inteligencia artificial a través del código abierto y la ciencia abierta.
jina-reranker-v3.5: Un reordenador (reranker) listwise eficiente con atención híbrida y auto-destilación
Los reordenadores (rerankers) listwise son el núcleo discriminativo de los flujos de trabajo de recuperación mediante agentes, sin embargo, el despliegue en producción exige eficiencia, robustez de dominio y fluidez en datos semiestructurados al mismo tiempo. Presentamos jina-reranker-v3.5, un reordenador (reranker) listwise de 0,6 mil millones de parámetros que cumple con estas demandas sin sacrificar la comparación entre documentos que hace efectivo a su predecesor, jina-reranker-v3. jina-reranker-v3.5 mantiene la interacción "last-but-not-late" (LBNL) de jina-reranker-v3 y la reelabora en tres ejes. Sustituye la atención global uniforme por un esquema híbrido de tres capas de ventana deslizante seguidas de dos capas globales, fijando la capa terminal como global, tal como lo requiere la lectura LBNL. Se entrena con una mezcla curada de múltiples dominios que abarca la recuperación legal, médica, financiera, multilingüe y estructurada. Transfiere calidad a través de una receta de auto-destilación de tres etapas en la que un profesor con atención completa establece un límite superior que un estudiante con atención dispersa recupera bajo un protocolo de adaptación escalonado. jina-reranker-v3.5 alcanza 63,20 nDCG@10 en BEIR, igualando a un modelo de 4 mil millones de parámetros con aproximadamente 7 veces menos parámetros, y mejora los resultados de jina-reranker-v3 en MIRACL y RTEB. Sus mayores ganancias se producen en la recuperación semiestructurada, donde eleva el nDCG@10 en 9,6 puntos respecto a jina-reranker-v3 y lidera a todos los reordenadores (rerankers) de tamaño comparable. El esquema híbrido reduce aún más la latencia de inferencia listwise hasta 1,56 veces. Lanzamos los pesos del modelo en Hugging Face bajo una licencia no comercial.
arXiv.orgChristina Nasika

Hoy lanzamos jina-reranker-v3.5, un reordenador (reranker) listwise de 0,6 mil millones de parámetros que mantiene la interacción last but not late (la última pero no tardía) de jina-reranker-v3 y lo hace más rápido y mucho más capaz en los datos que las empresas realmente buscan. Alcanza 63,20 nDCG@10 en BEIR, superando a Qwen3-Reranker-4B con aproximadamente 7 veces menos parámetros, y reordena hasta 1,56 veces más rápido que la v3 en documentos largos. Su mayor salto se encuentra en la recuperación semiestructurada: +9,6 nDCG@10 sobre la v3 en registros con restricciones de campo.

Tres cambios nos han permitido lograrlo. Un esquema de atención híbrido que sustituye la mayoría de las capas globales por ventanas deslizantes mientras fija la capa terminal como global. Una mezcla de entrenamiento curada a partir de los fallos en recuperación legal, médica, financiera, multilingüe y estructurada. Y una receta de auto-destilación de tres etapas donde el profesor y el estudiante tienen el mismo tamaño y solo difieren en el patrón de atención.

Calidad frente al recuento de parámetros en los cuatro regímenes de referencia. jina-reranker-v3.5 se encuentra en la frontera de Pareto en los cuatro: ningún modelo que hayamos evaluado es a la vez más pequeño y mejor.

Gráfico de dispersión de nDCG@10 frente al recuento de parámetros en BEIR con una línea de frontera de Pareto
Recuperación zero-shot en inglés en BEIR a través de 13 conjuntos de datos, medido por nDCG@10 después de reordenar los 100 mejores candidatos de jina-embeddings-v5-text-small. La línea roja traza la frontera de Pareto y la región sombreada está dominada: para cada modelo dentro de ella, algún otro modelo es más pequeño, mejor, o ambos. jina-reranker-v3.5 define la frontera directamente en 63,20, por encima del mxbai-rerank-large-v2 de 1,5 mil millones a 62,45 y el Qwen3-Reranker-4B de 4 mil millones a 62,28. Ningún modelo más grande que hayamos evaluado aporta una calidad superior en BEIR.
Gráfico de dispersión de nDCG@10 frente al recuento de parámetros en MIRACL con una línea de frontera de Pareto
Recuperación multilingüe en MIRACL a través de 18 idiomas, mismo protocolo de reordenamiento de los 100 mejores. jina-reranker-v3.5 ocupa la esquina de 0,6 mil millones de la frontera en 74,11, la mejor puntuación de cualquier modelo compacto, mientras que Qwen3-Reranker-4B ocupa la esquina de 4 mil millones en 76,56. Las mayores ganancias por idioma sobre jina-reranker-v3 se obtienen en yoruba (+4,4), farsi (+3,1) y francés (+3,0).
Gráfico de dispersión de nDCG@10 frente al recuento de parámetros en RTEB con una línea de frontera de Pareto
Recuperación en dominios profesionales en RTEB, cubriendo corpus legales, financieros, de programación y médicos. jina-reranker-v3.5 alcanza 70,95, superando tanto al Qwen3-Reranker-0.6B de igual tamaño en 68,41 como al mxbai-rerank-large-v2 de 1,5 mil millones en 70,81, operando a 0,6 mil millones. La distancia restante hasta el Qwen3-Reranker-4B en 77,68 se concentra en un puñado de tareas legales y médicas.
Gráfico de dispersión de nDCG@10 frente al recuento de parámetros en Struct-IR con una línea de frontera de Pareto
Recuperación semiestructurada en Struct-IR bajo un grupo de candidatos controlado, donde todos los documentos "gold" se inyectan junto con los 30 distractores más difíciles de la primera etapa, de modo que la medición aísla la discriminación con restricciones de campo de la cobertura de recuperación. jina-reranker-v3.5 alcanza 48,3, una mejora de 9,6 puntos sobre jina-reranker-v3 y la mayor mejora individual en este lanzamiento. Tenga en cuenta que este protocolo no es comparable con la tabla de clasificación de recuperación SSRB.

tagArquitectura

El reordenamiento (reranking) listwise puntúa a cada candidato en una única pasada directa (forward pass), por lo que la auto-atención completa sobre una lista de 100 documentos crece de forma cuadrática e infla la caché KV. La solución obvia es la atención de ventana deslizante. Bajo la interacción LBNL, la solución obvia rompe el modelo.

En LBNL, la consulta y todos los candidatos forman una secuencia causal, y el token de incrustación (向量模型) de la consulta se sitúa al final. Tiene que atender hasta el primer candidato para construir una representación consciente entre documentos. Una ventana finita corta esa dependencia. Por lo tanto, fijamos la capa final como global en todo momento, de modo que los tokens de incrustación de consulta y documentos observen todo el contexto de los candidatos en el punto de extracción. Sustituir esa única capa por una ventana deslizante degrada severamente el reordenamiento listwise; mantener solo esa capa global preserva la codificación conjunta sin una pila totalmente global.

Para las 27 capas restantes, exploramos los esquemas 1L1G, 1L2G, 3L2G y 5L1G. Ganó 3L2G: tres capas de ventana deslizante seguidas de dos capas globales, repetidas, dando 17 capas locales y 11 globales con una ventana de 1.024 词元. Las capas locales reducen el coste de atención de O(L²) a O(L·w), mientras que las capas globales cada tres pasos refrescan la señal a largo plazo entre candidatos en cada profundidad. Los esquemas más densos no aportaron mayor rendimiento; la tendencia de 5L1G fue peor en tareas complejas de múltiples documentos.

Diagrama de arquitectura que muestra la codificación listwise de LBNL con una arquitectura híbrida 3L2G y el pipeline de autodestilación de tres etapas
Izquierda: codificación listwise de LBNL en una arquitectura híbrida 3L2G de Qwen3-0.6B. La consulta y todos los candidatos comparten un contexto causal; las capas L utilizan una ventana deslizante de 1024 tokens, las capas G son globales y la capa terminal G* está fijada como global para que el embedding de la consulta final pueda ver toda la lista. Un MLP proyecta hacia un espacio compartido y la similitud del coseno produce el ranking. Derecha: la receta de tres etapas, donde el profesor de atención completa de la Etapa I permanece congelado y guía a la Etapa III.

tagAutodestilación a través de un vacío de atención

La destilación aquí es inusual. No reducimos un modelo grande a uno pequeño. Tanto el profesor como el alumno son de 0.6B y solo difieren en el patrón de atención. El profesor ejecuta atención completa a un costo cuadrático; el alumno ejecuta 3L2G.

Forzar a un alumno a cambiar las máscaras de atención y hacer coincidir las salidas del profesor al mismo tiempo hace que falle en ambos, por lo que la receta desacopla ambas presiones:

  • Etapa I — Profesor de atención completa. Partiendo del checkpoint público de jina-reranker-v3, ajustamos completamente a un profesor sin restricciones de ventana deslizante en la mezcla v3.5 completa. Esto establece el límite de calidad con este presupuesto de parámetros.
  • Etapa II — Adaptación de atención dispersa. El alumno se inicializa a partir de los pesos de la Etapa I y activa 3L2G. Primero entrenamos solo las proyecciones de atención con todo lo demás congelado, enseñando a las máscaras dispersas a enrutar la información sin alterar las representaciones aprendidas bajo atención completa. Luego descongelamos todo para que el alumno se realinee con la nueva geometría de atención. El alumno ya es desplegable y más rápido aquí, pero persiste una brecha constante con respecto al profesor en BEIR, RTEB-legal y MIRACL.
  • Etapa III — Destilación guiada por el profesor. Con el profesor congelado, alineamos al alumno en cuatro niveles simultáneamente: un KL listwise sobre distribuciones de puntuación normalizadas por softmax, un MSE sobre puntuaciones absolutas, un MSE sobre los estados ocultos de la última capa y una pérdida de coseno sobre los embeddings proyectados, además de regularizadores de similitud y dispersión en el contexto.

El orden importa. La Etapa II por sí sola deja una brecha notable porque el alumno debe cambiar su enrutamiento bajo una máscara más débil antes de poder imitar de forma segura las puntuaciones y estados del profesor. La Etapa III recupera entonces la mayor parte de esa brecha, lo que indica que la capacidad de atención completa se transfiere a un alumno disperso una vez que la geometría se ha adaptado. La receta está escrita para 3L2G, pero el esquema se generaliza a otros desajustes en el cronograma de atención.

tagDatos de entrenamiento

La mezcla v3 cubría bien la recuperación general pero mal los dominios especializados. En lugar de añadir más datos, realizamos un análisis de errores en los conjuntos de desarrollo de RTEB y STARK y construimos cada nuevo fragmento para cubrir exactamente los patrones de recuperación en los que fallan los modelos generales. Los ejemplos negativos difíciles (hard negatives) provienen de varios recuperadores a la vez (BM25, Jina, BGE, GTE, E5, ColBERT) para que el modelo no pueda aprender los atajos de un solo recuperador.

El fragmento legal combina EUR-Lex multilingüe, CLERC, AILA, jurisprudencia canadiense, resumen de casos suizos y EuroVoc, sobremuestreados porque el texto legal es denso en citas y extenso. El fragmento médico se centra en la redacción clínica y los pasajes cargados de entidades. El fragmento financiero prioriza las afirmaciones numéricas, el lenguaje regulatorio y los pasajes que comprenden tablas. La cobertura multilingüe se extiende más allá de MIRACL y mMARCO con WebFAQ en más de 50 idiomas, negativos translingüísticos de SWIM-IR y pares en japonés de Ruri-v3.

Los datos estructurados obtuvieron el mayor peso de muestreo, ya que se sitúan fuera de la distribución de texto libre que asumen los benchmarks estándar. La relevancia sobre registros y tablas depende de la igualdad, límites numéricos y de fecha, pertenencia a listas y combinaciones lógicas entre campos, no de la superposición léxica. Las primeras ejecuciones tuvieron un peor desempeño aquí, por lo que sintetizamos pares con restricciones complejas directamente.

Diagrama de pipeline para generar datos de entrenamiento sintéticos con restricciones complejas para la recuperación estructurada
Supervisión sintética para la recuperación con restricciones de campo. Muestreamos restricciones tipadas de un registro ancla y hacemos que un LLM las parafrasee en una consulta, luego perturbamos uno o dos campos restringidos para construir un negativo difícil casi duplicado que mantiene la misma forma superficial pero viola una restricción. La minería densa añade más candidatos y un juez LLM promueve las coincidencias verdaderas, refina las consultas demasiado amplias y descarta los casos ambiguos, retroalimentando la generación de consultas. El ejemplo de la derecha muestra por qué la superposición léxica es inútil aquí: el positivo y el negativo difícil son cadenas idénticas salvo por un solo campo.

tagResultados experimentales

Todas las cifras reordenan (rerank) los 100 mejores candidatos de jina-embeddings-v5-text-small bajo un pipeline unificado de MTEB v2, por lo que pueden diferir ligeramente de las cifras reportadas por el proveedor. Las tablas completas por dataset y por idioma se encuentran en el artículo.

ModeloParámetrosBEIRMIRACLRTEBStruct-IR
jina-embeddings-v5-text-small (1ª etapa)0.5B56.2665.1564.60–
mxbai-rerank-base-v20.5B59.5864.9061.4430.4
Qwen3-Reranker-0.6B0.6B56.9467.1268.4141.9
mxbai-rerank-large-v21.5B62.4569.6570.8143.0
Qwen3-Reranker-4B4.0B62.2876.5677.6855.6
jina-reranker-v30.6B62.1072.2068.0138.7
<strong>jina-reranker-v3.5</strong>0.6B63.2074.1170.9548.3

v3.5 mejora a v3 en toda la familia de benchmarks con el mismo número de parámetros, siendo la mayor ganancia en la recuperación semiestructurada.

Las ganancias en RTEB se concentran donde se dirigió la mezcla: AILA-Statute mejora 14.0 puntos y AILA-Case 11.7 sobre v3, y FinQA alcanza 86.91, el mejor de todos los modelos probados. En STARK, v3.5 mejora a v3 en las tres métricas oficiales y obtiene el mejor Hit@5 en general.

Una nota de protocolo sobre Struct-IR. El benchmark indexa millones de objetos por esquema y el Recall@5 de primera etapa en el esquema es de alrededor de 0.04, por lo que la recuperación de extremo a extremo está casi totalmente limitada por el recall y distingue mal a los Re-rankers. En su lugar, inyectamos todos los documentos correctos (gold) junto con los 30 distractores más difíciles de la primera etapa, lo que aísla la discriminación restringida por campos de la cobertura de recuperación. Las cifras bajo ese grupo no son comparables con la tabla de clasificación de recuperación SSRB.

tagEficiencia

Medido en una sola NVIDIA A100, tamaño de lote 1, entradas listwise de 100, FlashAttention-2.

Gráfico de barras comparando la latencia media de reordenamiento listwise de v3 y v3.5 en BEIR Natural Questions
Régimen de contexto corto, BEIR Natural Questions, con longitudes medias de consulta y documento de 10.3 y 145.5 tokens sobre 254 consultas cronometradas. La latencia media para el reordenamiento listwise de 100 desciende de 371 ms a 305 ms, una aceleración de 1.22×, y el rendimiento de documentos aumenta de 270 a 328 docs/s.
Gráfico de barras comparando la latencia media de reordenamiento listwise de v3 y v3.5 en RTEB AILACasedocs
Régimen de contexto largo, RTEB AILACasedocs, con longitudes medias de consulta y documento de 689.8 y 1904.0 tokens sobre 48 consultas cronometradas. La latencia media cae de 16.1 s a 10.3 s, una aceleración de 1.56×, y el rendimiento de prefill aumenta de 11.9k a 18.6k tokens/s. La atención híbrida es más rentable cuando los pasajes candidatos son largos.

Debido a que el reordenamiento listwise en producción está dominado por un solo prefill sobre un nuevo conjunto de candidatos, estas reducciones se traducen directamente en listas de candidatos más largas y documentos más grandes con un presupuesto de servicio fijo.

tagPrimeros pasos

tagA través de la API de Jina Search Foundation

curl -X POST \
  https://api.jina.ai/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ***" \
  -d '{
  "model": "jina-reranker-v3.5",
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "documents": [
    "...",
    "..."
  ],
  "return_documents": false
}'

tagA través de Elastic Inference Service

jina-reranker-v3.5 está disponible en Elastic Inference Service (EIS) a partir de Stack 9.3, por lo que puede realizar reordenamiento en GPUs gestionadas sin alojar el modelo usted mismo. Cree un endpoint de inferencia que haga referencia al modelo y, a continuación, llámelo como cualquier otra tarea de rerank.

PUT _inference/rerank/eis-jina-reranker-v3-5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-reranker-v3.5"
  }
}
POST _inference/rerank/eis-jina-reranker-v3-5
{
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "input": [
    "...",
    "..."
  ]
}

La respuesta devuelve una matriz rerank ordenada por relevancia, donde cada entrada contiene el índice original del candidato y su puntuación. Debido a que es un endpoint de inferencia estándar, el inference_id puede ser referenciado directamente desde un recuperador text_similarity_reranker en una consulta de búsqueda.

tagA través de transformers

from transformers import AutoModel

model = AutoModel.from_pretrained(
    'jinaai/jina-reranker-v3.5',
    dtype="auto",
    trust_remote_code=True,
)
model.eval()

query = "What are the health benefits of green tea?"
documents = [
    "Green tea contains catechins that may help reduce inflammation.",
    "El precio del cafe ha aumentado un 20% este ano.",
    "绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
    "Le the vert est riche en antioxydants.",
]

for r in model.rerank(query, documents):
    print(f"{r['relevance_score']:.4f}  {r['document'][:70]}")

tagConclusión

La propuesta práctica de jina-reranker-v3.5 es específica y comprobable: con 0,6 mil millones de parámetros, el entrenamiento dirigido cierra la mayor parte de la brecha respecto a un reranker generalista de 4 mil millones, y en BEIR la cierra por completo, mientras funciona más rápido que el modelo al que reemplaza. Para la recuperación de información empresarial, esto justifica invertir en una supervisión enfocada sobre una estructura compacta en lugar de recurrir por defecto al modelo más grande disponible.

Vale la pena señalar claramente dos limitaciones. Los rerankers a nivel de lista (listwise) siguen teniendo restricciones de entrada que los modelos a nivel de punto (pointwise) y de interacción tardía evitan, en particular límites superiores fijos en el recuento de candidatos y la longitud total de los mismos. Además, persisten brechas importantes respecto al modelo Qwen de 4 mil millones en tareas legales y médicas de RTEB, en Struct-IR de grupo controlado y en idiomas de bajos recursos en MIRACL. Esos son los casos difíciles, y los mencionamos en lugar de ocultarlos detrás de un promedio.

Categorías:
star
Presentado
presione soltar
rss_feed

Leer más
mayo 12, 2026 • 7 minutos de lectura
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
febrero 19, 2026 • 7 minutos de lectura
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
diciembre 04, 2025 • 7 minutos de lectura
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.