En estos tiempos difíciles, nada supera un buen plato de sopa caliente.
El minestrone es una de las sopas italianas clásicas: espesa, abundante, sabrosa, que combina frijoles, verduras abundantes y arroz o pasta. Su sabor es producto del ensamblaje de diversos ingredientes. Es un poco como el borscht en Europa del Este, los guisos en Estados Unidos o un salteado casero en Asia Pacífico, ya que combina ingredientes disponibles y económicos en un plato querido.
Podemos usar casi el mismo tipo de receta para los modelos de redes neuronales, según una línea de artículos que comienza con Wortsman et al. (2022).
Las "sopas de modelos" (¡ay, no "guisos de modelos" o "salteados de modelos"!) son una clase de técnicas de ensamblaje de modelos diseñadas para mitigar el costo de optimizar los datos de entrenamiento y los hiperparámetros del modelo. Cuando se entrena una red neuronal, normalmente se prueban diferentes datos y valores de hiperparámetros y se entrena varias veces, buscando el resultado con mejor rendimiento. El entrenamiento es muy costoso desde el punto de vista computacional, y los costos se acumulan rápidamente.
En cambio, las sopas de modelos implican el entrenamiento de varios modelos con diferentes hiperparámetros y opciones de datos de entrenamiento, lo mismo que se haría normalmente, pero luego se combinan. El resultado es un modelo de mayor rendimiento y más robusto que el mejor intérprete individual. No ahorra costos porque todavía se entrenan varios modelos, pero se puede obtener un mejor resultado por el mismo precio.
El enfoque de la sopa de modelos ya ha demostrado ser útil para los modelos de incrustación multimodal de texto e imagen (Wortsman et al. 2022) y los modelos generativos de lenguaje de gran tamaño. (Takuya et al. 2025) En Jina AI, hemos comenzado a utilizar esta técnica para entrenar nuestros propios modelos, y jina-embeddings-v3 y reader-lm-v2 incorporan sopas de modelos.
En este artículo, vamos a analizar las sopas de modelos y a mostrar los resultados de parte de nuestro trabajo con ellas. Específicamente:
- ¿Podemos usar sopas de modelos para mejorar el rendimiento fusionando modelos en diferentes puntos de su entrenamiento?
- ¿Podemos fusionar modelos entrenados con diferentes conjuntos de datos y para diferentes tareas para obtener un mejor rendimiento y una mayor eficiencia de entrenamiento que entrenando un solo modelo?
Esto tiene importantes beneficios potenciales:
- Las sopas de modelos pueden tener un rendimiento mejor y más robusto.
- Los modelos de incrustación multilingües a menudo sufren de sesgos y fallas de rendimiento causados por cantidades desiguales de datos de entrenamiento. Sería una gran ventaja poder entrenar el mejor modelo posible en cada tarea o conjunto de datos individualmente y luego combinarlos por igual.
- Es posible que podamos hacer un mejor aprendizaje continuo y actualización de modelos haciendo cambios en nuestros modelos de forma modular, actualizando un componente del modelo a la vez y luego volviéndolo a fusionar con los demás.
tag¿Cómo funciona?
La fusión de las salidas de varios modelos es una técnica antigua en la teoría estadística de la decisión. Por ejemplo, es una práctica común en la previsión meteorológica crear varios modelos, a menudo realizados por diferentes personas con diferentes suposiciones, y luego utilizar una variedad de mecanismos para promediar sus predicciones. Si los errores de cada modelo se distribuyen aleatoriamente, entonces el promedio de los modelos conducirá a respuestas con menos errores.
Por ejemplo, si tiene tres modelos diferentes que producen un "sí" o un "no" binario, y cada uno se equivoca el 10% de las veces, entonces dos de los tres se equivocarán solo el 2.8% de las veces. Cinco modelos, con un criterio de decisión mayoritaria, solo se equivocarán el 0.856% de las veces.
El promedio de modelos funciona con el mismo principio, pero en lugar de combinar las salidas de diferentes modelos, combina los propios modelos.
El enfoque utilizado es una extensión del promedio de peso estocástico (Izmailov et al. 2018), que se basa en conocimientos sobre los paisajes de pérdida de las redes neuronales para mostrar que el promedio de peso simple puede mejorar el rendimiento de la generalización del modelo en condiciones comunes.
La mecánica real del promedio de los modelos es inquietantemente simple: solo se promedian los pesos de varios modelos.

Si esto parece demasiado fácil, es importante tener en cuenta que existen limitaciones al fusionar modelos de esta manera. No se pueden fusionar los pesos de dos redes neuronales cualesquiera y esperar que funcione.
El promedio de modelos solo funciona en modelos muy similares, es decir, modelos cuyos pesos no son muy diferentes entre sí para empezar. La forma de garantizar esto es pre-entrenar un modelo y luego crear múltiples variantes de ese modelo afinándolos con diferentes hiperparámetros o diferentes datos. Estos modelos normalmente serán lo suficientemente similares como para promediarlos.
En términos más técnicos, el pre-entrenamiento generalmente produce un modelo cuyos pesos están cerca del fondo de una cuenca de pérdida, y el ajuste fino no conduce fácilmente a escapar de esa cuenca de pérdida. Si todos los modelos que se van a fusionar tienen pesos en la misma cuenca de pérdida, entonces sus pesos estarán bastante cerca de los mismos, y es probable que promediarlos funcione. Esto no está garantizado, pero empíricamente, parece ser cierto con la suficiente frecuencia como para ser útil.
tagConfiguración experimental
Modelo base: para los experimentos descritos aquí, utilizamos xlm-roberta-base de FacebookAI (Conneau et al. 2020) como nuestro modelo base pre-entrenado. Este modelo tiene 280 millones de parámetros y ha sido pre-entrenado en 2.5 TB de datos de Common Crawl que contienen texto en aproximadamente 100 idiomas.
Afinamos xlm-roberta-base en nuestro conjunto de entrenamiento de pares de oraciones curado para el entrenamiento de incrustaciones, antes de realizar nuestros experimentos.
Datos de entrenamiento: Jina AI mantiene conjuntos de datos personalizados curados para el entrenamiento. Para el primer experimento, utilizamos trillizos de oraciones específicamente curados para el entrenamiento contrastivo en seis idiomas: inglés, árabe, alemán, español, japonés y chino. Para el segundo experimento, utilizamos conjuntos de datos de entrenamiento específicos de la tarea en inglés.
Evaluación: utilizamos partes relevantes del conjunto de pruebas MMTEB (Enevoldsen et al. 2025) y el punto de referencia MIRACL (Zhang et al. 2023) para evaluar los modelos producidos por nuestro entrenamiento y fusión.
tagExperimento 1: Promedio de una sola ejecución
Para este experimento, utilizamos trillizos de oraciones contrastivas en los seis idiomas, mezclados, para un total de 6,000 pasos de entrenamiento con un tamaño de lote de 1,024 elementos. Cada 2,000 pasos, guardamos el estado del modelo para el promedio, produciendo 3 modelos, cada uno de los cuales refleja un punto diferente en el proceso de entrenamiento.
Promediamos los tres modelos para producir un modelo final. Luego probamos el modelo fusionado y los tres puntos de control guardados contra los conjuntos de pruebas MMTEB-STS y MIRACL.
Nuestros resultados se resumen en la siguiente tabla:
| Model | MIRACL (avg 6 languages) |
MMTEB-STS English (avg 8 benchmarks) |
MMTEB-STS Multilingual (avg 6 benchmarks) |
Average of 20 benchmarks |
|---|---|---|---|---|
| No triplet training | 0.3163 | 0.7859 | 0.7322 | 0.6276 |
| Step 2000 | 0.4631 | 0.7924 | 0.7561 | 0.6813 |
| Step 4000 | 0.4639 | 0.7902 | 0.7583 | 0.6812 |
| Step 6000 (final) | 0.4680 | 0.7891 | 0.7575 | 0.6818 |
| Merged model (all 3 stored checkpoints) |
0.4669 | 0.7910 | 0.7579 | 0.6823 |
La fusión con los puntos de control anteriores generalmente no produjo un modelo de mejor rendimiento que el de mejor rendimiento entre los puntos de control almacenados en puntos de referencia individuales o en cualquiera de las tres baterías de puntos de referencia utilizadas. Sin embargo, sí produjo el mejor modelo en todos los puntos de referencia promediados juntos.
En los puntos de referencia individuales, la diferencia entre el modelo fusionado y el punto de control de mejor rendimiento es en todos los casos inferior a 0.01. Esto es cierto no solo para los promedios en la tabla anterior, sino para cada prueba individual.
Esto demuestra que la fusión de diferentes puntos de control de entrenamiento puede producir un modelo más robusto con muy poco costo de rendimiento.
Además, al fusionar los diferentes puntos de control, podemos protegernos eficazmente contra el sobreentrenamiento. El sobreentrenamiento se ha convertido recientemente en un tema importante en las redes neuronales. (Springer et al., 2025) Una red se puede entrenar de una manera que la haga más difícil y de peor rendimiento después de un ajuste fino adicional.
Dado que el punto de control de mejor rendimiento en nuestro experimento a menudo no es el último, es probable que hayamos sobreentrenado nuestro modelo en 6,000 pasos de entrenamiento. El modelo fusionado se acerca mucho a igualar el rendimiento del mejor punto de control en todas las pruebas, eliminando los defectos del sobreentrenamiento.
tagExperimento 2: Promedio de modelos entrenados para diferentes tareas
Para este experimento, entrenamos tres modelos, cada uno para una tarea de incrustación común diferente:
- Similitud semántica: Medición de la superposición o similitud relativa en el significado entre dos textos, normalmente de longitud comparable.
- Recuperación de documentos basada en consultas textuales: Encontrar los documentos que mejor satisfacen una consulta. Las consultas son generalmente textos mucho más cortos que los documentos que coinciden.
- Preguntas y respuestas: Encontrar el documento que mejor responde a una pregunta en lenguaje natural. Las preguntas también son generalmente más cortas que los textos que coinciden.
Entrenar modelos para las tres tareas a la vez es bastante difícil porque los objetivos son muy dispares, y esperamos que las "sopas de modelos" mejoren el proceso.
Según la experiencia anterior, sabíamos que cada tarea requería un número diferente de épocas de entrenamiento. El entrenamiento se resume a continuación:
| Tarea | Pasos de entrenamiento (tamaño de lote = 1,024) |
Tamaño del conjunto de datos de entrenamiento (en elementos) |
|---|---|---|
| Preguntas y respuestas (QA) | 2,000 | 256,000 |
| Recuperación de documentos | 3,000 | 384,000 |
| Similitud Semántica (STS) | 1,000 | 128,000 |
Esto produjo tres modelos, que luego fusionamos en un solo modelo. Probamos el modelo resultante con las partes del conjunto de puntos de referencia MMTEB relevantes para esas tres tareas: MIRACL, NanoBEIR y STSEval (partes en inglés y multilingües de MMTEB).
| MIRACL (promedio de 6 idiomas) |
NanoBEIR (promedio de 13 puntos de referencia) |
MMTEB-STS Inglés (promedio de 9 puntos de referencia) |
MMTEB-STS Multilingüe (promedio de 6 puntos de referencia) |
Promedio de 34 puntos de referencia | |
|---|---|---|---|---|---|
| Sin entrenamiento de tripletes | 0.3163 | 0.5089 | 0.7859 | 0.7322 | 0.5876 |
| Entrenamiento QA | 0.4489 | 0.5332 | 0.7843 | 0.7535 | 0.6237 |
| Entrenamiento de recuperación | 0.4272 | 0.5360 | 0.7766 | 0.7340 | 0.6154 |
| Entrenamiento STS | 0.1779 | 0.4519 | 0.7994 | 0.7651 | 0.5508 |
| Modelo fusionado | 0.4246 | 0.5309 | 0.7981 | 0.7640 | 0.6240 |
Vemos aquí que los modelos entrenados específicamente para cada tarea tienen el mejor rendimiento en cada tarea. MIRACL es principalmente un punto de referencia de preguntas y respuestas, incluso si se llama de recuperación, y el modelo entrenado en QA supera a todos los demás en él, incluido el modelo fusionado. NanoBEIR es un conjunto de puntos de referencia de recuperación de información más convencional, y vemos que el modelo entrenado en recuperación es el que mejor funciona en él. El modelo de similitud semántica (STS) obtiene una puntuación bastante baja en esos puntos de referencia, pero supera a los demás en tareas explícitamente STS. Para cada categoría, el modelo fusionado tiene un rendimiento inferior al del modelo entrenado en una sola tarea.
Pero, una vez más, si promediamos todos los puntos de referencia, el modelo fusionado supera a los demás, aunque su puntuación representa sólo una mejora muy pequeña con respecto al modelo entrenado en QA, y tiene un rendimiento muy pobre en las tareas STS.
También fusionamos sólo los modelos QA y de recuperación y puntuamos el modelo resultante en los mismos puntos de referencia:
| MIRACL (promedio de 6 idiomas) |
NanoBEIR (promedio de 13 puntos de referencia) |
MMTEB-STS Inglés (promedio de 9 puntos de referencia) |
MMTEB-STS Multilingüe (promedio de 6 puntos de referencia) |
Promedio de 34 pruebas | Promedio QA & IR (19 pruebas) |
Promedio STS (15 pruebas) |
|
|---|---|---|---|---|---|---|---|
| Mejor modelo entrenado para la tarea | 0.4489 | 0.5360 | 0.7994 | 0.7651 | 0.6237 | 0.5066 | 0.7857 |
| Modelo fusionado | 0.4246 | 0.5309 | 0.7981 | 0.7640 | 0.6240 | 0.4973 | 0.7845 |
| Modelo fusionado QA+Recuperación | 0.4610 | 0.5404 | 0.7878 | 0.7498 | 0.6288 | 0.5153 | 0.7726 |
Vemos aquí que, si bien podemos mejorar el rendimiento tanto en preguntas y respuestas como en la recuperación fusionando modelos entrenados para las dos tareas, agregar modelos entrenados en STS reduce el rendimiento específico de la tarea en todas las categorías. Esto sugiere que la similitud semántica es, en algunos aspectos importantes, diferente de QA y la recuperación, y que un modelo entrenado en STS no es adecuado para fusionarse con los otros dos.
Esto se debe probablemente a que las preguntas y respuestas y la recuperación implican la comparación de textos cortos (preguntas y consultas) con documentos más largos, mientras que la similitud semántica implica la comparación de documentos de longitud más similar.
Wortsman et al. (2022) describen un enfoque selectivo para el promedio que denominan fusión "codiciosa". Implica tomar un modelo, generalmente el de mejor rendimiento de un conjunto de modelos, y luego agregarle solo aquellos modelos que individualmente mejoran el rendimiento. Con solo tres modelos, tenía poco sentido usar la fusión codiciosa para este experimento. Sin embargo, podríamos imaginar un caso con más modelos y usar una técnica como esta como base para determinar el grado de similitud entre las tareas. Aquí encontramos que la similitud semántica es diferente de las otras dos. Luego podríamos evaluar cuándo un modelo puede realizar muchas tareas y cuándo es más rentable usar un modelo diferente.
tag¡La sopa está servida!
Las "sopas de modelos" combinan la diversidad en algo mayor que la suma de sus partes. El valor de este enfoque radica en su capacidad para ofrecer una mayor consistencia, robustez y actuar como salvaguarda contra el sobreentrenamiento sin costo de entrenamiento adicional. Nuestros experimentos muestran que la fusión de puntos de control o modelos especializados en tareas puede mejorar el rendimiento general, incluso si ocasionalmente tiene el costo de picos específicos de la tarea.
Al final, las "sopas de modelos" ofrecen una forma práctica y muy sencilla de construir modelos más adaptables, aunque con algunas advertencias. No es una panacea y solo es aplicable cuando los modelos ya son muy similares.
Como dicen en Internet, Your Mileage May Vary. Pero es barato y fácil averiguar si las "sopas de modelos" pueden ayudar cuando entrenas tus modelos.







