Descripción general
jina-embeddings-v2-base-es es un modelo de embeddings de texto bilingüe de 161M parámetros para español e inglés, con una ventana de contexto de 8.192 tokens y salida de 768 dimensiones. Fue diseñado para la recuperación entre lenguajes en mercados de habla hispana, mapeando contenido semánticamente equivalente en español e inglés a un espacio de embedding compartido. El modelo aborda una brecha crítica: la mayoría de los modelos de embedding de la época eran centrados en inglés, con un rendimiento en español significativamente degradado.
Métodos
El modelo usa un backbone basado en BERT con codificaciones posicionales ALiBi bidireccionales simétricas, 161M parámetros y un espacio de salida de 768 dimensiones. El entrenamiento siguió un proceso de tres etapas: (1) preentrenamiento en corpus paralelos español-inglés, (2) ajuste fino contrastivo con minería de negativos difíciles en pares de oraciones curados, y (3) alineación entre lenguajes para asegurar que las representaciones en español e inglés del mismo concepto se agrupan juntas. El mecanismo ALiBi habilita la ventana de contexto de 8.192 tokens sin embeddings posicionales aprendidos, permitiendo al modelo extrapolar más allá de su longitud de entrenamiento de 512 tokens. El pooling promedio produce el vector de embedding final.
Rendimiento
El modelo superó a modelos multilingües significativamente mayores (E5, BGE-M3) en tareas de recuperación español-inglés, siendo solo el 15–30 % de su tamaño. Demostró un fuerte rendimiento en las subtareas de MTEB en español, particularmente en recuperación y agrupamiento. La ventana de contexto de 8.192 tokens ofreció un rendimiento consistente en documentos de varias páginas donde la mayoría de los modelos competidores requerían segmentación. En 2026, jina-embeddings-v5-text-small reemplazó a este modelo, ofreciendo 89 idiomas, contexto de 32K y adaptadores LoRA específicos por tarea. El modelo v2-base-es sigue siendo una opción rentable para pipelines dedicados de español e inglés.
Guía
Ideal para la búsqueda bilingüe español-inglés, la recomendación de contenido y el análisis de documentos entre lenguajes. Para documentos que excedan 8.192 tokens, use segmentación semántica o el parámetro `late_chunking a través de la API de Jina. El modelo se integra con las principales bases de datos vectoriales y marcos de RAG. Para nuevos proyectos que requieran cobertura multilingüe más allá de español-inglés, contexto de 32K u optimización específica por tarea, prefiera jina-embeddings-v5-text-small`. Se recomienda una GPU con soporte CUDA para producción. El texto de entrada debe estar en español o en inglés; se admite entrada de idiomas mixtos, pero el rendimiento está optimizado para los dos idiomas entrenados.




