Descripción general
jina-embeddings-v2-base-de es un modelo de embeddings de texto bilingüe de 161M parámetros para alemán e inglés con una ventana de contexto de 8.192 tokens. Mapea contenido semánticamente equivalente en ambos idiomas al mismo espacio de embeddings de 768 dimensiones, permitiendo la recuperación entre lenguajes sin traducción. El modelo fue uno de los primeros modelos de embedding bilingües de código abierto en combinar el soporte de contexto largo con un rendimiento equilibrado en ambos idiomas.
Métodos
Construido sobre un backbone basado en BERT con codificaciones posicionales ALiBi bidireccionales simétricas, el modelo procesa tanto alemán como inglés a través de una arquitectura unificada de 161M parámetros que produce embeddings de 768 dimensiones. El entrenamiento incluyó tres etapas: (1) preentrenamiento multilingüe en corpus paralelos alemán-inglés, (2) ajuste fino contrastivo en pares de oraciones curados con negativos difíciles, y (3) entrenamiento de alineación entre lenguajes para asegurar que los textos semánticamente equivalentes en alemán e inglés se mapeen a regiones cercanas del espacio de embedding. Una decisión de diseño clave fue el objetivo de minimización de sesgo, que contrarresta la tendencia de los modelos multilingües a favorecer las estructuras gramaticales del inglés: un modo de fallo documentado en embeddings multilingües anteriores. La ventana de 8.192 tokens mediante ALiBi permite procesar documentos completos en cualquiera de los dos idiomas sin truncamiento.
Rendimiento
El modelo superó a E5-base de Microsoft siendo menos de un tercio de su tamaño, y alcanzó el rendimiento de E5-large a pesar de ser 7 veces más pequeño. En WikiCLIR (recuperación de inglés a alemán), STS17/STS22 (similitud semántica bidireccional) y BUCC (alineación de texto bilingüe), superó consistentemente a modelos de tamaño comparable o mayor. La huella de 322MB permitió su despliegue en hardware estándar. En 2026, jina-embeddings-v5-text-small reemplazó a este modelo para la mayoría de las aplicaciones, ofreciendo contexto de 32K, 89 idiomas y adaptadores LoRA específicos por tarea. El modelo v2-base-de sigue siendo útil para pipelines bilingües alemán-inglés donde el contexto de 8K es suficiente.
Guía
Óptimo para la recuperación bilingüe alemán-inglés: búsqueda de productos, documentación de soporte y gestión de contenido donde las consultas y los documentos pueden estar en idiomas distintos. Para documentos que excedan 8.192 tokens, use segmentación semántica o el parámetro `late_chunking a través de la API de Jina. El modelo se integra con Qdrant, Weaviate, MongoDB y Milvus. Para nuevos proyectos multilingües que abarquen más de dos idiomas, prefiera jina-embeddings-v5-text-small` (89 idiomas, contexto de 32K, adaptadores LoRA). Se recomienda una GPU con soporte CUDA para el rendimiento en producción.









