Descripción general
jina-embeddings-v2-base-zh es un modelo de embeddings de texto bilingüe de 161M parámetros para chino e inglés con una ventana de contexto de 8.192 tokens y salida de 768 dimensiones. Fue el primer modelo de código abierto capaz de manejar chino e inglés a la vez con soporte de contexto largo, abordando los desafíos únicos de tokenización del texto chino basado en caracteres en arquitecturas de transformers.
Métodos
El modelo usa un backbone basado en BERT con codificaciones posicionales ALiBi bidireccionales simétricas, 161M parámetros y un espacio de salida de 768 dimensiones. El entrenamiento siguió un enfoque de tres fases: preentrenamiento inicial en datos bilingües de alta calidad chino-inglés, seguido de etapas de ajuste fino primario y secundario con pérdida contrastiva y minería de negativos difíciles. El mecanismo ALiBi habilita la ventana de contexto de 8.192 tokens sin embeddings posicionales aprendidos. Una mejora notable en la versión final fue una distribución de puntuaciones de similitud refinada que abordó los problemas de inflación de puntuaciones presentes en la versión de vista previa, produciendo puntuaciones de similitud más discriminativas y bien calibradas.
Rendimiento
En el leaderboard de C-MTEB (MTEB chino), el modelo demostró un rendimiento excepcional entre los modelos de menos de 0,5GB, destacando particularmente en tareas en chino. Superó significativamente a text-embedding-ada-002 de OpenAI en tareas de recuperación y similitud específicas del chino, manteniendo un rendimiento competitivo en tareas en inglés. La distribución refinada de puntuaciones de similitud mejoró la discriminación entre contenido relacionado y no relacionado en ambos idiomas. En 2026, jina-embeddings-v5-text-small reemplazó a este modelo con 89 idiomas, contexto de 32K y adaptadores LoRA específicos por tarea.
Guía
Óptimo para la recuperación bilingüe chino-inglés, la búsqueda de documentos entre lenguajes y el análisis de contenido multilingüe. Para documentos que excedan 8.192 tokens, use segmentación semántica o el parámetro `late_chunking a través de la API de Jina. El modelo se integra con las principales bases de datos vectoriales y marcos de RAG. Para nuevos proyectos multilingües, prefiera jina-embeddings-v5-text-small` (89 idiomas, contexto de 32K, adaptadores LoRA). Se recomienda una GPU con soporte CUDA para el rendimiento en producción. El texto de entrada debe estar en chino o en inglés; el modelo maneja ambos idiomas nativamente sin traducción.







