Descripción general
jina-embedding-b-en-v1 fue el primer modelo de embeddings de texto publicado por Jina AI: un codificador bidireccional de 110M parámetros que mapea texto en inglés a vectores de 768 dimensiones. Diseñado para búsqueda semántica, comparación de similitud y recomendación de contenido en una época en que el contexto de 512 tokens era el estándar de la industria, estableció el ingreso de Jina al espacio de embeddings de código abierto. El modelo es ahora legacy y ha sido superado por las familias v2 y v3, que admiten contextos de 8K+ tokens y entrada multilingüe.
Métodos
El modelo usa una arquitectura T5-encoder con pooling promedio para producir representaciones de longitud fija de 768 dimensiones. El entrenamiento siguió una receta contrastiva de dos fases en el dataset Linnaeus-Clean (385M pares de oraciones filtrados de 1,6B candidatos): primero, pérdida InfoNCE en pares de texto positivos para aprender alineación semántica; segundo, pérdida de tripletes para afinar la discriminación entre textos similares pero semánticamente distintos. Una decisión de diseño clave fue la estrategia de pooling promedio, que promedia representaciones a nivel de token para producir un único vector que captura el significado global de la oración. La ventana de contexto de 512 tokens era estándar para su época, pero limita la utilidad del modelo para aplicaciones de documentos largos.
Rendimiento
En STS12, el modelo alcanzó un puntaje de correlación de 0,751, superando a all-mpnet-base-v2 y all-minilm-l6-v2 al momento de su lanzamiento. Demostró un fuerte rendimiento en las tareas estándar de embeddings de oraciones en inglés mientras mantenía tiempos de inferencia rápidos aptos para producción. Su ventana de contexto de 512 tokens y su enfoque solo en inglés lo hicieron inadecuado para las cargas de trabajo de documentos largos y multilingües que se volvieron estándar para 2025. El modelo ha sido superado por jina-embeddings-v2-base-en (contexto de 8K, ALiBi bidireccional) y jina-embeddings-v3 (570M parámetros, 89 idiomas, adaptadores LoRA específicos por tarea).
Guía
Este modelo es legacy y no debe usarse para nuevos proyectos. Si migra desde jina-embedding-b-en-v1, actualice a jina-embeddings-v5-text-small para las cargas de trabajo actuales: admite contexto de 32K tokens, 89 idiomas y adaptadores LoRA específicos por tarea. Para necesidades de embeddings específicas de código, use jina-code-embeddings-1.5b. El modelo requiere hardware con soporte CUDA para un rendimiento óptimo y acepta entradas de hasta 512 tokens. No es adecuado para contenido multilingüe, documentos largos o aplicaciones centradas en código.
