Descripción general
jina-embeddings-v2-base-en es un modelo de embeddings de texto en inglés de 137M parámetros con una ventana de contexto de 8.192 tokens: 16 veces el límite estándar de 512 tokens de su época. Construido sobre un backbone BERT-small con ALiBi bidireccional simétrico (Attention with Linear Biases), fue el primer embedding de Jina de código abierto capaz de manejar documentos largos nativamente, sin truncamiento ni segmentación. Produce vectores de 768 dimensiones y sigue siendo una opción sólida para la recuperación solo en inglés cuando no se necesiten las funciones multilingües o de contexto largo de v3/v5.
Métodos
La arquitectura combina un transformador BERT-small (12 capas, 12 cabezas de atención, 768 dimensiones ocultas) con codificaciones posicionales ALiBi bidireccionales simétricas. ALiBi reemplaza los embeddings posicionales aprendidos con un sesgo de atención linealmente decreciente, permitiendo al modelo extrapolar mucho más allá de su longitud de entrenamiento de 512 tokens hasta 8.192 tokens sin degradación del rendimiento. El entrenamiento siguió una pipeline de dos etapas: preentrenamiento en C4, luego ajuste fino en la colección curada de Jina de 40+ conjuntos de datos de pares de oraciones especializados con minería de negativos difíciles. La atención bidireccional simétrica garantiza que cada token atienda tanto al contexto anterior como al posterior, produciendo representaciones que capturan el significado global de la oración. El pooling promedio sobre todas las representaciones de tokens produce el embedding final de 768 dimensiones.
Rendimiento
Al momento de su lanzamiento, el modelo superó a text-embedding-ada-002 de OpenAI en varias subtareas de MTEB en inglés: clasificación (73,45 % vs. 70,93 %), reordenación (85,38 % vs. 84,89 %), recuperación (56,98 % vs. 56,32 %) y resumen (31,6 % vs. 30,8 %). Su contexto de 8.192 tokens fue una ventaja significativa frente a los modelos competidores limitados a 512–2.048 tokens, permitiendo la recuperación a nivel de documento sin segmentación. La compacta huella de 307MB lo hizo desplegable en GPUs de consumo. En 2026, jina-embeddings-v5-text-small (677M parámetros, contexto de 32K, adaptadores LoRA específicos por tarea) lo supera para la mayoría de las cargas de trabajo de producción, pero sigue siendo relevante para pipelines ligeros solo en inglés.
Guía
Use este modelo para la recuperación solo en inglés cuando la ventana de contexto de 8K sea suficiente y no se requieran adaptadores multilingües o específicos por tarea. Para documentos que excedan 8.192 tokens, aplique segmentación semántica antes de incrustar. El modelo se integra con las principales bases de datos vectoriales (Qdrant, Weaviate, MongoDB Atlas, Milvus) y marcos de RAG (LangChain, LlamaIndex, Haystack). Para nuevos proyectos que requieran soporte multilingüe, contexto de 32K u optimización específica por tarea, prefiera jina-embeddings-v5-text-small. Se recomienda una GPU con soporte CUDA para el rendimiento en producción; la inferencia por CPU es posible pero notablemente más lenta.










