Gráfico de E/S

Texto

jina-embeddings-v2-base-en

Vector

Frontera de Pareto
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxlParámetros (log)nDCG@10
Este modelo
En la frontera
Jina AI
Otros
MTEB English · retrieval
49.05
Parámetros
137M
Rango por score
17 / 39
Frontera de Pareto
Por detrás
Distribución de valores
AUC 0.8376
Corpus
Pares de traducción
Búsqueda documental
0.8500.600.700.800.90
Relacionados26.9%
Negativo difícil2.7%
No relacionados1.1%
Umbrales recomendados
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
equilibrado · 0.762
AUC
0.8376
Techo de ruido
0.893
Caída de exhaustividad
0.691
Pares medidos
119 / 11k
Componentes del vector
-0.14-0.000.14
σ 0.0361 · 183k valores
Geometría del embedding
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.751
Dim. efectivas
59 / 768
Elija modelos para comparar
Publicaciones (1)

Descripción general

jina-embeddings-v2-base-en es un modelo de embeddings de texto en inglés de 137M parámetros con una ventana de contexto de 8.192 tokens: 16 veces el límite estándar de 512 tokens de su época. Construido sobre un backbone BERT-small con ALiBi bidireccional simétrico (Attention with Linear Biases), fue el primer embedding de Jina de código abierto capaz de manejar documentos largos nativamente, sin truncamiento ni segmentación. Produce vectores de 768 dimensiones y sigue siendo una opción sólida para la recuperación solo en inglés cuando no se necesiten las funciones multilingües o de contexto largo de v3/v5.

Métodos

La arquitectura combina un transformador BERT-small (12 capas, 12 cabezas de atención, 768 dimensiones ocultas) con codificaciones posicionales ALiBi bidireccionales simétricas. ALiBi reemplaza los embeddings posicionales aprendidos con un sesgo de atención linealmente decreciente, permitiendo al modelo extrapolar mucho más allá de su longitud de entrenamiento de 512 tokens hasta 8.192 tokens sin degradación del rendimiento. El entrenamiento siguió una pipeline de dos etapas: preentrenamiento en C4, luego ajuste fino en la colección curada de Jina de 40+ conjuntos de datos de pares de oraciones especializados con minería de negativos difíciles. La atención bidireccional simétrica garantiza que cada token atienda tanto al contexto anterior como al posterior, produciendo representaciones que capturan el significado global de la oración. El pooling promedio sobre todas las representaciones de tokens produce el embedding final de 768 dimensiones.

Rendimiento

Al momento de su lanzamiento, el modelo superó a text-embedding-ada-002 de OpenAI en varias subtareas de MTEB en inglés: clasificación (73,45 % vs. 70,93 %), reordenación (85,38 % vs. 84,89 %), recuperación (56,98 % vs. 56,32 %) y resumen (31,6 % vs. 30,8 %). Su contexto de 8.192 tokens fue una ventaja significativa frente a los modelos competidores limitados a 512–2.048 tokens, permitiendo la recuperación a nivel de documento sin segmentación. La compacta huella de 307MB lo hizo desplegable en GPUs de consumo. En 2026, jina-embeddings-v5-text-small (677M parámetros, contexto de 32K, adaptadores LoRA específicos por tarea) lo supera para la mayoría de las cargas de trabajo de producción, pero sigue siendo relevante para pipelines ligeros solo en inglés.

Guía

Use este modelo para la recuperación solo en inglés cuando la ventana de contexto de 8K sea suficiente y no se requieran adaptadores multilingües o específicos por tarea. Para documentos que excedan 8.192 tokens, aplique segmentación semántica antes de incrustar. El modelo se integra con las principales bases de datos vectoriales (Qdrant, Weaviate, MongoDB Atlas, Milvus) y marcos de RAG (LangChain, LlamaIndex, Haystack). Para nuevos proyectos que requieran soporte multilingüe, contexto de 32K u optimización específica por tarea, prefiera jina-embeddings-v5-text-small. Se recomienda una GPU con soporte CUDA para el rendimiento en producción; la inferencia por CPU es posible pero notablemente más lenta.

Blogs que mencionan este modelo
diciembre 17, 2024 • 12 minutos de lectura
Los Text Embeddings fallan al capturar el orden de las palabras y cómo solucionarlo
Los modelos de incrustación de texto tienen dificultades para captar sutiles matices lingüísticos como el orden de las palabras, las relaciones direccionales, las secuencias temporales, las conexiones causales, las comparaciones y la negación. Comprender estos desafíos es clave para mejorar el rendimiento del modelo.
octubre 25, 2024 • 19 minutos de lectura
Encontrando Puntos de Ruptura Óptimos en Documentos Largos Usando Modelos de Lenguaje Pequeños
Entrenamos tres modelos de lenguaje pequeños para segmentar mejor los documentos largos en fragmentos, y estas son las lecciones clave que aprendimos.
octubre 15, 2024 • 9 minutos de lectura
Verificación de hechos con la nueva API de Grounding en Jina Reader
Con el nuevo g.jina.ai, puedes verificar fácilmente las declaraciones para reducir las alucinaciones de los LLM o mejorar la integridad del contenido escrito por humanos.
septiembre 27, 2024 • 15 minutos de lectura
Migración de Jina Embeddings v2 a v3
Recopilamos algunos consejos para ayudarte a migrar de Jina Embeddings v2 a v3.
septiembre 18, 2024 • 10 minutos de lectura
Jina Embeddings v3: Un Modelo de Embeddings Multilingüe de Vanguardia
jina-embeddings-v3 es un modelo de vanguardia de embeddings de texto multilingüe con 570M parámetros y una longitud de token de 8192, que supera a los últimos embeddings propietarios de OpenAI y Cohere en MTEB.