Gráfico de E/S

Texto

jina-embeddings-v2-base-de

Vector

Frontera de Pareto
30M100M300M1B3.0B657075808590bge-m3EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parámetros (log)Spearman
Este modelo
En la frontera
Jina AI
Otros
MTEB English · sts
82.00
Parámetros
161M
Rango por score
13 / 39
Frontera de Pareto
Por detrás
Distribución de valores
AUC 0.8452
Corpus
Pares de traducción
Búsqueda documental
0.6900.000.200.400.600.80
Relacionados16.8%
Negativo difícil1.7%
No relacionados0.9%
Umbrales recomendados
FPR 0.1 · 0.499
FPR 0.01 · 0.690
FPR 0.001 · 0.796
FPR 0.0001 · 0.897
equilibrado · 0.368
AUC
0.8452
Techo de ruido
0.793
Caída de exhaustividad
0.195
Pares medidos
119 / 11k
Componentes del vector
-0.19-0.010.17
σ 0.0361 · 183k valores
Geometría del embedding
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.316
Dim. efectivas
49 / 768
Pares de idiomas
de-ruen-deen-koen-zhja-ko
Dispersión del umbral entre pares: 0.158
Elija modelos para comparar
Publicaciones (1)

Descripción general

jina-embeddings-v2-base-de es un modelo de embeddings de texto bilingüe de 161M parámetros para alemán e inglés con una ventana de contexto de 8.192 tokens. Mapea contenido semánticamente equivalente en ambos idiomas al mismo espacio de embeddings de 768 dimensiones, permitiendo la recuperación entre lenguajes sin traducción. El modelo fue uno de los primeros modelos de embedding bilingües de código abierto en combinar el soporte de contexto largo con un rendimiento equilibrado en ambos idiomas.

Métodos

Construido sobre un backbone basado en BERT con codificaciones posicionales ALiBi bidireccionales simétricas, el modelo procesa tanto alemán como inglés a través de una arquitectura unificada de 161M parámetros que produce embeddings de 768 dimensiones. El entrenamiento incluyó tres etapas: (1) preentrenamiento multilingüe en corpus paralelos alemán-inglés, (2) ajuste fino contrastivo en pares de oraciones curados con negativos difíciles, y (3) entrenamiento de alineación entre lenguajes para asegurar que los textos semánticamente equivalentes en alemán e inglés se mapeen a regiones cercanas del espacio de embedding. Una decisión de diseño clave fue el objetivo de minimización de sesgo, que contrarresta la tendencia de los modelos multilingües a favorecer las estructuras gramaticales del inglés: un modo de fallo documentado en embeddings multilingües anteriores. La ventana de 8.192 tokens mediante ALiBi permite procesar documentos completos en cualquiera de los dos idiomas sin truncamiento.

Rendimiento

El modelo superó a E5-base de Microsoft siendo menos de un tercio de su tamaño, y alcanzó el rendimiento de E5-large a pesar de ser 7 veces más pequeño. En WikiCLIR (recuperación de inglés a alemán), STS17/STS22 (similitud semántica bidireccional) y BUCC (alineación de texto bilingüe), superó consistentemente a modelos de tamaño comparable o mayor. La huella de 322MB permitió su despliegue en hardware estándar. En 2026, jina-embeddings-v5-text-small reemplazó a este modelo para la mayoría de las aplicaciones, ofreciendo contexto de 32K, 89 idiomas y adaptadores LoRA específicos por tarea. El modelo v2-base-de sigue siendo útil para pipelines bilingües alemán-inglés donde el contexto de 8K es suficiente.

Guía

Óptimo para la recuperación bilingüe alemán-inglés: búsqueda de productos, documentación de soporte y gestión de contenido donde las consultas y los documentos pueden estar en idiomas distintos. Para documentos que excedan 8.192 tokens, use segmentación semántica o el parámetro `late_chunking a través de la API de Jina. El modelo se integra con Qdrant, Weaviate, MongoDB y Milvus. Para nuevos proyectos multilingües que abarquen más de dos idiomas, prefiera jina-embeddings-v5-text-small` (89 idiomas, contexto de 32K, adaptadores LoRA). Se recomienda una GPU con soporte CUDA para el rendimiento en producción.

Blogs que mencionan este modelo