Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Reader
Convierta cualquier URL a Markdown para un mejor anclaje de los LLM.
Embeddings
Embeddings multimodales y multilingües.
Reranker
Reranker para maximizar la relevancia de los resultados de búsqueda.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
warning
Este modelo está obsoleto por los modelos más nuevos.
Embeddings
Licencia Apache 2.0
open_in_new Publicación de lanzamiento

jina-embeddings-v2-base-de

Embeddings bilingües alemán-inglés con rendimiento SOTA
Licencia
Apache-2.0
Fecha de lanzamiento
calendar_month
2024-01-15
Entrada
abc
Texto
arrow_forward
Producción
more_horiz
Vector
Segmentación tardía help_outline
check_circle
Yes
Detalles del modelo
Parámetros: 161M
Longitud del token de entrada: 8K
Dimensión de salida: 768
Modelo base help_outline
jina-bert-v2-base-de
Idiomas entrenados help_outline
2 idiomas
Modelos relacionados
link
jina-embeddings-v2-base-en
Disponible a través de
API de Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Gráfico de E/S

Texto

jina-embeddings-v2-base-de

Vector

Frontera de Paretohelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parámetros (log)nDCG@10
Este modelo
En la frontera
Jina AI
Otros
MTEB English · retrieval
44.10
Parámetros
161M
Rango por score
27 / 39
Frontera de Pareto
Por detrás
Distribución de valoreshelp_outline
AUC 0.8452
Corpus
Pares de traducción
Búsqueda documental
0.6900.000.200.400.600.80
Relacionados16.8%
Negativo difícil1.7%
No relacionados0.9%
Umbrales recomendados
FPR 0.1 · 0.499
FPR 0.01 · 0.690
FPR 0.001 · 0.796
FPR 0.0001 · 0.897
equilibrado · 0.368
AUC
0.8452
Techo de ruido
0.793
Caída de exhaustividad
0.195
Pares medidos
119 / 11k
Componentes del vectorhelp_outline
-0.19-0.010.17
σ 0.0361 · 183k valores
Geometría del embeddinghelp_outline
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.316
Dim. efectivas
49 / 768
Pares de idiomashelp_outline
de-ruen-deen-koen-zhja-ko
Dispersión del umbral entre pares: 0.158
Elija modelos para comparar
Publicaciones (1)
arXiv
febrero 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Descripción general

jina-embeddings-v2-base-de es un modelo de embeddings de texto bilingüe de 161M parámetros para alemán e inglés con una ventana de contexto de 8.192 tokens. Mapea contenido semánticamente equivalente en ambos idiomas al mismo espacio de embeddings de 768 dimensiones, permitiendo la recuperación entre lenguajes sin traducción. El modelo fue uno de los primeros modelos de embedding bilingües de código abierto en combinar el soporte de contexto largo con un rendimiento equilibrado en ambos idiomas.

Métodos

Construido sobre un backbone basado en BERT con codificaciones posicionales ALiBi bidireccionales simétricas, el modelo procesa tanto alemán como inglés a través de una arquitectura unificada de 161M parámetros que produce embeddings de 768 dimensiones. El entrenamiento incluyó tres etapas: (1) preentrenamiento multilingüe en corpus paralelos alemán-inglés, (2) ajuste fino contrastivo en pares de oraciones curados con negativos difíciles, y (3) entrenamiento de alineación entre lenguajes para asegurar que los textos semánticamente equivalentes en alemán e inglés se mapeen a regiones cercanas del espacio de embedding. Una decisión de diseño clave fue el objetivo de minimización de sesgo, que contrarresta la tendencia de los modelos multilingües a favorecer las estructuras gramaticales del inglés: un modo de fallo documentado en embeddings multilingües anteriores. La ventana de 8.192 tokens mediante ALiBi permite procesar documentos completos en cualquiera de los dos idiomas sin truncamiento.

Rendimiento

El modelo superó a E5-base de Microsoft siendo menos de un tercio de su tamaño, y alcanzó el rendimiento de E5-large a pesar de ser 7 veces más pequeño. En WikiCLIR (recuperación de inglés a alemán), STS17/STS22 (similitud semántica bidireccional) y BUCC (alineación de texto bilingüe), superó consistentemente a modelos de tamaño comparable o mayor. La huella de 322MB permitió su despliegue en hardware estándar. En 2026, jina-embeddings-v5-text-small reemplazó a este modelo para la mayoría de las aplicaciones, ofreciendo contexto de 32K, 89 idiomas y adaptadores LoRA específicos por tarea. El modelo v2-base-de sigue siendo útil para pipelines bilingües alemán-inglés donde el contexto de 8K es suficiente.

Guía

Óptimo para la recuperación bilingüe alemán-inglés: búsqueda de productos, documentación de soporte y gestión de contenido donde las consultas y los documentos pueden estar en idiomas distintos. Para documentos que excedan 8.192 tokens, use segmentación semántica o el parámetro `late_chunking a través de la API de Jina. El modelo se integra con Qdrant, Weaviate, MongoDB y Milvus. Para nuevos proyectos multilingües que abarquen más de dos idiomas, prefiera jina-embeddings-v5-text-small` (89 idiomas, contexto de 32K, adaptadores LoRA). Se recomienda una GPU con soporte CUDA para el rendimiento en producción.

Blogs que mencionan este modelo
septiembre 27, 2024 • 15 minutos de lectura
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
mayo 15, 2024 • 11 minutos de lectura
Binary Embeddings: All the AI, 3.125% of the Fat
32-bits is a lot of precision for something as robust and inexact as an AI model. So we got rid of 31 of them! Binary embeddings are smaller, faster and highly performant.
Sofia Vasileva
Scott Martens
Futuristic digital 3D model of a coffee grinder with blue neon lights on a black background, featuring numerical data.
abril 29, 2024 • 7 minutos de lectura
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
enero 31, 2024 • 16 minutos de lectura
A Deep Dive into Tokenization
Tokenization, in LLMs, means chopping input texts up into smaller parts for processing. So why are embeddings billed by the token?
Scott Martens
Colorful speckled grid pattern with a mix of small multicolored dots on a black background, creating a mosaic effect.
enero 26, 2024 • 13 minutos de lectura
Jina Embeddings v2 Bilingual Models Are Now Open-Source On Hugging Face
Jina AI's open-source bilingual embedding models for German-English and Chinese-English are now on Hugging Face. We’re going to walk through installation and cross-language retrieval.
Scott Martens
Colorful "EMBEDDINGS" text above a pile of yellow smileys on a black background with decorative lines at the top.
Idioma / tema actual
Search Foundation
Reader
Embeddings
Reranker
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y su contenido, software, productos y servicios asociados están destinados exclusivamente a un uso profesional. El uso por parte de consumidores no está previsto ni dirigido.