Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Reader
Convierta cualquier URL a Markdown para un mejor anclaje de los LLM.
Embeddings
Embeddings multimodales y multilingües.
Reranker
Reranker para maximizar la relevancia de los resultados de búsqueda.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
warning
Este modelo está obsoleto por los modelos más nuevos.
Embeddings
Licencia Apache 2.0
open_in_new Publicación de lanzamiento

jina-embeddings-v2-base-es

Incorporaciones bilingües español-inglés con rendimiento SOTA
Licencia
Apache-2.0
Fecha de lanzamiento
calendar_month
2024-02-14
Entrada
abc
Texto
arrow_forward
Producción
more_horiz
Vector
Segmentación tardía help_outline
check_circle
Yes
Detalles del modelo
Parámetros: 161M
Longitud del token de entrada: 8K
Dimensión de salida: 768
Modelo base help_outline
jina-bert-v2-base-es
Idiomas entrenados help_outline
2 idiomas
Modelos relacionados
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
Disponible a través de
API de Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Gráfico de E/S

Texto

jina-embeddings-v2-base-es

Vector

Frontera de Pareto help_outline
workspace_premium
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parámetros (log)Spearman
Este modelo
En la frontera
Jina AI
Otros
MTEB English · sts
83.50
Parámetros
161M
Rango por score
11 / 39
Frontera de Pareto
En ella
Distribución de valoreshelp_outline
AUC 0.8383
Corpus
Pares de traducción
Búsqueda documental
0.6830.000.200.400.600.80
Relacionados17.6%
Negativo difícil3.0%
No relacionados0.8%
Umbrales recomendados
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
equilibrado · 0.365
AUC
0.8383
Techo de ruido
0.774
Caída de exhaustividad
0.163
Pares medidos
119 / 11k
Componentes del vectorhelp_outline
-0.160.000.17
σ 0.0361 · 183k valores
Geometría del embeddinghelp_outline
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.326
Dim. efectivas
51 / 768
Pares de idiomashelp_outline
de-ruen-deen-koen-zhja-ko
Dispersión del umbral entre pares: 0.315
Elija modelos para comparar
Publicaciones (1)
arXiv
febrero 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Descripción general

jina-embeddings-v2-base-es es un modelo de embeddings de texto bilingüe de 161M parámetros para español e inglés, con una ventana de contexto de 8.192 tokens y salida de 768 dimensiones. Fue diseñado para la recuperación entre lenguajes en mercados de habla hispana, mapeando contenido semánticamente equivalente en español e inglés a un espacio de embedding compartido. El modelo aborda una brecha crítica: la mayoría de los modelos de embedding de la época eran centrados en inglés, con un rendimiento en español significativamente degradado.

Métodos

El modelo usa un backbone basado en BERT con codificaciones posicionales ALiBi bidireccionales simétricas, 161M parámetros y un espacio de salida de 768 dimensiones. El entrenamiento siguió un proceso de tres etapas: (1) preentrenamiento en corpus paralelos español-inglés, (2) ajuste fino contrastivo con minería de negativos difíciles en pares de oraciones curados, y (3) alineación entre lenguajes para asegurar que las representaciones en español e inglés del mismo concepto se agrupan juntas. El mecanismo ALiBi habilita la ventana de contexto de 8.192 tokens sin embeddings posicionales aprendidos, permitiendo al modelo extrapolar más allá de su longitud de entrenamiento de 512 tokens. El pooling promedio produce el vector de embedding final.

Rendimiento

El modelo superó a modelos multilingües significativamente mayores (E5, BGE-M3) en tareas de recuperación español-inglés, siendo solo el 15–30 % de su tamaño. Demostró un fuerte rendimiento en las subtareas de MTEB en español, particularmente en recuperación y agrupamiento. La ventana de contexto de 8.192 tokens ofreció un rendimiento consistente en documentos de varias páginas donde la mayoría de los modelos competidores requerían segmentación. En 2026, jina-embeddings-v5-text-small reemplazó a este modelo, ofreciendo 89 idiomas, contexto de 32K y adaptadores LoRA específicos por tarea. El modelo v2-base-es sigue siendo una opción rentable para pipelines dedicados de español e inglés.

Guía

Ideal para la búsqueda bilingüe español-inglés, la recomendación de contenido y el análisis de documentos entre lenguajes. Para documentos que excedan 8.192 tokens, use segmentación semántica o el parámetro `late_chunking a través de la API de Jina. El modelo se integra con las principales bases de datos vectoriales y marcos de RAG. Para nuevos proyectos que requieran cobertura multilingüe más allá de español-inglés, contexto de 32K u optimización específica por tarea, prefiera jina-embeddings-v5-text-small`. Se recomienda una GPU con soporte CUDA para producción. El texto de entrada debe estar en español o en inglés; se admite entrada de idiomas mixtos, pero el rendimiento está optimizado para los dos idiomas entrenados.

Blogs que mencionan este modelo
abril 29, 2024 • 7 minutos de lectura
Embeddings y Reranker de Jina en Azure: Soluciones de IA escalables y listas para negocios
Los Jina Embeddings y Rerankers están ahora disponibles en Azure Marketplace. Las empresas que priorizan la privacidad y la seguridad ahora pueden integrar fácilmente los modelos de última generación de Jina AI directamente en su ecosistema Azure existente.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
febrero 14, 2024 • 4 minutos de lectura
Aquí Se Habla Español: Embeddings Español-Inglés de Alta Calidad y Contexto de 8k
El nuevo modelo de embeddings bilingüe español-inglés de Jina AI lleva la tecnología AI más avanzada a medio billón de hispanohablantes.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
Idioma / tema actual
Search Foundation
Reader
Embeddings
Reranker
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y su contenido, software, productos y servicios asociados están destinados exclusivamente a un uso profesional. El uso por parte de consumidores no está previsto ni dirigido.