Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
warning
Este modelo está obsoleto por los modelos más nuevos.
Incrustaciones
Licencia Apache 2.0
open_in_new Publicación de lanzamiento

jina-embeddings-v2-base-es

Incorporaciones bilingües español-inglés con rendimiento SOTA
Licencia
Apache-2.0
Fecha de lanzamiento
calendar_month
2024-02-14
Aporte
abc
Texto
arrow_forward
Producción
more_horiz
Vector
Fragmentación tardía help_outline
check_circle
Yes
Detalles del modelo
Parámetros: 161M
Longitud del token de entrada: 8K
Dimensión de salida: 768
Modelo base help_outline
open_in_new
jina-embeddings-v2-base-en
Idiomas entrenados help_outline
2 idiomas
Modelos relacionados
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
Disponible a través de
API de Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Gráfico de E/S

Texto

jina-embeddings-v2-base-es

Vector

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
Distribución de valoreshelp_outline
AUC 0.8383
Corpus
Pares de traducción
Búsqueda documental
0.6830.000.200.400.600.80
Relacionados17.6%
Negativo difícil3.0%
No relacionados0.8%
Umbrales recomendados
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
equilibrado · 0.365
AUC
0.8383
Techo de ruido
0.774
Caída de exhaustividad
0.163
Pares medidos
119 / 11k
Componentes del vectorhelp_outline
-0.160.000.17
σ 0.0361 · 183k valores
Geometría del embeddinghelp_outline
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.326
Dim. efectivas
51 / 768
Pares de idiomashelp_outline
de-ruen-deen-koen-zhja-ko
Dispersión del umbral entre pares: 0.315
Elige modelos para comparar
Publicaciones (1)
arXiv
febrero 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Descripción general

Jina Embeddings v2 Base Spanish es un innovador modelo de incrustación de texto bilingüe que aborda el desafío crítico de la recuperación y el análisis de información entre contenido en español e inglés. A diferencia de los modelos multilingües tradicionales que a menudo muestran un sesgo hacia idiomas específicos, este modelo ofrece un rendimiento verdaderamente equilibrado tanto en español como en inglés, lo que lo hace indispensable para las organizaciones que operan en mercados de habla hispana o que manejan contenido bilingüe. La característica más notable del modelo es su capacidad de generar incrustaciones alineadas geométricamente: cuando los textos en español e inglés expresan el mismo significado, sus representaciones vectoriales se agrupan naturalmente en el espacio de incrustación, lo que permite una búsqueda y un análisis sin problemas entre idiomas.

Métodos

En el corazón de este modelo se encuentra una arquitectura innovadora basada en ALiBi (Atención con sesgos lineales) bidireccional simétrico, un enfoque sofisticado que permite el procesamiento de secuencias de hasta 8192 tokens sin incrustaciones posicionales tradicionales. El modelo utiliza una arquitectura BERT modificada con 161 millones de parámetros, que incorpora unidades lineales controladas (GLU) y técnicas de normalización de capas especializadas. El entrenamiento sigue un proceso de tres etapas: preentrenamiento inicial en un corpus de texto masivo, seguido de un ajuste fino con pares de texto cuidadosamente seleccionados y, finalmente, entrenamiento negativo duro para mejorar la discriminación entre contenido similar pero semánticamente distinto. Este enfoque, combinado con incrustaciones de 768 dimensiones, permite que el modelo capture relaciones semánticas matizadas al tiempo que mantiene la eficiencia computacional.

Actuación

En evaluaciones comparativas exhaustivas, el modelo demuestra capacidades excepcionales, en particular en tareas de recuperación en varios idiomas, donde supera a modelos multilingües significativamente más grandes como E5 y BGE-M3 a pesar de tener solo un 15-30 % de su tamaño. El modelo logra un rendimiento superior en tareas de recuperación y agrupamiento, mostrando una fortaleza particular en la búsqueda de coincidencias de contenido semánticamente equivalente en varios idiomas. Cuando se prueba en el benchmark MTEB, exhibe un rendimiento sólido en varias tareas, incluidas la clasificación, el agrupamiento y la similitud semántica. La ventana de contexto extendida de 8192 tokens resulta especialmente valiosa para el procesamiento de documentos largos, mostrando un rendimiento constante incluso con documentos que abarcan varias páginas, una capacidad de la que carecen la mayoría de los modelos de la competencia.

Guía

Para utilizar este modelo de manera eficaz, las organizaciones deben garantizar el acceso a una infraestructura de GPU compatible con CUDA para lograr un rendimiento óptimo. El modelo se integra perfectamente con las principales bases de datos vectoriales y marcos RAG, incluidos MongoDB, Qdrant, Weaviate y Haystack, lo que lo hace fácilmente implementable en entornos de producción. Se destaca en aplicaciones como búsqueda de documentos bilingües, sistemas de recomendación de contenido y análisis de documentos en varios idiomas. Si bien el modelo muestra una versatilidad impresionante, está particularmente optimizado para escenarios bilingües español-inglés y puede no ser la mejor opción para aplicaciones monolingües o escenarios que involucran otros pares de idiomas. Para obtener resultados óptimos, los textos de entrada deben tener el formato adecuado en español o inglés, aunque el modelo maneja contenido en varios idiomas de manera eficaz. El modelo admite el ajuste fino para aplicaciones específicas del dominio, pero esto debe abordarse considerando cuidadosamente la calidad y distribución de los datos de entrenamiento.
Blogs que mencionan este modelo
abril 29, 2024 • 7 minutos de lectura
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
febrero 14, 2024 • 4 minutos de lectura
Aquí Se Habla Español: Top-Quality Spanish-English Embeddings and 8k Context
Jina AI's new bilingual Spanish-English embedding model brings the state-of-the-art in AI to half a billion Spanish speakers.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.