Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
warning
Este modelo está obsoleto por los modelos más nuevos.
Incrustaciones
Licencia Apache 2.0

jina-embedding-b-en-v1

La primera versión del modelo Jina Embedding, el OG.
Licencia
Apache-2.0
Fecha de lanzamiento
calendar_month
2023-06-17
Aporte
abc
Texto
arrow_forward
Producción
more_horiz
Vector
Detalles del modelo
Parámetros: 110M
Longitud del token de entrada: 512
Dimensión de salida: 768
Modelo base help_outline
open_in_new
T5-Base Encoder
Idiomas entrenados help_outline
1 idiomas
Modelos relacionados
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
Disponible a través de
Hugging Face
Air-gapped
Gráfico de E/S

Texto

jina-embedding-b-en-v1

Vector

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
44.03
Parameters
110M
Rank by score
28 / 39
Pareto front
Behind it
Elige modelos para comparar
Publicaciones (1)
EMNLP 2023
julio 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models

Descripción general

Jina Embedding B v1 es un modelo de incrustación de texto especializado diseñado para transformar texto en inglés en representaciones numéricas de alta dimensión, manteniendo al mismo tiempo el significado semántico. El modelo aborda la necesidad crítica de incrustaciones de texto eficientes y precisas en entornos de producción, especialmente valiosas para organizaciones que requieren un equilibrio entre la eficiencia computacional y la calidad de incrustación. Con sus 110 millones de parámetros que generan incrustaciones de 768 dimensiones, sirve como una solución práctica para equipos que implementan búsqueda semántica, agrupación de documentos o sistemas de recomendación de contenido sin requerir recursos computacionales extensos.

Métodos

El modelo emplea una arquitectura basada en un codificador T5 mejorado con agrupamiento de medias para generar representaciones de longitud fija. Entrenado en el conjunto de datos Linnaeus-Clean cuidadosamente seleccionado, que contiene 385 millones de pares de oraciones de alta calidad filtrados de los 1.600 millones de pares iniciales, el modelo se sometió a un proceso de entrenamiento de dos fases. La primera fase utilizó aprendizaje contrastivo con pérdida de InfoNCE en pares de texto, mientras que la segunda fase incorporó entrenamiento de tripletes para refinar la capacidad del modelo para distinguir entre contenido similar y diferente. Este innovador enfoque de entrenamiento, combinado con un riguroso filtrado de datos que incluye detección de idioma y verificación de consistencia, permite que el modelo capture relaciones semánticas matizadas de manera efectiva.

Actuación

En evaluaciones del mundo real, Jina Embedding B v1 demuestra capacidades impresionantes, particularmente en tareas de similitud textual semántica. El modelo logra un rendimiento de vanguardia en STS12 con una puntuación de 0,751, superando a modelos establecidos como all-mpnet-base-v2 y all-minilm-l6-v2. Muestra un sólido rendimiento en varios puntos de referencia, al tiempo que mantiene tiempos de inferencia eficientes. Sin embargo, los usuarios deben tener en cuenta que el modelo está optimizado específicamente para contenido en idioma inglés y es posible que no funcione de manera óptima en tareas multilingües o específicas del código. Desde entonces, el modelo ha sido reemplazado por jina-embeddings-v2-base-en y jina-embeddings-v3, que ofrecen un rendimiento mejorado en una gama más amplia de casos de uso.

Guía

Para una implementación óptima, el modelo requiere una GPU compatible con CUDA, aunque su tamaño moderado permite una inferencia eficiente en hardware estándar. El modelo acepta secuencias de entrada de hasta 512 tokens de longitud y es particularmente adecuado para entornos de producción donde la generación de incrustaciones consistentes y confiables es crucial. Funciona mejor con contenido en inglés y es ideal para aplicaciones como búsqueda semántica, comparación de similitudes de documentos y sistemas de recomendación de contenido. Los equipos deben considerar el uso de las versiones más nuevas v2 o v3 para nuevos proyectos, ya que ofrecen un rendimiento mejorado y un soporte de idiomas más amplio. El modelo no se recomienda para tareas que requieran comprensión multilingüe o conocimiento de dominio especializado fuera del texto en inglés general.
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.