Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Reader
Convierta cualquier URL a Markdown para un mejor anclaje de los LLM.
Embeddings
Embeddings multimodales y multilingües.
Reranker
Reranker para maximizar la relevancia de los resultados de búsqueda.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
warning
Este modelo está obsoleto por los modelos más nuevos.
Embeddings
Licencia Apache 2.0
open_in_new Publicación de lanzamiento

jina-embeddings-v2-base-en

A la par con text-embedding-ada002 de OpenAI
Licencia
Apache-2.0
Fecha de lanzamiento
calendar_month
2023-10-28
Entrada
abc
Texto
arrow_forward
Producción
more_horiz
Vector
Segmentación tardía help_outline
check_circle
Yes
Detalles del modelo
Parámetros: 137M
Longitud del token de entrada: 8K
Dimensión de salida: 768
Idiomas entrenados help_outline
1 idiomas
Modelos relacionados
link
jina-embedding-b-en-v1
link
jina-embeddings-v3
Disponible a través de
API de Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Gráfico de E/S

Texto

jina-embeddings-v2-base-en

Vector

Frontera de Paretohelp_outline
MTEB English
RTEB public
LongEmbed
LoCo
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v2-base…Parámetros (log)nDCG@10
Este modelo
En la frontera
Jina AI
Otros
LongEmbed
58.12
Parámetros
137M
Rango por score
18 / 69
Frontera de Pareto
Por detrás
Distribución de valoreshelp_outline
AUC 0.8376
Corpus
Pares de traducción
Búsqueda documental
0.8500.600.700.800.90
Relacionados26.9%
Negativo difícil2.7%
No relacionados1.1%
Umbrales recomendados
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
equilibrado · 0.762
AUC
0.8376
Techo de ruido
0.893
Caída de exhaustividad
0.691
Pares medidos
119 / 11k
Componentes del vectorhelp_outline
-0.14-0.000.14
σ 0.0361 · 183k valores
Geometría del embeddinghelp_outline
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.751
Dim. efectivas
59 / 768
Elija modelos para comparar
Publicaciones (1)
arXiv
octubre 30, 2023
Jina Embeddings 2: 8192-Token General-Purpose Text Embeddings for Long Documents

Descripción general

jina-embeddings-v2-base-en es un modelo de embeddings de texto en inglés de 137M parámetros con una ventana de contexto de 8.192 tokens: 16 veces el límite estándar de 512 tokens de su época. Construido sobre un backbone BERT-small con ALiBi bidireccional simétrico (Attention with Linear Biases), fue el primer embedding de Jina de código abierto capaz de manejar documentos largos nativamente, sin truncamiento ni segmentación. Produce vectores de 768 dimensiones y sigue siendo una opción sólida para la recuperación solo en inglés cuando no se necesiten las funciones multilingües o de contexto largo de v3/v5.

Métodos

La arquitectura combina un transformador BERT-small (12 capas, 12 cabezas de atención, 768 dimensiones ocultas) con codificaciones posicionales ALiBi bidireccionales simétricas. ALiBi reemplaza los embeddings posicionales aprendidos con un sesgo de atención linealmente decreciente, permitiendo al modelo extrapolar mucho más allá de su longitud de entrenamiento de 512 tokens hasta 8.192 tokens sin degradación del rendimiento. El entrenamiento siguió una pipeline de dos etapas: preentrenamiento en C4, luego ajuste fino en la colección curada de Jina de 40+ conjuntos de datos de pares de oraciones especializados con minería de negativos difíciles. La atención bidireccional simétrica garantiza que cada token atienda tanto al contexto anterior como al posterior, produciendo representaciones que capturan el significado global de la oración. El pooling promedio sobre todas las representaciones de tokens produce el embedding final de 768 dimensiones.

Rendimiento

Al momento de su lanzamiento, el modelo superó a text-embedding-ada-002 de OpenAI en varias subtareas de MTEB en inglés: clasificación (73,45 % vs. 70,93 %), reordenación (85,38 % vs. 84,89 %), recuperación (56,98 % vs. 56,32 %) y resumen (31,6 % vs. 30,8 %). Su contexto de 8.192 tokens fue una ventaja significativa frente a los modelos competidores limitados a 512–2.048 tokens, permitiendo la recuperación a nivel de documento sin segmentación. La compacta huella de 307MB lo hizo desplegable en GPUs de consumo. En 2026, jina-embeddings-v5-text-small (677M parámetros, contexto de 32K, adaptadores LoRA específicos por tarea) lo supera para la mayoría de las cargas de trabajo de producción, pero sigue siendo relevante para pipelines ligeros solo en inglés.

Guía

Use este modelo para la recuperación solo en inglés cuando la ventana de contexto de 8K sea suficiente y no se requieran adaptadores multilingües o específicos por tarea. Para documentos que excedan 8.192 tokens, aplique segmentación semántica antes de incrustar. El modelo se integra con las principales bases de datos vectoriales (Qdrant, Weaviate, MongoDB Atlas, Milvus) y marcos de RAG (LangChain, LlamaIndex, Haystack). Para nuevos proyectos que requieran soporte multilingüe, contexto de 32K u optimización específica por tarea, prefiera jina-embeddings-v5-text-small. Se recomienda una GPU con soporte CUDA para el rendimiento en producción; la inferencia por CPU es posible pero notablemente más lenta.

Blogs que mencionan este modelo
diciembre 17, 2024 • 12 minutos de lectura
Text Embeddings Fail to Capture Word Order and How to Fix It
Text embedding models struggle with capturing subtle linguistic nuances like word order, directional relationships, temporal sequences, causal connections, comparisons, and negation. Understanding these challenges is key to improving model performance.
Bo Wang
Alex C-G
Three abstract figures in white, gray, and pink on matching cubes placed on a colorful checkered surface against a green back
octubre 25, 2024 • 19 minutos de lectura
Finding Optimal Breakpoints in Long Documents Using Small Language Models
We trained three small language models to better segment long documents into chunks, and here are the key lessons we learned.
Andrei Ungureanu
Alex C-G
A pattern of yellow file icons on a blue background with one icon displaying a smiley face creating an emotive contrast.
octubre 15, 2024 • 9 minutos de lectura
Fact-Checking with New Grounding API in Jina Reader
With the new g.jina.ai, you can easily ground statements to reduce LLM hallucinations or improve the integrity of human-written content.
Jina AI
Jina developer interface showing "Jina AI was founded in 2020" with controls labeled true and false, and web address on top.
septiembre 27, 2024 • 15 minutos de lectura
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
septiembre 18, 2024 • 10 minutos de lectura
Jina Embeddings v3: A Frontier Multilingual Embedding Model
jina-embeddings-v3 is a frontier multilingual text embedding model with 570M parameters and 8192 token-length, outperforming the latest proprietary embeddings from OpenAI and Cohere on MTEB.
Jina AI
Dynamic image showing the characters "V3" formed by bright green dots varying in size on a black background.
Idioma / tema actual
Search Foundation
Reader
Embeddings
Reranker
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y su contenido, software, productos y servicios asociados están destinados exclusivamente a un uso profesional. El uso por parte de consumidores no está previsto ni dirigido.