Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Reader
Convierta cualquier URL a Markdown para un mejor anclaje de los LLM.
Embeddings
Embeddings multimodales y multilingües.
Reranker
Reranker para maximizar la relevancia de los resultados de búsqueda.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
warning
Este modelo está obsoleto por los modelos más nuevos.
Embeddings
Licencia Apache 2.0
open_in_new Publicación de lanzamiento

jina-embeddings-v2-base-zh

Embeddings bilingües chino-inglés con rendimiento SOTA
Licencia
Apache-2.0
Fecha de lanzamiento
calendar_month
2024-01-09
Entrada
abc
Texto
arrow_forward
Producción
more_horiz
Vector
Segmentación tardía help_outline
check_circle
Yes
Detalles del modelo
Parámetros: 161M
Longitud del token de entrada: 8K
Dimensión de salida: 768
Modelo base help_outline
jina-bert-v2-base-zh
Idiomas entrenados help_outline
2 idiomas
Modelos relacionados
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
Disponible a través de
API de Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Gráfico de E/S

Texto

jina-embeddings-v2-base-zh

Vector

Frontera de Paretohelp_outline
30M100M300M1B3.0B10B506070acge_text_embeddingbge-base-zhbge-base-zh-v1.5bge-large-zh-noinstructbge-small-zhbge-small-zh-v1.5Conan-embedding-v1Dmeta-embedding-zh-smalle5-mistral-7b-instructgte-base-zhgte-large-zhgte-multilingual-basegte-Qwen1.5-7B-instructgte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-small-zhluotuo-bert-mediumm3e-basem3e-largemultilingual-e5-basemultilingual-e5-largemultilingual-e5-smallpiccolo-base-zhpiccolo-large-zh-v2stella-base-zh-v2stella-base-zh-v3-1792dstella-large-zh-v2stella-mrl-large-zh-v3.…text2vec-base-chinesetext2vec-large-chinesexiaobu-embeddingxiaobu-embedding-v2Yinkazpoint_large_embedding_…Parámetros (log)score
Este modelo
En la frontera
Jina AI
Otros
C-MTEB
63.79
Parámetros
161M
Rango por score
23 / 40
Frontera de Pareto
Por detrás
Distribución de valoreshelp_outline
AUC 0.8373
Corpus
Pares de traducción
Búsqueda documental
0.6820.000.200.400.600.80
Relacionados12.6%
Negativo difícil1.8%
No relacionados1.2%
Umbrales recomendados
FPR 0.1 · 0.475
FPR 0.01 · 0.682
FPR 0.001 · 0.796
FPR 0.0001 · 0.835
equilibrado · 0.353
AUC
0.8373
Techo de ruido
0.793
Caída de exhaustividad
0.113
Pares medidos
119 / 11k
Componentes del vectorhelp_outline
-0.180.000.18
σ 0.0361 · 183k valores
Geometría del embeddinghelp_outline
0768
Media por dimensión, pasa el cursor para ver el rango
Suelo de ruido
0.308
Dim. efectivas
56 / 768
Elija modelos para comparar
Publicaciones (1)
arXiv
febrero 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Descripción general

jina-embeddings-v2-base-zh es un modelo de embeddings de texto bilingüe de 161M parámetros para chino e inglés con una ventana de contexto de 8.192 tokens y salida de 768 dimensiones. Fue el primer modelo de código abierto capaz de manejar chino e inglés a la vez con soporte de contexto largo, abordando los desafíos únicos de tokenización del texto chino basado en caracteres en arquitecturas de transformers.

Métodos

El modelo usa un backbone basado en BERT con codificaciones posicionales ALiBi bidireccionales simétricas, 161M parámetros y un espacio de salida de 768 dimensiones. El entrenamiento siguió un enfoque de tres fases: preentrenamiento inicial en datos bilingües de alta calidad chino-inglés, seguido de etapas de ajuste fino primario y secundario con pérdida contrastiva y minería de negativos difíciles. El mecanismo ALiBi habilita la ventana de contexto de 8.192 tokens sin embeddings posicionales aprendidos. Una mejora notable en la versión final fue una distribución de puntuaciones de similitud refinada que abordó los problemas de inflación de puntuaciones presentes en la versión de vista previa, produciendo puntuaciones de similitud más discriminativas y bien calibradas.

Rendimiento

En el leaderboard de C-MTEB (MTEB chino), el modelo demostró un rendimiento excepcional entre los modelos de menos de 0,5GB, destacando particularmente en tareas en chino. Superó significativamente a text-embedding-ada-002 de OpenAI en tareas de recuperación y similitud específicas del chino, manteniendo un rendimiento competitivo en tareas en inglés. La distribución refinada de puntuaciones de similitud mejoró la discriminación entre contenido relacionado y no relacionado en ambos idiomas. En 2026, jina-embeddings-v5-text-small reemplazó a este modelo con 89 idiomas, contexto de 32K y adaptadores LoRA específicos por tarea.

Guía

Óptimo para la recuperación bilingüe chino-inglés, la búsqueda de documentos entre lenguajes y el análisis de contenido multilingüe. Para documentos que excedan 8.192 tokens, use segmentación semántica o el parámetro `late_chunking a través de la API de Jina. El modelo se integra con las principales bases de datos vectoriales y marcos de RAG. Para nuevos proyectos multilingües, prefiera jina-embeddings-v5-text-small` (89 idiomas, contexto de 32K, adaptadores LoRA). Se recomienda una GPU con soporte CUDA para el rendimiento en producción. El texto de entrada debe estar en chino o en inglés; el modelo maneja ambos idiomas nativamente sin traducción.

Blogs que mencionan este modelo
abril 29, 2024 • 7 minutos de lectura
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
enero 31, 2024 • 16 minutos de lectura
A Deep Dive into Tokenization
Tokenization, in LLMs, means chopping input texts up into smaller parts for processing. So why are embeddings billed by the token?
Scott Martens
Colorful speckled grid pattern with a mix of small multicolored dots on a black background, creating a mosaic effect.
enero 26, 2024 • 13 minutos de lectura
Jina Embeddings v2 Bilingual Models Are Now Open-Source On Hugging Face
Jina AI's open-source bilingual embedding models for German-English and Chinese-English are now on Hugging Face. We’re going to walk through installation and cross-language retrieval.
Scott Martens
Colorful "EMBEDDINGS" text above a pile of yellow smileys on a black background with decorative lines at the top.
enero 09, 2024 • 12 minutos de lectura
8K Token-Length Bilingual Embeddings Break Language Barriers in Chinese and English
The first bilingual Chinese-English embedding model with 8192 token-length.
Jina AI
Colorful 3D text "OPEN" in green and blue on a black background creating a vibrant effect
Idioma / tema actual
Search Foundation
Reader
Embeddings
Reranker
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y su contenido, software, productos y servicios asociados están destinados exclusivamente a un uso profesional. El uso por parte de consumidores no está previsto ni dirigido.