Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
warning
Ce modèle est obsolète pour les modèles plus récents.
Embeddings
Licence Apache 2.0
open_in_new Article de lancement

jina-embeddings-v2-base-zh

Embeddings bilingues chinois-anglais avec performances SOTA
Licence
Apache-2.0
Date de sortie
calendar_month
2024-01-09
Saisie
abc
Texte
arrow_forward
Sortir
more_horiz
Vecteur
Chunking tardif help_outline
check_circle
Yes
Détails du modèle
Paramètres: 161M
Longueur du token d'entrée: 8K
Dimension de sortie: 768
Modèle de base help_outline
jina-bert-v2-base-zh
Langues enseignées help_outline
2 langues
Modèles associés
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
Disponible via
API Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Graphique d'E/S

Texte

jina-embeddings-v2-base-zh

Vecteur

Frontière de Paretohelp_outline
30M100M300M1B3.0B10B506070acge_text_embeddingbge-base-zhbge-base-zh-v1.5bge-large-zh-noinstructbge-small-zhbge-small-zh-v1.5Conan-embedding-v1Dmeta-embedding-zh-smalle5-mistral-7b-instructgte-base-zhgte-large-zhgte-multilingual-basegte-Qwen1.5-7B-instructgte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-small-zhluotuo-bert-mediumm3e-basem3e-largemultilingual-e5-basemultilingual-e5-largemultilingual-e5-smallpiccolo-base-zhpiccolo-large-zh-v2stella-base-zh-v2stella-base-zh-v3-1792dstella-large-zh-v2stella-mrl-large-zh-v3.…text2vec-base-chinesetext2vec-large-chinesexiaobu-embeddingxiaobu-embedding-v2Yinkazpoint_large_embedding_…Paramètres (log)score
Ce modèle
Sur la frontière
Jina AI
Autres
C-MTEB
63.79
Paramètres
161M
Rang par score
23 / 40
Frontière de Pareto
Derrière
Distribution des valeurshelp_outline
AUC 0.8373
Corpus
Paires de traduction
Recherche documentaire
0.6820.000.200.400.600.80
Liées12.6%
Négatif difficile1.8%
Non liées1.2%
Seuils recommandés
FPR 0.1 · 0.475
FPR 0.01 · 0.682
FPR 0.001 · 0.796
FPR 0.0001 · 0.835
équilibré · 0.353
AUC
0.8373
Plafond de bruit
0.793
Décrochage du rappel
0.113
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.180.000.18
σ 0.0361 · 183k valeurs
Géométrie des embeddingshelp_outline
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.308
Dim. effectives
56 / 768
Choisissez les modèles à comparer
Publications (1)
arXiv
février 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Aperçu

jina-embeddings-v2-base-zh est un modèle d'embedding de texte bilingue de 161M paramètres pour le chinois et l'anglais, avec une fenêtre de contexte de 8 192 tokens et une sortie de 768 dimensions. Il fut le premier modèle open source à traiter le chinois et l'anglais sans couture avec un support du long contexte, abordant les défis uniques de tokenisation du texte chinois basé sur les caractères dans les architectures transformeur.

Méthodes

Le modèle utilise un backbone basé sur BERT avec des encodings positionnels ALiBi bidirectionnels symétriques, 161M paramètres et un espace de sortie de 768 dimensions. L'entraînement a suivi une approche en trois phases : un pré-entraînement initial sur des données bilingues de haute qualité chinois-anglais, suivi d'étapes d'ajustement fin primaire et secondaire avec une perte contrastive et le minage de négatifs difficiles. Le mécanisme ALiBi permet la fenêtre de contexte de 8 192 tokens sans embeddings positionnels appris. Une amélioration notable dans la version finale fut une distribution de scores de similarité affinée qui a corrigé les problèmes d'inflation de scores présents dans la version d'aperçu, produisant des scores de similarité plus discriminants et mieux calibrés.

Performance

Sur le leaderboard C-MTEB (MTEB chinois), le modèle a montré une performance exceptionnelle parmi les modèles de moins de 0,5Go, se distinguant particulièrement sur les tâches en chinois. Il a nettement surpassé text-embedding-ada-002 d'OpenAI sur les tâches de recherche et de similarité spécifiques au chinois, tout en maintenant une performance compétitive sur les tâches en anglais. La distribution affinée des scores de similarité a amélioré la discrimination entre les contenus apparentés et non apparentés dans les deux langues. En 2026, jina-embeddings-v5-text-small remplace ce modèle avec 89 langues, un contexte de 32K et des adaptateurs LoRA spécifiques aux tâches.

Conseils

Optimal pour la recherche bilingue chinois-anglais, la recherche interlingue de documents et l'analyse de contenu multilingue. Pour les documents dépassant 8 192 tokens, utilisez le découpage sémantique ou le paramètre `late_chunking via l'API Jina. Le modèle s'intègre avec les principales bases de données vectorielles et les frameworks RAG. Pour les nouveaux projets multilingues, préférez jina-embeddings-v5-text-small` (89 langues, contexte de 32K, adaptateurs LoRA). Une GPU compatible CUDA est recommandée pour le débit en production. Le texte d'entrée doit être en chinois ou en anglais ; le modèle traite les deux langues nativement sans traduction.

Blogs qui mentionnent ce modèle
avril 29, 2024 • 7 minutes lues
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
janvier 31, 2024 • 16 minutes lues
A Deep Dive into Tokenization
Tokenization, in LLMs, means chopping input texts up into smaller parts for processing. So why are embeddings billed by the token?
Scott Martens
Colorful speckled grid pattern with a mix of small multicolored dots on a black background, creating a mosaic effect.
janvier 26, 2024 • 13 minutes lues
Jina Embeddings v2 Bilingual Models Are Now Open-Source On Hugging Face
Jina AI's open-source bilingual embedding models for German-English and Chinese-English are now on Hugging Face. We’re going to walk through installation and cross-language retrieval.
Scott Martens
Colorful "EMBEDDINGS" text above a pile of yellow smileys on a black background with decorative lines at the top.
janvier 09, 2024 • 12 minutes lues
8K Token-Length Bilingual Embeddings Break Language Barriers in Chinese and English
The first bilingual Chinese-English embedding model with 8192 token-length.
Jina AI
Colorful 3D text "OPEN" in green and blue on a black background creating a vibrant effect
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reclasseur
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.