Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Points forts
Performances de premier plan sur C-MTEB
Donner aux entreprises chinoises les moyens de leur expansion mondiale
Commencez avec jina-embeddings-v2-base-zh via API
Prochaines étapes : Extension du support linguistique et intégration AWS Sagemaker
Un grand merci à nos premiers testeurs
Nouveau modèle bilingue chinois-anglais 8K : un outil essentiel pour l'expansion internationale des entreprises !
communiqué de presse
janvier 09, 2024

Des embeddings bilingues d'une longueur de 8K tokens brisent les barrières linguistiques en chinois et en anglais

Le premier modèle d'embedding bilingue chinois-anglais avec une longueur de token de 8192.
Colorful 3D text "OPEN" in green and blue on a black background creating a vibrant effect
Jina AI • 11 minutes lues

Suite au succès remarquable des précédents Embeddings V2, nous sommes ravis d'annoncer le lancement de notre dernier modèle d'embedding de texte bilingue chinois/anglais : jina-embeddings-v2-base-zh. Ce nouveau modèle hérite de l'exceptionnelle longueur de 8K tokens des Jina Embeddings V2, avec désormais un support robuste pour les langues chinoise et anglaise.

jina-embeddings-v2-base-zh se distingue par sa qualité et ses performances exceptionnelles, obtenues grâce à un pré-entraînement rigoureux et équilibré avec des données bilingues de haute qualité. Cette approche assure une réduction significative des biais, souvent observés dans les modèles entraînés avec des données multilingues déséquilibrées.

tagPoints forts

  • Modèle bilingue : Ce modèle encode les textes en anglais et en chinois, permettant l'utilisation de l'une ou l'autre langue comme requête ou document cible. Les textes ayant des significations équivalentes dans ces langues sont mappés dans le même espace d'embedding, formant la base de nombreuses applications multilingues.
  • Longueur étendue de 8K tokens : Notre modèle est capable de traiter des passages de texte significativement plus longs, une caractéristique qui dépasse les capacités de la plupart des autres modèles open-source.
  • Compact et efficace : Avec une taille de 322MB (161 millions de paramètres) et des dimensions de sortie de 768, notre modèle est conçu pour des performances élevées sur du matériel informatique standard sans GPU, améliorant son accessibilité.

tagPerformances de premier plan sur C-MTEB

Dans le classement Chinese MTEB, nos Jina Embeddings v2, supportant à la fois le chinois et l'anglais, se distinguent comme l'un des meilleurs modèles de moins de 0,5GB. Ce qui le démarque est sa impressionnante capacité de 8K tokens, une caractéristique unique dans sa catégorie.

Table comparing Chinese AI models' rankings and statistics, including model names, sizes, and C-MTEB scores

Parmi les modèles chinois de taille similaire, seuls le modèle E5 Multilingual et notre jina-embeddings-v2-base-zh offrent un support pour l'anglais, permettant des applications multilingues efficaces. Notamment, Jina démontre des performances nettement supérieures dans toutes les catégories impliquant la langue chinoise.

Technical table comparing performance of language retrieval models, including average and overall scores for tasks like Eng-to-Chn

Bien que les deux modèles aient une taille de contexte de 8K tokens, jina-embeddings-v2-base-zh surpasse significativement text-embedding-ada-002 d'OpenAI, particulièrement dans les tâches impliquant la langue chinoise.

Comparative table of AI models with columns for model name, size, context, embedding size, and C-MTEB average score

tagDonner aux entreprises chinoises les moyens de leur expansion mondiale

Notre modèle d'embedding chinois-anglais est un outil puissant pour les entreprises chinoises cherchant à "aller global" (出海). Il traite parfaitement les textes chinois, fournissant des embeddings de haute qualité qui s'intègrent facilement avec les principales bases de données vectorielles, systèmes de recherche et applications RAG.

jina-embeddings-v2-base-zh est particulièrement bénéfique pour développer des applications d'IA adaptées aux contextes chinois-anglais, crucial pour les entreprises en expansion internationale. Voici quelques cas d'utilisation spécifiques :

  1. Analyse et gestion documentaire : Il peut analyser et gérer une vaste gamme de documents, facilitant les transactions juridiques et commerciales internationales.
  2. Applications de recherche alimentées par l'IA : Améliore les fonctions de recherche dans des environnements multilingues, facilitant la recherche d'informations pertinentes en chinois et en anglais pour les utilisateurs mondiaux.
  3. Chatbots et questions-réponses basés sur la récupération : Construit des bots de service client bilingues efficaces, améliorant les interactions avec les clients du monde entier.
  4. Applications de traitement du langage naturel : Cela inclut l'analyse des sentiments pour comprendre les tendances du marché mondial, la modélisation des sujets pour les stratégies marketing internationales et la classification des textes pour gérer la communication mondiale.
  5. Systèmes de recommandation : Personnalise les recommandations de produits et de contenus pour divers publics mondiaux, en utilisant des insights tirés des données chinoises et anglaises.

En utilisant ce modèle, les entreprises chinoises peuvent combler efficacement le fossé linguistique dans leurs applications d'IA, améliorant leur compétitivité mondiale et leur portée sur le marché.

tagCommencez avec jina-embeddings-v2-base-zh via API

Commencez à intégrer notre modèle dans votre flux de travail immédiatement via l'API Embeddings. Visitez simplement notre portail Embeddings, obtenez votre clé d'accès gratuite ou rechargez une clé existante, puis choisissez jina-embeddings-v2-base-zh dans le menu déroulant. C'est aussi simple que ça pour commencer !

Embedding API
Top-performing, 8192-token context length, $100 for 1.25B tokens, seamless OpenAI alternative, free trial
AI platform interface with options like USAGE and TEST, and highlighting the "Chinese-English bilingual embeddings with SOTA performance.

tagProchaines étapes : Extension du support linguistique et intégration AWS Sagemaker

jina-embeddings-v2-base-zh sera bientôt disponible via AWS Sagemaker et Hugging Face.

AWS Marketplace: Jina AI
jinaai (Jina AI)
embeddings, prompts, multimodal AI

Chez Jina AI, notre engagement à être un leader dans la technologie d'embedding abordable et accessible pour un public mondial est inébranlable. Nous développons activement des offres multilingues supplémentaires, en nous concentrant sur les principales langues européennes et internationales, pour élargir notre portée. Restez à l'écoute pour ces mises à jour passionnantes, y compris l'intégration avec AWS SageMaker, alors que nous continuons à étendre nos capacités.

tagUn grand merci à nos premiers testeurs

Nous sommes immensément reconnaissants envers les membres sélectionnés de notre communauté d'utilisateurs chinois qui ont testé la version préliminaire (jina-embeddings-v2-base-zh-preview). Leurs retours perspicaces ont été cruciaux pour améliorer les performances de la version officielle. Si vous avez des observations ou des suggestions concernant la qualité de nos modèles, nous vous invitons chaleureusement à rejoindre notre serveur Discord et à partager vos réflexions avec nous. Votre contribution est inestimable dans notre parcours d'amélioration continue.

Rejoignez le serveur Discord de Jina AI !
Rejoignez la communauté Jina AI sur Discord - échangez avec 4182 autres membres et profitez des chats vocaux et textuels gratuits.
Discord

Amélioration de la distribution des scores vs. jina-embeddings-v2-base-zh-preview

jina-embeddings-v2-base-zh-preview souffrait de scores de similarité gonflés, donnant des scores de cosinus élevés même pour des éléments non liés. Cela était particulièrement évident dans les 5 premiers résultats de la capture d'écran ci-dessous. Les scores de similarité étaient systématiquement élevés et ne reflétaient pas précisément la véritable relation entre les éléments. Par exemple, la comparaison entre "安妮" et "蒸汽机" a reçu des scores de similarité trompeusement élevés.

Dans la version officielle, nous avons affiné le modèle pour produire des scores de similarité plus distincts et logiques, assurant une représentation plus précise des relations entre les éléments. Par exemple, la notation révisée présente maintenant une gamme plus large, offrant une meilleure compréhension de la similarité relative entre les éléments.

De plus, Jina Embeddings est désormais le seul modèle d'embedding open-source supportant 8192 tokens. Cette fonctionnalité souligne sa capacité à traiter une grande variété de types de données, des documents volumineux aux phrases brèves, ou même des mots/noms individuels comme "安妮" vs "露娜".

Table comparing similarity scores between the character "安妮" and various others, with rows for different characters and columns for similarity attributes

tagNouveau modèle bilingue chinois-anglais 8K : un outil essentiel pour l'expansion internationale des entreprises !

Après le succès de notre Embeddings V2, nous lançons aujourd'hui un nouveau grand modèle de vecteurs textuels bilingue chinois-anglais : jina-embeddings-v2-base-zh. Ce modèle hérite de tous les avantages de V2, peut traiter des textes jusqu'à 8000 tokens, et gère parfaitement le contenu bilingue chinois-anglais, ouvrant la voie aux applications multilingues.

L'excellence de jina-embeddings-v2-base-zh repose sur un dataset bilingue de qualité et notre pré-entraînement rigoureux, suivi d'un premier et second fine-tuning. Cette approche en trois étapes a non seulement généralisé les capacités bilingues du modèle mais a aussi efficacement réduit les biais, résolvant le problème courant de "déséquilibre" des modèles multilingues.

tagAperçu des caractéristiques du modèle

Caractéristique 1 : Intégration bilingue transparente

Le modèle jina-embeddings-v2-base-zh traite aisément les textes en chinois et en anglais, que ce soit pour les requêtes de recherche ou les documents cibles. Les contenus similaires en chinois et en anglais sont mappés dans le même espace vectoriel, posant ainsi une base solide pour les applications multilingues.

Caractéristique 2 : Support des longs textes jusqu'à 8K Tokens

Notre modèle prend en charge les textes jusqu'à 8K Tokens, une caractéristique unique parmi les modèles vectoriels open source, offrant un avantage significatif pour le traitement de longs passages de texte.

Caractéristique 3 : Structure de modèle compacte et efficace

Le modèle jina-embeddings-v2-base-zh, avec sa taille légère de 322MB (comprenant 161 millions de paramètres) et une dimension de sortie de 768, peut fonctionner efficacement sur du matériel informatique standard sans nécessiter de GPU, augmentant considérablement son utilité et sa praticité.

tagPerformance exceptionnelle du modèle

Dans le classement CMTEB très compétitif, notre modèle Jina Embeddings v2 se distingue dans la catégorie des modèles de moins de 0,5 GB. Il supporte non seulement les textes chinois et anglais, mais peut également traiter des textes jusqu'à 8K Tokens, une capacité rare parmi les modèles similaires.

Chart comparing Chinese AI models with details like names, sizes, embedding dimensions, and average C-MTEB scores

Parmi les modèles de taille similaire supportant le chinois, Multilingual E5 et notre jina-embeddings-v2-base-zh sont les deux seuls capables de traiter l'anglais, rendant possibles les applications multilingues.

Data comparison table of language retrieval models with metrics for Eng-to-Chn, Chn-to-Eng, and Eng-to-Eng retrievals

Actuellement, à l'échelle mondiale, seuls le modèle propriétaire text-embedding-ada-002 d'OpenAI et Jina Embeddings peuvent supporter des entrées de texte long de 8k Tokens. En ce qui concerne le traitement des tâches en chinois, Jina Embeddings montre des performances nettement supérieures.

A detailed table comparing three AI models, highlighting their size, context, embedding size, and C-MTEB average score

tagSoutenir l'expansion mondiale des entreprises chinoises

Notre modèle vectoriel bilingue jina-embeddings-v2-base-zh est un partenaire puissant pour les entreprises chinoises cherchant à s'étendre sur le marché international. Il peut traiter de manière transparente les textes en chinois et en anglais, fournir des représentations vectorielles de texte de haute qualité, et s'intégrer facilement dans des bases de données vectorielles avancées, des systèmes de recherche et des applications RAG.
Ce modèle est particulièrement adapté pour créer des applications d'IA adaptées aux scénarios bilingues chinois-anglais, ce qui est inestimable pour les entreprises visant une expansion mondiale. Voici quelques cas d'utilisation pratiques :

  • Analyse et gestion documentaire : analyse et gestion de documents massifs, facilitant les transactions juridiques et commerciales internationales.
  • Applications de recherche basées sur l'IA : améliorer les performances de recherche dans un environnement multilingue, aidant les utilisateurs du monde entier à trouver facilement des informations en chinois et en anglais.
  • Chatbots et systèmes de questions-réponses améliorés : créer des chatbots de service client bilingues efficaces, optimisant l'expérience de communication avec les clients internationaux.
  • Applications de traitement du langage naturel : couvrant l'analyse des tendances du marché mondial, la modélisation thématique pour les stratégies de marché internationales, et la classification de texte pour la gestion des communications mondiales.
  • Systèmes de recommandation : utiliser les insights des données chinoises et anglaises pour fournir des recommandations personnalisées de produits et de contenus à un public mondial diversifié.

Grâce à ce modèle, les entreprises chinoises peuvent franchir la barrière linguistique dans le domaine des applications IA et prendre l'avantage sur le marché mondial.

tagPrise en main facile de jina-embeddings-v2-base-zh

Vous souhaitez intégrer rapidement notre modèle de vecteurs bilingue dans votre workflow ? C'est simple : visitez https://jina.ai/embeddings, obtenez votre clé API gratuite ou mettez à jour votre clé existante, puis sélectionnez jina-embeddings-v2-base-zh dans le menu déroulant. Votre modèle est immédiatement prêt à être exploré et utilisé !

Embedding API
Top-performing, 8192-token context length, $100 for 1.25B tokens, seamless OpenAI alternative, free trial
Technical webpage displaying code and API references with sections for usage, FAQ, and model details

tagPerspectives d'avenir : support multilingue et intégration approfondie avec AWS SageMaker

jina-embeddings-v2-base-zh sera bientôt disponible sur AWS SageMaker et HuggingFace, offrant un service encore plus pratique aux utilisateurs.

AWS Marketplace: Jina AI
jinaai (Jina AI)
embeddings, prompts, multimodal AI

Nous travaillons activement sur des modèles de vecteurs multilingues, particulièrement pour les langues européennes et internationales, afin de répondre aux besoins diversifiés des utilisateurs mondiaux. Restez à l'écoute pour nos passionnantes mises à jour à venir, notamment l'intégration approfondie avec AWS SageMaker, alors que nous continuons d'approfondir et d'élargir notre gamme de services.

tagRemerciements : merci aux testeurs précoces pour leurs précieuses contributions

Nous remercions sincèrement les membres de la communauté chinoise qui ont participé aux tests de jina-embeddings-v2-base-zh-preview. Vos précieux retours ont joué un rôle crucial dans l'optimisation de notre modèle. Si vous avez des suggestions ou des idées lors de votre utilisation, n'hésitez pas à nous en faire part. Chacun de vos retours est un moteur de notre progrès continu.

Join the Jina AI Discord Server!
Check out the Jina AI community on Discord - hang out with 4182 other members and enjoy free voice and text chat.
Discord

La version officielle résout le problème d'inflation des scores de la version preview

Par rapport à la version preview précédente, le modèle officiel fournit des scores de similarité plus dispersés et plus raisonnables. Dans les tests de la version preview, notre modèle montrait une inflation des scores de similarité, où même des mots totalement sans rapport comme 'Annie' et 'machine à vapeur' obtenaient une similarité cosinus très élevée. Dans la version officielle, nous avons optimisé le modèle pour garantir des scores de similarité plus raisonnables, reflétant ainsi plus précisément les relations entre les contenus.

De plus, Jina Embeddings prend désormais en charge le traitement de textes jusqu'à 8192 Token, qu'il s'agisse de longs discours, de phrases courtes, ou même de mots ou noms isolés (comme la comparaison entre "Annie" et "Luna"), démontrant sa puissante capacité à traiter divers types de données. Cette amélioration augmente non seulement la précision du modèle, mais renforce également sa flexibilité et son utilité dans le traitement de données diversifiées.

Detailed table with sentence similarity scores for Chinese entities, showcasing precision and recall values ranging from 0 to 1
Catégories:
communiqué de presse
rss_feed

En savoir plus
août 03, 2026 • 11 minutes lues
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
mai 12, 2026 • 7 minutes lues
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
février 19, 2026 • 7 minutes lues
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.