Suite au succès remarquable des précédents Embeddings V2, nous sommes ravis d'annoncer le lancement de notre dernier modèle d'embedding de texte bilingue chinois/anglais : jina-embeddings-v2-base-zh. Ce nouveau modèle hérite de l'exceptionnelle longueur de 8K tokens des Jina Embeddings V2, avec désormais un support robuste pour les langues chinoise et anglaise.
jina-embeddings-v2-base-zh se distingue par sa qualité et ses performances exceptionnelles, obtenues grâce à un pré-entraînement rigoureux et équilibré avec des données bilingues de haute qualité. Cette approche assure une réduction significative des biais, souvent observés dans les modèles entraînés avec des données multilingues déséquilibrées.
tagPoints forts
- Modèle bilingue : Ce modèle encode les textes en anglais et en chinois, permettant l'utilisation de l'une ou l'autre langue comme requête ou document cible. Les textes ayant des significations équivalentes dans ces langues sont mappés dans le même espace d'embedding, formant la base de nombreuses applications multilingues.
- Longueur étendue de 8K tokens : Notre modèle est capable de traiter des passages de texte significativement plus longs, une caractéristique qui dépasse les capacités de la plupart des autres modèles open-source.
- Compact et efficace : Avec une taille de 322MB (161 millions de paramètres) et des dimensions de sortie de 768, notre modèle est conçu pour des performances élevées sur du matériel informatique standard sans GPU, améliorant son accessibilité.
tagPerformances de premier plan sur C-MTEB
Dans le classement Chinese MTEB, nos Jina Embeddings v2, supportant à la fois le chinois et l'anglais, se distinguent comme l'un des meilleurs modèles de moins de 0,5GB. Ce qui le démarque est sa impressionnante capacité de 8K tokens, une caractéristique unique dans sa catégorie.

Parmi les modèles chinois de taille similaire, seuls le modèle E5 Multilingual et notre jina-embeddings-v2-base-zh offrent un support pour l'anglais, permettant des applications multilingues efficaces. Notamment, Jina démontre des performances nettement supérieures dans toutes les catégories impliquant la langue chinoise.

Bien que les deux modèles aient une taille de contexte de 8K tokens, jina-embeddings-v2-base-zh surpasse significativement text-embedding-ada-002 d'OpenAI, particulièrement dans les tâches impliquant la langue chinoise.

tagDonner aux entreprises chinoises les moyens de leur expansion mondiale
Notre modèle d'embedding chinois-anglais est un outil puissant pour les entreprises chinoises cherchant à "aller global" (出海). Il traite parfaitement les textes chinois, fournissant des embeddings de haute qualité qui s'intègrent facilement avec les principales bases de données vectorielles, systèmes de recherche et applications RAG.
jina-embeddings-v2-base-zh est particulièrement bénéfique pour développer des applications d'IA adaptées aux contextes chinois-anglais, crucial pour les entreprises en expansion internationale. Voici quelques cas d'utilisation spécifiques :
- Analyse et gestion documentaire : Il peut analyser et gérer une vaste gamme de documents, facilitant les transactions juridiques et commerciales internationales.
- Applications de recherche alimentées par l'IA : Améliore les fonctions de recherche dans des environnements multilingues, facilitant la recherche d'informations pertinentes en chinois et en anglais pour les utilisateurs mondiaux.
- Chatbots et questions-réponses basés sur la récupération : Construit des bots de service client bilingues efficaces, améliorant les interactions avec les clients du monde entier.
- Applications de traitement du langage naturel : Cela inclut l'analyse des sentiments pour comprendre les tendances du marché mondial, la modélisation des sujets pour les stratégies marketing internationales et la classification des textes pour gérer la communication mondiale.
- Systèmes de recommandation : Personnalise les recommandations de produits et de contenus pour divers publics mondiaux, en utilisant des insights tirés des données chinoises et anglaises.
En utilisant ce modèle, les entreprises chinoises peuvent combler efficacement le fossé linguistique dans leurs applications d'IA, améliorant leur compétitivité mondiale et leur portée sur le marché.
tagCommencez avec jina-embeddings-v2-base-zh via API
Commencez à intégrer notre modèle dans votre flux de travail immédiatement via l'API Embeddings. Visitez simplement notre portail Embeddings, obtenez votre clé d'accès gratuite ou rechargez une clé existante, puis choisissez jina-embeddings-v2-base-zh dans le menu déroulant. C'est aussi simple que ça pour commencer !


tagProchaines étapes : Extension du support linguistique et intégration AWS Sagemaker
jina-embeddings-v2-base-zh sera bientôt disponible via AWS Sagemaker et Hugging Face.


Chez Jina AI, notre engagement à être un leader dans la technologie d'embedding abordable et accessible pour un public mondial est inébranlable. Nous développons activement des offres multilingues supplémentaires, en nous concentrant sur les principales langues européennes et internationales, pour élargir notre portée. Restez à l'écoute pour ces mises à jour passionnantes, y compris l'intégration avec AWS SageMaker, alors que nous continuons à étendre nos capacités.
tagUn grand merci à nos premiers testeurs
Nous sommes immensément reconnaissants envers les membres sélectionnés de notre communauté d'utilisateurs chinois qui ont testé la version préliminaire (jina-embeddings-v2-base-zh-preview). Leurs retours perspicaces ont été cruciaux pour améliorer les performances de la version officielle. Si vous avez des observations ou des suggestions concernant la qualité de nos modèles, nous vous invitons chaleureusement à rejoindre notre serveur Discord et à partager vos réflexions avec nous. Votre contribution est inestimable dans notre parcours d'amélioration continue.

Amélioration de la distribution des scores vs. jina-embeddings-v2-base-zh-preview
jina-embeddings-v2-base-zh-preview souffrait de scores de similarité gonflés, donnant des scores de cosinus élevés même pour des éléments non liés. Cela était particulièrement évident dans les 5 premiers résultats de la capture d'écran ci-dessous. Les scores de similarité étaient systématiquement élevés et ne reflétaient pas précisément la véritable relation entre les éléments. Par exemple, la comparaison entre "安妮" et "蒸汽机" a reçu des scores de similarité trompeusement élevés.
Dans la version officielle, nous avons affiné le modèle pour produire des scores de similarité plus distincts et logiques, assurant une représentation plus précise des relations entre les éléments. Par exemple, la notation révisée présente maintenant une gamme plus large, offrant une meilleure compréhension de la similarité relative entre les éléments.
De plus, Jina Embeddings est désormais le seul modèle d'embedding open-source supportant 8192 tokens. Cette fonctionnalité souligne sa capacité à traiter une grande variété de types de données, des documents volumineux aux phrases brèves, ou même des mots/noms individuels comme "安妮" vs "露娜".

tagNouveau modèle bilingue chinois-anglais 8K : un outil essentiel pour l'expansion internationale des entreprises !
Après le succès de notre Embeddings V2, nous lançons aujourd'hui un nouveau grand modèle de vecteurs textuels bilingue chinois-anglais : jina-embeddings-v2-base-zh. Ce modèle hérite de tous les avantages de V2, peut traiter des textes jusqu'à 8000 tokens, et gère parfaitement le contenu bilingue chinois-anglais, ouvrant la voie aux applications multilingues.
L'excellence de jina-embeddings-v2-base-zh repose sur un dataset bilingue de qualité et notre pré-entraînement rigoureux, suivi d'un premier et second fine-tuning. Cette approche en trois étapes a non seulement généralisé les capacités bilingues du modèle mais a aussi efficacement réduit les biais, résolvant le problème courant de "déséquilibre" des modèles multilingues.
tagAperçu des caractéristiques du modèle
Caractéristique 1 : Intégration bilingue transparente
Le modèle jina-embeddings-v2-base-zh traite aisément les textes en chinois et en anglais, que ce soit pour les requêtes de recherche ou les documents cibles. Les contenus similaires en chinois et en anglais sont mappés dans le même espace vectoriel, posant ainsi une base solide pour les applications multilingues.
Caractéristique 2 : Support des longs textes jusqu'à 8K Tokens
Notre modèle prend en charge les textes jusqu'à 8K Tokens, une caractéristique unique parmi les modèles vectoriels open source, offrant un avantage significatif pour le traitement de longs passages de texte.
Caractéristique 3 : Structure de modèle compacte et efficace
Le modèle jina-embeddings-v2-base-zh, avec sa taille légère de 322MB (comprenant 161 millions de paramètres) et une dimension de sortie de 768, peut fonctionner efficacement sur du matériel informatique standard sans nécessiter de GPU, augmentant considérablement son utilité et sa praticité.
tagPerformance exceptionnelle du modèle
Dans le classement CMTEB très compétitif, notre modèle Jina Embeddings v2 se distingue dans la catégorie des modèles de moins de 0,5 GB. Il supporte non seulement les textes chinois et anglais, mais peut également traiter des textes jusqu'à 8K Tokens, une capacité rare parmi les modèles similaires.

Parmi les modèles de taille similaire supportant le chinois, Multilingual E5 et notre jina-embeddings-v2-base-zh sont les deux seuls capables de traiter l'anglais, rendant possibles les applications multilingues.

Actuellement, à l'échelle mondiale, seuls le modèle propriétaire text-embedding-ada-002 d'OpenAI et Jina Embeddings peuvent supporter des entrées de texte long de 8k Tokens. En ce qui concerne le traitement des tâches en chinois, Jina Embeddings montre des performances nettement supérieures.

tagSoutenir l'expansion mondiale des entreprises chinoises
Notre modèle vectoriel bilingue jina-embeddings-v2-base-zh est un partenaire puissant pour les entreprises chinoises cherchant à s'étendre sur le marché international. Il peut traiter de manière transparente les textes en chinois et en anglais, fournir des représentations vectorielles de texte de haute qualité, et s'intégrer facilement dans des bases de données vectorielles avancées, des systèmes de recherche et des applications RAG.
Ce modèle est particulièrement adapté pour créer des applications d'IA adaptées aux scénarios bilingues chinois-anglais, ce qui est inestimable pour les entreprises visant une expansion mondiale. Voici quelques cas d'utilisation pratiques :
- Analyse et gestion documentaire : analyse et gestion de documents massifs, facilitant les transactions juridiques et commerciales internationales.
- Applications de recherche basées sur l'IA : améliorer les performances de recherche dans un environnement multilingue, aidant les utilisateurs du monde entier à trouver facilement des informations en chinois et en anglais.
- Chatbots et systèmes de questions-réponses améliorés : créer des chatbots de service client bilingues efficaces, optimisant l'expérience de communication avec les clients internationaux.
- Applications de traitement du langage naturel : couvrant l'analyse des tendances du marché mondial, la modélisation thématique pour les stratégies de marché internationales, et la classification de texte pour la gestion des communications mondiales.
- Systèmes de recommandation : utiliser les insights des données chinoises et anglaises pour fournir des recommandations personnalisées de produits et de contenus à un public mondial diversifié.
Grâce à ce modèle, les entreprises chinoises peuvent franchir la barrière linguistique dans le domaine des applications IA et prendre l'avantage sur le marché mondial.
tagPrise en main facile de jina-embeddings-v2-base-zh
Vous souhaitez intégrer rapidement notre modèle de vecteurs bilingue dans votre workflow ? C'est simple : visitez https://jina.ai/embeddings, obtenez votre clé API gratuite ou mettez à jour votre clé existante, puis sélectionnez jina-embeddings-v2-base-zh dans le menu déroulant. Votre modèle est immédiatement prêt à être exploré et utilisé !


tagPerspectives d'avenir : support multilingue et intégration approfondie avec AWS SageMaker
jina-embeddings-v2-base-zh sera bientôt disponible sur AWS SageMaker et HuggingFace, offrant un service encore plus pratique aux utilisateurs.


Nous travaillons activement sur des modèles de vecteurs multilingues, particulièrement pour les langues européennes et internationales, afin de répondre aux besoins diversifiés des utilisateurs mondiaux. Restez à l'écoute pour nos passionnantes mises à jour à venir, notamment l'intégration approfondie avec AWS SageMaker, alors que nous continuons d'approfondir et d'élargir notre gamme de services.
tagRemerciements : merci aux testeurs précoces pour leurs précieuses contributions
Nous remercions sincèrement les membres de la communauté chinoise qui ont participé aux tests de jina-embeddings-v2-base-zh-preview. Vos précieux retours ont joué un rôle crucial dans l'optimisation de notre modèle. Si vous avez des suggestions ou des idées lors de votre utilisation, n'hésitez pas à nous en faire part. Chacun de vos retours est un moteur de notre progrès continu.

La version officielle résout le problème d'inflation des scores de la version preview
Par rapport à la version preview précédente, le modèle officiel fournit des scores de similarité plus dispersés et plus raisonnables. Dans les tests de la version preview, notre modèle montrait une inflation des scores de similarité, où même des mots totalement sans rapport comme 'Annie' et 'machine à vapeur' obtenaient une similarité cosinus très élevée. Dans la version officielle, nous avons optimisé le modèle pour garantir des scores de similarité plus raisonnables, reflétant ainsi plus précisément les relations entre les contenus.
De plus, Jina Embeddings prend désormais en charge le traitement de textes jusqu'à 8192 Token, qu'il s'agisse de longs discours, de phrases courtes, ou même de mots ou noms isolés (comme la comparaison entre "Annie" et "Luna"), démontrant sa puissante capacité à traiter divers types de données. Cette amélioration augmente non seulement la précision du modèle, mais renforce également sa flexibilité et son utilité dans le traitement de données diversifiées.







