Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
warning
このモデルは、新しいモデルでは非推奨になりました。
Embeddings
Apache 2.0 ライセンス
open_in_new リリース記事

jina-embeddings-v2-base-zh

中国語と英語のバイリンガリズムをサポートする 8K 最高のベクトルモデル
ライセンス
Apache-2.0
発売日
calendar_month
2024-01-09
入力
abc
テキスト
arrow_forward
出力
more_horiz
ベクター
レイトチャンキング help_outline
check_circle
Yes
モデル詳細
パラメータ: 161M
入力トークン長: 8K
出力寸法: 768
ベースモデル help_outline
jina-bert-v2-base-zh
訓練された言語 help_outline
2 言語
関連機種
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
以下の方法で入手できます
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
エアギャップ
I/O 図

テキスト

jina-embeddings-v2-base-zh

ベクター

パレートフロンhelp_outline
30M100M300M1B3.0B10B506070acge_text_embeddingbge-base-zhbge-base-zh-v1.5bge-large-zh-noinstructbge-small-zhbge-small-zh-v1.5Conan-embedding-v1Dmeta-embedding-zh-smalle5-mistral-7b-instructgte-base-zhgte-large-zhgte-multilingual-basegte-Qwen1.5-7B-instructgte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-small-zhluotuo-bert-mediumm3e-basem3e-largemultilingual-e5-basemultilingual-e5-largemultilingual-e5-smallpiccolo-base-zhpiccolo-large-zh-v2stella-base-zh-v2stella-base-zh-v3-1792dstella-large-zh-v2stella-mrl-large-zh-v3.…text2vec-base-chinesetext2vec-large-chinesexiaobu-embeddingxiaobu-embedding-v2Yinkazpoint_large_embedding_…パラメータ数(対数)score
このモデル
フロン上
Jina AI
その他
C-MTEB
63.79
パラメータ
161M
スコア順位
23 / 40
パレートフロン
フロン未満
値の分布help_outline
AUC 0.8373
コーパス
翻訳ペア
ドキュメント検索
0.6820.000.200.400.600.80
関連12.6%
ハードネガティブ1.8%
無関連1.2%
推奨しきい値
FPR 0.1 · 0.475
FPR 0.01 · 0.682
FPR 0.001 · 0.796
FPR 0.0001 · 0.835
バランス · 0.353
AUC
0.8373
ノイズ上限
0.793
再現率の崖
0.113
測定ペア数
119 / 11k
ベクトル成分help_outline
-0.180.000.18
σ 0.0361 · 183k 個の値
埋め込みの幾何help_outline
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.308
実効次元数
56 / 768
比較するモデルを選択してください
論文 (1)
arXiv
2月 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

概要

jina-embeddings-v2-base-zh は中国語・英語の 161M パラメータのバイリンガルテキスト埋め込みモデルで、8,192 トークンのコンテキストウィンドウと 768 次元の出力を備えます。長コンテキスト対応で中国語と英語の両方をシームレスに処理した最初のオープンソースモデルであり、トランスフォーマーアーキテクチャにおける中国語の文字ベーステキスト特有のトークナイズ化課題に対処しました。

方法

モデルは対称双方向 ALiBi 位置エンコーディングを備えた BERT ベースのバックボーン、161M パラメータ、768 次元の出力空間を使用します。訓練は 3 段階のアプローチに従いました:高品質な中国語-英語バイリンガルデータでの初期事前学習に続き、対比損失と困難負サンプルマイニングを伴う一次・二次ファインチューニング段階。ALiBi メカニズムにより、学習済み位置埋め込みなしで 8,192 トークンのコンテキストウィンドウが可能になりました。最終リリースの注目すべき改善は、プレビュー版に存在したスコア膨張の問題に対処した洗練された類似度スコアの分布で、より識別力があり適切に較正された類似度スコアを生成します。

パフォーマンス

C-MTEB(中国語 MTEB)リーダーボードで、モデルは 0.5GB 未満のモデル群の中で卓越した性能を示し、特に中国語タスクで優れた結果を記録しました。中国語固有の検索と類似性タスクでは OpenAI の text-embedding-ada-002 を大幅に上回ると同時に、英語タスクでも競争力のある性能を維持しました。洗練された類似度スコアの分布により、両言語で関連と非関連のコンテンツ間の識別が向上しました。2026 年、jina-embeddings-v5-text-small が 89 言語、32K コンテキスト、タスク固有 LoRA アダプタによりこのモデルに取って代わります。

ベストプラクティス

中国語-英語のバイリンガル検索、クロスリンガル文書検索、多言語コンテンツ解析に最適です。8,192 トークンを超える文書には、セマンティックチャンキングまたは Jina API 経由の `late_chunking パラメータを使用してください。モデルは主要なベクトルデータベースと RAG フレームワークと統合できます。新しい多言語プロジェクトには、jina-embeddings-v5-text-small`(89 言語、32K コンテキスト、LoRA アダプタ)を推奨します。本番のスループットには CUDA 対応 GPU を推奨します。入力テキストは中国語または英語にしてください。モデルは翻訳なしで両言語をネイティブに処理します。

このモデルについて言及しているブログ
4月 29, 2024 • 7 読む時間
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
1月 31, 2024 • 16 読む時間
A Deep Dive into Tokenization
Tokenization, in LLMs, means chopping input texts up into smaller parts for processing. So why are embeddings billed by the token?
Scott Martens
Colorful speckled grid pattern with a mix of small multicolored dots on a black background, creating a mosaic effect.
1月 26, 2024 • 13 読む時間
Jina Embeddings v2 Bilingual Models Are Now Open-Source On Hugging Face
Jina AI's open-source bilingual embedding models for German-English and Chinese-English are now on Hugging Face. We’re going to walk through installation and cross-language retrieval.
Scott Martens
Colorful "EMBEDDINGS" text above a pile of yellow smileys on a black background with decorative lines at the top.
1月 09, 2024 • 12 読む時間
8K Token-Length Bilingual Embeddings Break Language Barriers in Chinese and English
The first bilingual Chinese-English embedding model with 8192 token-length.
Jina AI
Colorful 3D text "OPEN" in green and blue on a black background creating a vibrant effect
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するコンテンツ、ソフトウェア、製品、サービスは、すべて専門的な利用を目的としています。消費者向けの利用は想定していません。