I/O 図

テキスト

jina-embeddings-v2-base-de

ベクター

パレートフロン
30M100M300M1B3.0B657075808590bge-m3EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…パラメータ数(対数)Spearman
このモデル
フロン上
Jina AI
その他
MTEB English · sts
82.00
パラメータ
161M
スコア順位
13 / 39
パレートフロン
フロン未満
値の分布
AUC 0.8452
コーパス
翻訳ペア
ドキュメント検索
0.6900.000.200.400.600.80
関連16.8%
ハードネガティブ1.7%
無関連0.9%
推奨しきい値
FPR 0.1 · 0.499
FPR 0.01 · 0.690
FPR 0.001 · 0.796
FPR 0.0001 · 0.897
バランス · 0.368
AUC
0.8452
ノイズ上限
0.793
再現率の崖
0.195
測定ペア数
119 / 11k
ベクトル成分
-0.19-0.010.17
σ 0.0361 · 183k 個の値
埋め込みの幾何
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.316
実効次元数
49 / 768
言語ペア
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき:0.158
比較するモデルを選択してください
論文 (1)

概要

jina-embeddings-v2-base-de161M パラメータのドイツ語・英語バイリンガルテキスト埋め込みモデルで、8,192 トークンのコンテキストウィンドウを備えます。両言語の意味的に等価なコンテンツを同じ 768 次元の埋め込み空間にマッピングし、翻訳なしのクロスリンガル検索を可能にします。モデルは、長コンテキスト対応を両言語のバランスの取れた性能と組み合わせた最初のオープンソースバイリンガル埋め込みモデルの一つでした。

方法

対称双方向 ALiBi 位置エンコーディングを備えた BERT ベースのバックボーン上に構築されたモデルは、161M パラメータの統一アーキテクチャを通じてドイツ語と英語の両方を処理し、768 次元の埋め込みを生成します。訓練には 3 段階が含まれます:(1) ドイツ語-英語平行コーパスでの多言語事前学習、(2) 困難負サンプルを伴うキュレーション済み文ペアでの対比ファインチューニング、(3) ドイツ語と英語の意味的に等価なテキストが埋め込み空間の近傍領域にマッピングされることを保証するクロスリンガルアラインメント訓練。主要な設計上の選択はバイアス最小化目的関数で、多言語モデルが英語の文法構造を偏って扱う傾向を打ち消します — これは以前の多言語埋め込みで文書化された既知の失敗モードです。ALiBi による 8,192 トークンのウィンドウにより、切り詰めなしでどちらの言語でも文書全体を処理できます。

パフォーマンス

モデルは Microsoft の E5-base を上回りながらそのサイズの 3 分の 1 以下であり、7 倍小さいながら E5-large の性能に匹敵しました。WikiCLIR(英語からドイツ語への検索)、STS17/STS22(双方向セマンティック類似性)、BUCC(バイリンガルテキストアラインメント)では、同等またはより大きなサイズのモデルを一貫して上回りました。322MB のフットプリントにより標準ハードウェアでのデプロイができました。2026 年、jina-embeddings-v5-text-small がほとんどのアプリケーションでこのモデルに取って代わり、32K コンテキスト、89 言語、タスク固有 LoRA アダプタを提供します。v2-base-de モデルは、8K コンテキストで十分なドイツ語-英語バイリンガルパイプラインでは引き続き有用です。

ベストプラクティス

ドイツ語-英語のバイリンガル検索に最適です:製品検索、サポートドキュメント、コンテンツ管理など、クエリと文書が異なる言語になり得る場面です。8,192 トークンを超えるドキュメントには、セマンティックチャンキングまたは Jina API 経由の `late_chunking パラメータを使用してください。モデルは Qdrant、Weaviate、MongoDB、Milvus と統合できます。2 言語を超える新しい多言語プロジェクトには、jina-embeddings-v5-text-small`(89 言語、32K コンテキスト、LoRA アダプタ)を推奨します。本番のスループットには CUDA 対応 GPU を推奨します。

このモデルについて言及しているブログ
9月 27, 2024 • 15 読む時間
Jina Embeddings v2 から v3 への移行
Jina Embeddings v2 から v3 への移行に役立つヒントをいくつか集めました。
5月 15, 2024 • 11 読む時間
バイナリ Embeddings:AI をすべて、容量はわずか 3.125%
AI モデルのような堅牢で不正確なものに対して、32 ビットの精度は大きすぎます。そこで私たちは 31 ビットを削減しました!バイナリ埋め込みはより小さく、より高速で、高性能です。
4月 29, 2024 • 7 読む時間
Azure 上の Jina Embeddings と Reranker:スケーラブルなビジネス向け AI ソリューション
Jina Embeddings および Rerankers が Azure Marketplace で利用可能になりました。プライバシーとセキュリティを重視する企業は、Jina AI の最先端モデルを既存の Azure エコシステムに簡単に統合できるようになりました。
1月 31, 2024 • 16 読む時間
トークン化について深く理解する
LLMでトークン化とは、入力テキストを処理のために小さな部分に分割することを意味します。では、なぜ embedding は token 単位で課金されるのでしょうか?
1月 26, 2024 • 13 読む時間
Jina Embeddings v2 バイリンガルモデルが Hugging Face で オープンソース化されました
Jina AI のオープンソースのドイツ語-英語と中国語-英語のバイリンガル埋め込みモデルが、Hugging Face で利用可能になりました。 インストールと言語間検索について説明していきます。