Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
Embeddings
copyright CC BY-NC 4.0
open_in_new リリースノート

jina-embeddings-v5-text-nano

エッジ展開のための最先端の多言語ベクトル
ライセンス
copyright CC-BY-NC-4.0
発売日
calendar_month
2026-02-18
入力
abc
文章
arrow_forward
出力
more_horiz
ベクター
Matryoshka 次元 help_outline
32
64
128
256
512
768
モデル詳細
パラメータ: 239M
入力トークン長: 8K
出力寸法: 768
ベースモデル help_outline
open_in_new
EuroBERT-210M
訓練された言語 help_outline
32 言語
サポートされている言語 help_outline
108 言語
量子化 help_outline
GGUF
Apple Silicon サポート help_outline
MLX
関連機種
link
jina-embeddings-v3
link
jina-embeddings-v5-text-small
サポートされているタスク
search 検索
compare_arrows テキストマッチング
bubble_chart クラスタリング
label 分類
以下の方法で入手できます
Elastic Inference Service
Jina API
AWS SageMaker
Hugging Face
エアギャップ
I/O 図

文章

jina-embeddings-v5-text-nano

タスク

ベクター

パレートフロンhelp_outline
MMTEB
MIRACL
RTEB public
LongEmbed
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanoパラメータ数(対数)nDCG@10
このモデル
フロン上
Jina AI
その他
LongEmbed
63.65
パラメータ
212M
スコア順位
14 / 69
パレートフロン
フロン未満
値の分布help_outline
AUC 0.8242
コーパス
翻訳ペア
ドキュメント検索
コード
画像 / バナー
画像 / ロゴ
タスク
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
関連20.2%
ハードネガティブ1.7%
無関連1.1%
推奨しきい値
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
バランス · 0.678
AUC
0.8242
ノイズ上限
0.840
再現率の崖
0.557
測定ペア数
119 / 11k
ベクトル成分help_outline
-0.180.000.19
σ 0.0361 · 183k 個の値
埋め込みの幾何help_outline
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.288
実効次元数
69 / 768
次元の切り詰めhelp_outline
3264128256512768
text-matching · 要求した次元数ごとのしきい値
言語ペアhelp_outline
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき: 0.027
比較するモデルを選択してください
論文 (1)
SIGIR 2026
2月 17, 2026
jina-embeddings-v5-text: Task-Targeted Embedding Distillation

概要

jina-embeddings-v5-text-nanoは、EuroBERT-210Mバックボーン上に構築され、2億3,900万のパラメータを誇ります。EuroBERT-210Mは、15の主要なヨーロッパ言語と世界言語で事前学習済みの双方向エンコーダです。このモデルは、最終端末プーリングを通じて768次元の埋め込みを生成し、最大32,000語彙単位の長さのコンテキストをサポートします。このモデルには、検索、意味的類似性、クラスタリング、分類のための4つのタスク固有のLoRAアダプタ(それぞれ670万パラメータ)が含まれています。Matryoshka表現学習技術は、埋め込みを32次元まで切り捨てることをサポートします。Qwen3-Embedding-4B埋め込み蒸留とタスク固有のアダプタトレーニングを組み合わせてトレーニングされたこのモデルは、サイズの2倍以上のモデルに匹敵するパフォーマンスを実現し、レイテンシに敏感なエッジデプロイアプリケーションに最適です。

方法

トレーニング プロセスは jina-embeddings-v5-text-small と同じで、2 段階の手順を採用していますが、EuroBERT-210M バックボーン ネットワークに適用されます。最初の段階は埋め込み蒸留です。これは、コサイン距離損失関数を使用して、線形投影層を介して学生モデルの 768 次元埋め込みを教師モデルの空間にマッピングすることで、Qwen3-Embedding-4B からの知識を転送します。トレーニングでは、複数言語の 300 を超えるデータセットのテキスト ペアを使用しました。第 2 段階では、4 つの特定タスク (各アダプターには 670 万のパラメーターが含まれます) の LoRA アダプターが、凍結されたバックボーン ネットワークの重みを使用してトレーニングされました。これらのタスクには、検索 (InfoNCE + 知識蒸留 + GOR)、テキスト マッチング (CoSENT + 知識蒸留)、クラスタリング (タスク固有の教師モデル指示を使用した再蒸留)、分類 (双方向 InfoNCE + リレーショナル知識蒸留) があります。 EuroBERT バックボーン ネットワークは、英語、フランス語、ドイツ語、スペイン語、中国語、日本語、アラビア語、ヒンディー語を含む 15 の主要ヨーロッパ言語と世界各国の言語を網羅した強力な多言語カバレッジを提供します。

パフォーマンス

MMTEB(多言語)データセットにおいて、jina-embeddings-v5-text-nanoモデルは、わずか2億3,900万パラメータしか使用せず、タスクレベル平均スコア65.5、タイプレベル平均スコア57.7を達成し、KaLM-mini-v2.5(60.1ポイント、4億9,400万パラメータ)、voyage-4-nano(58.9ポイント、4億8,000万パラメータ)、Gemma-300M(61.1ポイント、3億800万パラメータ)など、5億パラメータ未満のすべてのモデルを上回りました。分類スコアは69.2、クラスタリングスコアは52.7、ペア分類スコアは81.9、リランキングスコアは64.6、検索スコアは63.3、STSスコアは78.2でした。英語MTEBデータセットでは、平均スコア71.0を達成し、よりパラメータ化されたjina-embeddings-v5-text-smallモデル(71.7)とほぼ同等のスコアを示しました。検索ベンチマークでは、この手法はMTEB-Mで63.26、RTEBで64.08、BEIRで56.06、LongEmbedで63.65というスコアを示しました。埋め込みはバイナリ量子化下でも堅牢性を維持し、GOR正則化によりMTEB検索におけるパフォーマンスの低下は2ポイント以内に抑えられています。

ベストプラクティス

タスクに基づいて適切な LoRA アダプターを選択します。非対称クエリ ドキュメント検索の場合は 'retrieval'(クエリの前に 'Query:'、段落の前に 'Document:' を追加)、対称類似性タスクの場合は 'text-matching'(両方の入力に 'Document:' をプレフィックスとして追加)、関連ドキュメントをグループ化する場合は 'clustering'、分類の場合は 'classification' を選択します。このナノモデルは、レイテンシの影響を受けやすくリソースが制限されるデプロイメントに最適化されている一方で、そのサイズの 2 倍以上のモデルに匹敵する精度を維持しています。Matryoshka 切り捨てにより、埋め込み次元を 768 から 32 まで削減できます。最良の結果を得るには、次元を 256 以上に維持してください。バイナリ量子化がサポートされています。EuroBERT バックボーンは、英語、フランス語、ドイツ語、スペイン語、中国語、日本語、アラビア語、ヒンディー語を含む 15 の主要言語を堅牢にカバーしています。埋め込みの比較は、コサイン類似度を使用して実行されます。これは、Jina AI API、Hugging Face (Sentence Transformers および vLLM)、および llama.cpp 向けの量子化バリアントを通じて入手できます。
このモデルについて言及しているブログ
5月 12, 2026 • 7 読む時間
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
3月 06, 2026 • 6 読む時間
Identifying Embedding Models from Raw Numerical Values
A tiny transformer that fingerprints embedding models by reading raw numerical digits. No feature engineering.
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
2月 19, 2026 • 7 読む時間
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Two sub-1B multilingual embeddings with best-in-class performance, available on Elastic Inference Service, Llama.cpp and MLX.
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。