Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
Embeddings
copyright CC BY-NC 4.0
open_in_new リリース記事

jina-embeddings-v5-text-nano

エッジ展開のための最先端の多言語ベクトル
ライセンス
copyright CC-BY-NC-4.0
発売日
calendar_month
2026-02-18
入力
abc
テキスト
arrow_forward
出力
more_horiz
ベクター
Matryoshka 次元 help_outline
32
64
128
256
512
768
モデル詳細
パラメータ: 239M
入力トークン長: 8K
出力寸法: 768
ベースモデル help_outline
open_in_new
EuroBERT-210M
訓練された言語 help_outline
32 言語
サポートされている言語 help_outline
108 言語
量子化 help_outline
GGUF
Apple Silicon サポート help_outline
MLX
関連機種
link
jina-embeddings-v3
link
jina-embeddings-v5-text-small
サポートされているタスク
search 検索
compare_arrows テキストマッチング
bubble_chart クラスタリング
label 分類
以下の方法で入手できます
Elastic Inference Service
Jina API
AWS SageMaker
Hugging Face
エアギャップ
I/O 図

テキスト

jina-embeddings-v5-text-nano

タスク

ベクター

パレートフロン help_outline
workspace_premium
MMTEB
MIRACL
RTEB public
LongEmbed
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B3040506070all-MiniLM-L6-v2bge-large-en-v1.5e5-large-v2e5-small-v2EmbeddingGemma-300Mgranite-embedding-311m-…granite-embedding-97m-m…GritLM-7BGritLM-8x7Bgte-Qwen2-7B-instructharrier-oss-v1-0.6bharrier-oss-v1-27bjina-embeddings-v3jina-embeddings-v5-omni…KaLM-Embedding-Gemma3-1…LaBSELanguageBindLCO-Embedding-Omni-3Bllama-embed-nemotron-8bmultilingual-e5-basemultilingual-e5-large-i…Omni-Embed-Nemotron-3Bpotion-multilingual-128MQwen3-Embedding-0.6BQwen3-Embedding-4BQwen3-Embedding-8Bsnowflake-arctic-embed-…static-similarity-mrl-m…stella_en_1.5B_v5stella_en_400M_v5jina-embeddings-v5-text…パラメータ数(対数)score
このモデル
フロン上
Jina AI
その他
MMTEB
65.50
パラメータ
212M
スコア順位
12 / 48
パレートフロン
フロン上
値の分布help_outline
AUC 0.8242
コーパス
翻訳ペア
ドキュメント検索
コード
画像 / バナー
画像 / ロゴ
タスク
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
関連20.2%
ハードネガティブ1.7%
無関連1.1%
推奨しきい値
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
バランス · 0.678
AUC
0.8242
ノイズ上限
0.840
再現率の崖
0.557
測定ペア数
119 / 11k
ベクトル成分help_outline
-0.180.000.19
σ 0.0361 · 183k 個の値
埋め込みの幾何help_outline
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.288
実効次元数
69 / 768
次元の切り詰めhelp_outline
3264128256512768
text-matching · 要求した次元数ごとのしきい値
言語ペアhelp_outline
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき:0.027
比較するモデルを選択してください
論文 (1)
SIGIR 2026
2月 17, 2026
jina-embeddings-v5-text: Task-Targeted Embedding Distillation

概要

jina-embeddings-v5-text-nano は EuroBERT-210M バックボーン上に構築された 239M パラメータの多言語テキスト埋め込みモデルです。8K トークンのコンテキストをサポートし、Matryoshka 切り捨てを 32 次元まで行える 768 次元の埋め込みを生成し、Jina の 500M 未満の埋め込みモデル群でパラメータあたり最高精度を実現します。GPU が利用できないエッジ展開、レイテンシに敏感なアプリケーション、リソース制約の環境のために設計されています。

方法

モデルは EuroBERT-210M に基づいています。これは主要 15 言語をカバーする多言語データで事前学習されたコンパクトな双方向エンコーダーです。Last-Token-Pooling を用いて最終トークン表現から埋め込みを生成します。訓練は2段階の蒸留レシピに従います:まず、より大きな教師モデルからの知識蒸留が埋め込み品質を転移;次に、タスク固有のコントラスト損失が検索、テキストマッチング、クラスタリング、分類タスクでモデルをファインチューニングします。Matryoshka Representation Learning により、任意のサポートサイズ(32、64、128、256、512、768)で埋め込み次元を切り捨てながら強い性能を維持できます。Geometric Orthogonal Regularization(GOR)は、2 進量子化下の性能劣化を MTEB 検索で 2 ポイント未満に抑えます。8K コンテキストウィンドウにより、チャンキングなしの長文書処理を可能にします。

パフォーマンス

MMTEB(多言語)では、モデルはわずか 239M パラメータでタスクレベル平均 65.5、タイプレベル平均 57.7 を達成し、500M 未満の全モデル(KaLM-mini-v2.5(60.1、494M)、voyage-4-nano(58.9、480M)、Gemma-300M(61.1、308M)を含む)を上回っています。タスクレベルスコア:分類 69.2、クラスタリング 52.7、ペア分類 81.9、リランキング 64.6、検索 63.3、STS 78.2。英語 MTEB では平均 71.0 を達成し、はるかに大きい jina-embeddings-v5-text-small(71.7)にほぼ迫っています。検索特化:MTEB-M 63.26、RTEB 64.08、BEIR 56.06、LongEmbed 63.65。GOR 正則化により、2 進量子化下でも埋め込みは堅牢さを保ちます。

ベストプラクティス

適切なタスクプレフィックスを選択してください:非対称クエリ-ドキュメント検索には 'retrieval'、対称類似度には 'text-matching'、グルーピングには 'clustering'、カテゴライズには 'classification'。Matryoshka 切り捨てを 256 次元にすると、検索品質の 95% 以上を維持しながらストレージを 67% 削減します。さらなるストレージ削減のための 2 進量子化もサポートしています。EuroBERT バックボーンは英語、フランス語、ドイツ語、スペイン語、中国語、日本語、アラビア語、ヒンディー語を含む主要 15 言語で強力なカバレッジを提供します。埋め込みの比較にはコサイン類似度を使用してください。Jina AI API、Hugging Face(Sentence Transformers、vLLM)、llama.cpp 用の量子化バリアントで利用可能です。32K コンテキストやより高い精度が必要なワークロードには、代わりに jina-embeddings-v5-text-small を使用してください。

このモデルについて言及しているブログ
5月 12, 2026 • 7 読む時間
jina-embeddings-v5-omni:テキスト、画像、音声、動画のための向量模型
1つのモデルで、テキスト、画像、音声、動画という4つのモダリティに対応。1.6Bおよび0.9Bのクラス最高レベルのオムニ・ベクトルモデルです。
Jina AI
3月 06, 2026 • 6 読む時間
生の数値から埋め込みモデルを特定する
生の数値を読み取ることで埋め込みモデルをフィンガープリント化する、小さな Transformer。特徴量エンジニアリングは不要。
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
2月 19, 2026 • 7 読む時間
jina-embeddings-v5-text: 新しい SOTA 小型多言語ベクトルモデル
<input> 1B 未満の最高の性能を誇る 2 つの多言語対応ベクトルモデル(Embeddings)が、Elastic Inference Service、Llama.cpp、および MLX で利用可能になりました。 </input>
Jina AI
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するコンテンツ、ソフトウェア、製品、サービスは、すべて専門的な利用を目的としています。消費者向けの利用は想定していません。