Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
Elastic Inference Service
Elasticsearch内でJinaモデルをネイティブに実行する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
Embeddings
copyright CC BY-NC 4.0
open_in_new リリースノート

jina-embeddings-v5-omni-small

テキスト、画像、音声、動画、PDFに対応したマルチモーダルベクトル。
ライセンス
copyright CC-BY-NC-4.0
発売日
calendar_month
2026-05-07
入力
abc
文章
image
写真
audiotrack
音
videocam
ビデオ
picture_as_pdf
PDF
arrow_forward
出力
more_horiz
ベクター
Matryoshka 次元 help_outline
32
64
128
256
512
768
1024
モデル詳細
パラメータ: 1.7B
入力トークン長: 32K
出力寸法: 1024
ベースモデル help_outline
open_in_new
jina-embeddings-v5-text-small
訓練された言語 help_outline
32 言語
サポートされている言語 help_outline
93 言語
量子化 help_outline
GGUF
Apple Silicon サポート help_outline
MLX
関連機種
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
サポートされているタスク
search 検索
compare_arrows テキストマッチング
bubble_chart クラスタリング
label 分類
以下の方法で入手できます
Elastic Inference Service
Jina API
AWS SageMaker
Hugging Face
エアギャップ
I/O 図 1

文章

jina-embeddings-v5-omni-small

画像

タスク

ベクター

I/O 図 2

文章

jina-embeddings-v5-omni-small

音

タスク

ベクター

I/O 図 3

文章

jina-embeddings-v5-omni-small

ビデオ

タスク

ベクター

I/O 図 4

複数

ベクター

文章

jina-embeddings-v5-omni-small

PDF

タスク

Pareto fronthelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
30M100M300M1B3.0B10B20406080bekko-embedding-v1-a25mbge-large-enbge-large-en-v1.5bge-m3bge-small-en-v1.5BOOM-4B-v1e5-base-v2e5-mistral-7b-instructF2LLM-v2-14BF2LLM-v2-330MF2LLM-v2-4BF2LLM-v2-80Mgranite-embedding-small…GritLM-7Bjina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-omni…jina-embeddings-v5-text…jina-embeddings-v5-text…LaBSEMoD-EmbeddingNemotron-3-Embed-8BNV-Embed-v2Octen-Embedding-0.6BOcten-Embedding-4BOcten-Embedding-8Bparaphrase-multilingual…paraphrase-multilingual…PIXIE-Rune-v1.0potion-multilingual-128Msnowflake-arctic-embed-…UAE-Large-V1voyage-4-nanoParameters (log)nDCG@10
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
値の分布help_outline
AUC 0.8269
コーパス
翻訳ペア
ドキュメント検索
コード
画像 / バナー
画像 / ロゴ
タスク
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
関連10.9%
ハードネガティブ2.1%
無関連0.9%
推奨しきい値
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
バランス · 0.697
AUC
0.8269
ノイズ上限
0.855
再現率の崖
0.566
測定ペア数
119 / 11k
このモデルは jina-embeddings-v5-text-small とテキストタワーを共有しています。ここに示す分布はそのモデルのもので、fp16 の転送精度で一致します。
ベクトル成分help_outline
-0.160.010.18
σ 0.0313 · 244k 個の値
埋め込みの幾何help_outline
01024
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.300
実効次元数
70 / 1024
次元の切り詰めhelp_outline
32641282565121024
text-matching · 要求した次元数ごとのしきい値
言語ペアhelp_outline
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき: 0.024
比較するモデルを選択してください
論文 (1)
SIGIR 2026
5月 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

概要

jina-embeddings-v5-omni-small(約17億4000万個のパラメータ)は、テキスト、画像、ビデオ、音声データを受け入れ、jina-embeddings-v5-text-smallと整合した共有ベクトル空間に埋め込みを生成するマルチモーダルベクトルモデルです。最初にテキストでインデックスを作成し、任意のモダリティでクエリを実行することも、その逆も、再インデックスなしで実行できます。マルチモーダル学習中は、テキストバックボーンネットワークと4つのタスク固有のLoRAアダプタ(検索、テキストマッチング、クラスタリング、分類)すべてが固定されるため、プレーンテキスト出力はjina-embeddings-v5-text-smallと同一になります。このモデルは1024次元の埋め込みを生成し、マトリョーシカ切り捨てを使用して32次元に削減します。また、32Kトークンのコンテキスト長をサポートします。

方法

トレーニングの第 3 段階では、jina-embeddings-v5-text-small モデルを拡張しました。テキストバックボーンネットワークと 4 つのタスク固有の LoRA アダプタはすべて固定し、クロスモーダルプロジェクターのみを新規にトレーニングしました。SigLIP2 So400m ビジュアルエンコーダは、画像とビデオ (均一にサンプリングされた 32 フレーム) を処理します。Whisper-large-v3 オーディオエンコーダは、オーディオ入力を処理します。PDF ページは画像としてレンダリングされ、ビジュアルパスを介して処理されます。トレーニングでは、コントラスト損失関数を使用し、クロスモーダルハードネガティブサンプルを組み込んで、ビジュアル表現とオーディオ表現を既存のテキスト埋め込み空間に合わせました。

パフォーマンス

プレーンテキストのパフォーマンスはjina-embeddings-v5-text-smallと同一です。マルチモーダル学習中にテキストバックボーンもLoRAアダプタも変更されていません。クロスモーダル検索では、テキスト-画像、テキスト-音声、テキスト-動画の各タスクにおいて、モデルは高い一貫性を示します。PDFページの検索は、ビジュアルパスを介して行われます。サーバー展開においては、omni-smallモデルがJinaのマルチモーダルベクトルモデルの中で最高の精度と効率のバランスを実現しています。

ベストプラクティス

v5-text-small と同じ 4 つの LoRA アダプタ (retrieval、text-matching、clustering、classification) を使用します。API を介して渡されるマルチモーダル入力の場合、画像 URL、音声ファイル URL、ビデオファイル URL、または PDF URL を直接渡すことができます。モデルは、各モダリティのデータを適切なエンコーダにルーティングします。サポートされている音声フォーマットには、WAV、MP3、FLAC、OGG、M4A、および Opus があります。ビデオ入力は、均一にサンプリングされた 32 フレームとして処理されます。異なるモダリティを単一のバッチで自由に混合できます。埋め込み空間はすべてのモダリティで共有されます。比較にはコサイン類似度が使用されます。1024 次元から 32 次元への Matryoshka 切り捨てがサポートされています。テキストのみの埋め込みは jina-embeddings-v5-text-small とドロップイン互換であり、アップグレード時に再インデックス化は必要ありません。
このモデルについて言及しているブログ
5月 12, 2026 • 7 読む時間
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。