Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
Embeddings
copyright CC BY-NC 4.0
open_in_new リリース記事

jina-embeddings-v5-omni-small

テキスト、画像、音声、動画、PDFに対応したマルチモーダルベクトル。
ライセンス
copyright CC-BY-NC-4.0
発売日
calendar_month
2026-05-07
入力
abc
テキスト
image
画像
audiotrack
音声
videocam
動画
picture_as_pdf
PDF
arrow_forward
出力
more_horiz
ベクター
Matryoshka 次元 help_outline
32
64
128
256
512
768
1024
モデル詳細
パラメータ: 1.7B
入力トークン長: 32K
出力寸法: 1024
ベースモデル help_outline
link
jina-embeddings-v5-text-small
open_in_new
SigLIP2 Large
open_in_new
Whisper-large-v3
訓練された言語 help_outline
32 言語
サポートされている言語 help_outline
93 言語
量子化 help_outline
GGUF
Apple Silicon サポート help_outline
MLX
関連機種
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
サポートされているタスク
search 検索
compare_arrows テキストマッチング
bubble_chart クラスタリング
label 分類
以下の方法で入手できます
Elastic Inference Service
Jina API
AWS SageMaker
Hugging Face
エアギャップ
I/O 図 1

テキスト

jina-embeddings-v5-omni-small

画像

タスク

ベクター

I/O 図 2

テキスト

jina-embeddings-v5-omni-small

音声

タスク

ベクター

I/O 図 3

テキスト

jina-embeddings-v5-omni-small

動画

タスク

ベクター

I/O 図 4

複数

ベクター

テキスト

jina-embeddings-v5-omni-small

PDF

タスク

パレートフロンhelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…パラメータ数(対数)score
このモデル
フロン上
Jina AI
その他
MAEB
49.96
パラメータ
1.6B
スコア順位
5 / 21
パレートフロン
フロン上
値の分布help_outline
AUC 0.8269
コーパス
翻訳ペア
ドキュメント検索
コード
画像 / バナー
画像 / ロゴ
タスク
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
関連10.9%
ハードネガティブ2.1%
無関連0.9%
推奨しきい値
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
バランス · 0.697
AUC
0.8269
ノイズ上限
0.855
再現率の崖
0.566
測定ペア数
119 / 11k
このモデルは jina-embeddings-v5-text-small とテキストタワーを共有しています。ここに示す分布はそのモデルのもので、fp16 の転送精度で一致します。
ベクトル成分help_outline
-0.160.010.18
σ 0.0313 · 244k 個の値
埋め込みの幾何help_outline
01024
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.300
実効次元数
70 / 1024
次元の切り詰めhelp_outline
32641282565121024
text-matching · 要求した次元数ごとのしきい値
言語ペアhelp_outline
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき:0.024
比較するモデルを選択してください
論文 (1)
SIGIR 2026
5月 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

概要

jina-embeddings-v5-omni-small は約 1.74B パラメータのマルチモーダル埋め込みモデルで、テキスト、画像、動画、音声、PDF を受け付け、共有 1024 次元ベクトル空間で埋め込みを生成します。Jina API のデフォルト埋め込みモデルであり、Jina のマルチモーダル埋め込みモデルの中で最も優れた精度-効率のトレードオフを提供します。テキスト専用の出力は jina-embeddings-v5-text-small とビット同一であり、テキスト専用からマルチモーダルへのシームレスな移行を再インデックスなしで可能にします。

方法

モデルは jina-embeddings-v5-text-small を拡張する第3段階で訓練されます。マルチモーダル訓練中は、Qwen3-0.6B-Base テキストバックボーンと4 つのタスク固有 LoRA アダプターすべてが凍結され、新規に訓練されるのはクロスモーダル投影器のみです。SigLIP2 Large ビジュアルエンコーダーが画像と動画を処理し(動画ごとに 32 フレームを均一サンプリング)、Whisper-large-v3 音声エンコーダーが音声入力を処理します。PDF ページは画像としてレンダリングされ、視覚経路で処理されます。訓練はクロスモーダルハードネガティブを用いたコントラスト損失を使用し、視覚・音声表現を既存のテキスト埋め込み空間に整列させます。1024 次元の出力は 32 次元まで Matryoshka 切り捨てをサポートしています。32K トークンのコンテキストウィンドウはテキスト入力をカバーします。モデルは Apple Silicon 向けの量子化推論と MLX 推論をサポートしています。

パフォーマンス

テキスト専用の性能は jina-embeddings-v5-text-small(MMTEB タスクレベル平均 67.0、英語 MTEB 71.7)とビット同一です——マルチモーダル訓練中はテキストバックボーンと LoRA アダプターには手をつけません。クロスモーダル検索では、モデルはテキスト-画像、テキスト-音声、テキスト-動画タスクにわたって強い整合性を示しています。PDF ページ検索は視覚経路で処理されます。omni-small モデルは、サーバーデプロイメント向けに Jina のマルチモーダル埋め込みモデル中で最適な精度-効率のトレードオフを提供し、1024 次元の埋め込みは 768 次元の omni-nano 変種よりも高い識別力を持ちます。

ベストプラクティス

適切な LoRA アダプターを選択してください:retrieval、text-matching、clustering、または classification。API 経由のマルチモーダル入力では、画像 URL、音声ファイル URL、動画ファイル URL、PDF URL を直接渡してください——モデルは各モダリティを適切なエンコーダーにルーティングします。対応する音声フォーマットには WAV、MP3、FLAC、OGG、M4A、Opus が含まれます。動画入力は 32 フレームの均一サンプリングとして処理されます。単一バッチ内でモダリティを自由に混合できます:埋め込み空間はすべてのモダリティ間で共有されます。比較にはコサイン類似度を使用してください。1024 から 32 次元への Matryoshka 切り捨てはサポートされています。テキスト専用の埋め込みは jina-embeddings-v5-text-small とドロップイン互換です——アップグレード時に再インデックスは不要です。GPU なしのエッジ展開には jina-embeddings-v5-omni-nano を代わりに使用してください。

このモデルについて言及しているブログ
5月 12, 2026 • 7 読む時間
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するコンテンツ、ソフトウェア、製品、サービスは、すべて専門的な利用を目的としています。消費者向けの利用は想定していません。