Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
Embeddings
copyright CC BY-NC 4.0
open_in_new リリース記事

jina-embeddings-v5-omni-nano

エッジ展開用のコンパクトなマルチモーダルベクター
ライセンス
copyright CC-BY-NC-4.0
発売日
calendar_month
2026-05-07
入力
abc
テキスト
image
画像
audiotrack
音声
videocam
動画
picture_as_pdf
PDF
arrow_forward
出力
more_horiz
ベクター
Matryoshka 次元 help_outline
32
64
128
256
512
768
モデル詳細
パラメータ: 1.0B
入力トークン長: 8K
出力寸法: 768
ベースモデル help_outline
link
jina-embeddings-v5-text-nano
open_in_new
SigLIP2 Base
open_in_new
Whisper-large-v3
訓練された言語 help_outline
32 言語
サポートされている言語 help_outline
108 言語
量子化 help_outline
GGUF
Apple Silicon サポート help_outline
MLX
関連機種
link
jina-embeddings-v5-omni-small
link
jina-embeddings-v5-text-nano
link
jina-embeddings-v3
link
jina-clip-v2
サポートされているタスク
search 検索
compare_arrows テキストマッチング
bubble_chart クラスタリング
label 分類
以下の方法で入手できます
Elastic Inference Service
Jina API
AWS SageMaker
Hugging Face
エアギャップ
I/O 図 1

テキスト

jina-embeddings-v5-omni-nano

画像

タスク

ベクター

I/O 図 2

テキスト

jina-embeddings-v5-omni-nano

音声

タスク

ベクター

I/O 図 3

テキスト

jina-embeddings-v5-omni-nano

動画

タスク

ベクター

I/O 図 4

複数

ベクター

テキスト

jina-embeddings-v5-omni-nano

PDF

タスク

パレートフロンhelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…パラメータ数(対数)score
このモデル
フロン上
Jina AI
その他
MAEB
49.69
パラメータ
986M
スコア順位
6 / 21
パレートフロン
フロン上
値の分布help_outline
AUC 0.8242
コーパス
翻訳ペア
ドキュメント検索
コード
画像 / バナー
画像 / ロゴ
タスク
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
関連20.2%
ハードネガティブ1.7%
無関連1.1%
推奨しきい値
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
バランス · 0.678
AUC
0.8242
ノイズ上限
0.840
再現率の崖
0.557
測定ペア数
119 / 11k
このモデルは jina-embeddings-v5-text-nano とテキストタワーを共有しています。ここに示す分布はそのモデルのもので、fp16 の転送精度で一致します。
ベクトル成分help_outline
-0.180.000.19
σ 0.0361 · 183k 個の値
埋め込みの幾何help_outline
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.288
実効次元数
69 / 768
次元の切り詰めhelp_outline
3264128256512768
text-matching · 要求した次元数ごとのしきい値
言語ペアhelp_outline
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき:0.027
比較するモデルを選択してください
論文 (1)
SIGIR 2026
5月 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

概要

jina-embeddings-v5-omni-nano は約 1.04B パラメータのマルチモーダル埋め込みモデルで、テキスト、画像、動画、音声を受け付け、共有ベクトル空間で埋め込みを生成します。v5-omni 一族のコンパクトなバリアントで、GPU が利用できないエッジや一般ハードウェア向けに設計されています。テキスト専用の出力は jina-embeddings-v5-text-nano とビット同一であり、テキスト専用からマルチモーダルへのドロップインアップグレードを再インデックスなしで実現します。

方法

モデルは jina-embeddings-v5-text-nano にマルチモーダル機能を付加する第3段階の訓練で拡張されます。EuroBERT-210M テキストバックボーンと4 つのタスク固有 LoRA アダプターは凍結され、新規に訓練されるのはクロスモーダル投影器のみです。SigLIP2 Base ビジュアルエンコーダーが画像と動画を処理し(動画ごとに 32 フレームを均一サンプリング)、Whisper-large-v3 音声エンコーダーが音声入力を処理します。PDF ページは画像としてレンダリングされ、視覚経路で処理されます。訓練はクロスモーダルハードネガティブを用いたコントラスト損失を使用し、視覚・音声表現を既存のテキスト埋め込み空間に整列させます。768 次元の出力空間は 32 次元まで Matryoshka 切り捨てをサポートしています。8K トークンのコンテキストウィンドウはテキスト入力をカバーし、画像・音声入力はそれぞれのエンコーダーで処理されます。

パフォーマンス

テキスト専用の性能は jina-embeddings-v5-text-nano(MMTEB タスクレベル平均 65.5、英語 MTEB 71.0)とビット同一です。マルチモーダル性能は、埋め込み空間が 768 次元(1024 に対して)と狭く、テキストバックボーンが小さいため jina-embeddings-v5-omni-small をわずかに下回りますが、テキスト-画像、テキスト-音声、テキスト-動画の検索にわたって強いクロスモーダル整合性を維持しています。モデルは CPU やエッジハードウェア向けに最適化されており、より大きな omni-small モデルが効率的に動けない環境に対応します。クロスモーダル検索品質は、そのサイズクラスにおいて競争力があります。

ベストプラクティス

jina-embeddings-v5-omni-small と同じ利用パターンです:適切な LoRA アダプター(retrieval、text-matching、clustering、classification)を選択し、API 経由で画像 URL、音声ファイル URL、動画ファイル URL、PDF URL を直接渡してください——モデルは各モダリティを適切なエンコーダーにルーティングします。対応する音声フォーマット:WAV、MP3、FLAC、OGG、M4A、Opus。動画入力は 32 フレームの均一サンプリングとして処理されます。単一バッチ内でモダリティを自由に混合できます;埋め込み空間はすべてのモダリティ間で共有されます。比較にはコサイン類似度を使用してください。768 から 32 次元への Matryoshka 切り捨てはサポートされています。テキスト専用の埋め込みは jina-embeddings-v5-text-nano とドロップイン互換です——アップグレード時に再インデックスは不要です。より高い精度を必要とするサーバーデプロイメントには、jina-embeddings-v5-omni-small(1024 次元、より大きなバックボーン)を使用してください。

このモデルについて言及しているブログ
5月 12, 2026 • 7 読む時間
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するコンテンツ、ソフトウェア、製品、サービスは、すべて専門的な利用を目的としています。消費者向けの利用は想定していません。