I/O 図 1

テキスト

jina-embeddings-v5-omni-nano

画像

タスク

ベクター

I/O 図 2

テキスト

jina-embeddings-v5-omni-nano

音声

タスク

ベクター

I/O 図 3

テキスト

jina-embeddings-v5-omni-nano

動画

タスク

ベクター

I/O 図 4

複数

ベクター

テキスト

jina-embeddings-v5-omni-nano

PDF

タスク

パレートフロン
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…パラメータ数(対数)score
このモデル
フロン上
Jina AI
その他
MAEB
49.69
パラメータ
986M
スコア順位
6 / 21
パレートフロン
フロン上
値の分布
AUC 0.8242
コーパス
翻訳ペア
ドキュメント検索
コード
画像 / バナー
画像 / ロゴ
タスク
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
関連20.2%
ハードネガティブ1.7%
無関連1.1%
推奨しきい値
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
バランス · 0.678
AUC
0.8242
ノイズ上限
0.840
再現率の崖
0.557
測定ペア数
119 / 11k
このモデルは jina-embeddings-v5-text-nano とテキストタワーを共有しています。ここに示す分布はそのモデルのもので、fp16 の転送精度で一致します。
ベクトル成分
-0.180.000.19
σ 0.0361 · 183k 個の値
埋め込みの幾何
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.288
実効次元数
69 / 768
次元の切り詰め
3264128256512768
text-matching · 要求した次元数ごとのしきい値
言語ペア
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき:0.027
比較するモデルを選択してください
論文 (1)

概要

jina-embeddings-v5-omni-nano は約 1.04B パラメータのマルチモーダル埋め込みモデルで、テキスト、画像、動画、音声を受け付け、共有ベクトル空間で埋め込みを生成します。v5-omni 一族のコンパクトなバリアントで、GPU が利用できないエッジや一般ハードウェア向けに設計されています。テキスト専用の出力は jina-embeddings-v5-text-nano とビット同一であり、テキスト専用からマルチモーダルへのドロップインアップグレードを再インデックスなしで実現します。

方法

モデルは jina-embeddings-v5-text-nano にマルチモーダル機能を付加する第3段階の訓練で拡張されます。EuroBERT-210M テキストバックボーンと4 つのタスク固有 LoRA アダプターは凍結され、新規に訓練されるのはクロスモーダル投影器のみです。SigLIP2 Base ビジュアルエンコーダーが画像と動画を処理し(動画ごとに 32 フレームを均一サンプリング)、Whisper-large-v3 音声エンコーダーが音声入力を処理します。PDF ページは画像としてレンダリングされ、視覚経路で処理されます。訓練はクロスモーダルハードネガティブを用いたコントラスト損失を使用し、視覚・音声表現を既存のテキスト埋め込み空間に整列させます。768 次元の出力空間は 32 次元まで Matryoshka 切り捨てをサポートしています。8K トークンのコンテキストウィンドウはテキスト入力をカバーし、画像・音声入力はそれぞれのエンコーダーで処理されます。

パフォーマンス

テキスト専用の性能は jina-embeddings-v5-text-nano(MMTEB タスクレベル平均 65.5、英語 MTEB 71.0)とビット同一です。マルチモーダル性能は、埋め込み空間が 768 次元(1024 に対して)と狭く、テキストバックボーンが小さいため jina-embeddings-v5-omni-small をわずかに下回りますが、テキスト-画像、テキスト-音声、テキスト-動画の検索にわたって強いクロスモーダル整合性を維持しています。モデルは CPU やエッジハードウェア向けに最適化されており、より大きな omni-small モデルが効率的に動けない環境に対応します。クロスモーダル検索品質は、そのサイズクラスにおいて競争力があります。

ベストプラクティス

jina-embeddings-v5-omni-small と同じ利用パターンです:適切な LoRA アダプター(retrieval、text-matching、clustering、classification)を選択し、API 経由で画像 URL、音声ファイル URL、動画ファイル URL、PDF URL を直接渡してください——モデルは各モダリティを適切なエンコーダーにルーティングします。対応する音声フォーマット:WAV、MP3、FLAC、OGG、M4A、Opus。動画入力は 32 フレームの均一サンプリングとして処理されます。単一バッチ内でモダリティを自由に混合できます;埋め込み空間はすべてのモダリティ間で共有されます。比較にはコサイン類似度を使用してください。768 から 32 次元への Matryoshka 切り捨てはサポートされています。テキスト専用の埋め込みは jina-embeddings-v5-text-nano とドロップイン互換です——アップグレード時に再インデックスは不要です。より高い精度を必要とするサーバーデプロイメントには、jina-embeddings-v5-omni-small(1024 次元、より大きなバックボーン)を使用してください。

このモデルについて言及しているブログ