Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
Elastic Inference Service
Elasticsearch内でJinaモデルをネイティブに実行する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
アーキテクチャ
はじめに
学習
結論
star
注目
プレスリリース
5月 12, 2026

jina-embeddings-v5-omni:テキスト、画像、音声、動画のための向量模型

1つのモデルで、テキスト、画像、音声、動画という4つのモダリティに対応。1.6Bおよび0.9Bのクラス最高レベルのオムニ・ベクトルモデルです。
Han Xiao
Han Xiao • 7 読む時間
jina-embeddings-v5-omni - a jinaai Collection
Multimodal (text + image + video + audio) embedding models aligned with jina-embeddings-v5-text-*. Two sizes, four task variants each.
a jinaai Collection
jina-embeddings-v5-omni: Text-Geometry-Preserving Multimodal Embeddings via Frozen-Tower Composition
In this work, we introduce frozen-encoder model composition, a novel approach to multimodal embedding models. We build on the VLM-style architecture, in which non-text encoders are adapted to produce input for a language model, which in turn generates embeddings for all varieties of input. We present the result: the jina-embeddings-v5-omni suite, a pair of models that encode text, image, audio, and video input into a single semantic embedding space. Our method is to extend the two Jina Embeddings v5 Text models to support additional media by adding encoders for images and audio. The backbone text embedding models and the added non-text media encoders remain frozen. We only trained the connecting components, representing 0.35% of the total weights of the joint model. Training is therefore much more efficient than full-parameter retraining. Additionally, the language model remains effectively unaltered, producing exactly the same embeddings for text inputs as the Jina Embeddings v5 Text models. Our evaluations show that this approach produces results that are competitive with the state-of-the-art, yielding nearly equal performance to larger multimodal embedding models.
arXiv.orgFlorian Hönicke

私たちは、v5-text 向量模型を画像、音声、ビデオに拡張した jina-embeddings-v5-omni をリリースします。両モデルとも v5-text と同じフリーズされたテキストバックボーンを共有しているため、テキストの向量模型は同一であり、インデックスを再構築する必要はありません。jina-embeddings-v5-omni-small は4つのモダリティ全体で平均 53.93 を記録し、5.7分の1のパラメータ数で LCO-7B (54.43) に匹敵します。また、jina-embeddings-v5-omni-nano はわずか 0.95B パラメータで競争力のある文書検索性能を発揮します。

Pareto frontier
すべてのオープンウェイトオムニ向量模型(テキスト、画像、音声、ビデオをサポート)のパレートフロンティア。jina-embeddings-v5-omni-small (1.57B) は、5.7倍少ないパラメータを使用しながら、LCO-7B (8.93B) の平均スコアに匹敵します。jina-embeddings-v5-omni-nano (0.95B) は、LanguageBind (1.14B) を +8.9 ポイント上回ります。ベースライン: LanguageBind、Omni-Embed-Nemotron-3B、LCO-Embedding-Omni-3B、LCO-Embedding-Omni-7B。
Per-modality scores
テキスト (MMTEB)、画像 (MIEB)、ビデオ (MMEB-Video)、音声 (MAEB) のモダリティ別の内訳。jina-embeddings-v5-omni-small はテキストにおいて 67.0 で全オムニモデルをリードし、jina-embeddings-v5-text-small の品質を完全に継承しています。画像 (56.05) では、分類 (68.55) とクラスタリング (84.57、全モデル中最高) に優れています。音声 (51.46) は LCO-7B (52.37) に近く、最高の音声分類スコア (55.89) を記録しました。ビデオ (41.20) は LCO-7B (47.41) との現在の差であり、時間的推論はエンドツーエンドの学習からより大きな恩恵を受けるためです。
Task breakdown
13のタスクタイプにわたるタスク別のパフォーマンス。金の星は、jina-embeddings-v5-omni-small が最高のオープンウェイトベースライン (3〜9倍大きい) を上回ったタスクを示しています。主な勝利: 画像分類 (68.55 vs 64.30)、画像クラスタリング (84.57 vs 83.24)、音声分類 (55.89 vs 53.39)。主なギャップ: ビデオ検索 (27.82 vs 58.73) および構成的タスク/VQA (44.23 vs 53.40)。
Document retrieval
文書検索 (ViDoRe-in-MIEB)。jina-embeddings-v5-omni-small (0.92B アクティブなテキスト+画像パラメータ) は 79.08 をスコアし、LCO-3B (4.07B で 78.24) を上回りました。jina-embeddings-v5-omni-nano はわずか 0.31B のアクティブパラメータで 70.05 を記録し、LanguageBind (37.33) を大きく上回っています。Nemotron-3B は 85.64 でリードしていますが、5.1倍のパラメータを使用しています。

tagアーキテクチャ

v5-omni は v5-text バックボーンを完全にフリーズさせ、小型の学習可能なプロジェクターを介して接続された事前学習済みの視覚および音声エンコーダーを追加しています。

  • 視覚: 2x2 空間マージ (4倍の 詞元 削減) を備えた Qwen3.5 視覚エンコーダー (SigLIP2 から適応)。テキストバックボーンの隠れ次元にマッピングするランダムに初期化された層に置き換えた最終投影層 (fc_vision_2) 以外はすべてフリーズしています。
  • 音声: Qwen2.5-Omni エンコーダー (Whisper-large-v3 から適応)。単一のランダムに初期化された fc_audio 層が 1280 次元の出力をテキストバックボーンに投影します。
  • ビデオ: 視覚フレームのシーケンスとして処理され、必要に応じて抽出された音声セグメントが前に置かれます。

このモデルは、v5-text の4つのタスク固有の LoRA アダプター (検索、テキストマッチング、分類、クラスタリング) を継承し、各タスクバリエーションに対して個別のプロジェクター重みを学習させます。アーキテクチャは完全にモジュール化されており、テキストのみのデプロイメントでは視覚や音声の重みはロードされず (v5-text と同じフットプリント)、画像のみでは音声がスキップされ、フルオムニではすべてがロードされます。

Architecture
v5-omni アーキテクチャ。フリーズされた視覚および音声エンコーダーが、学習可能なプロジェクターを通じてフリーズされたテキストバックボーンに供給されます。プロジェクターのみ (合計重みの 0.35%) が学習されます。タスク固有の LoRA アダプターが検索、分類、クラスタリング、テキストマッチングを処理します。
機能jina-embeddings-v5-omni-smalljina-embeddings-v5-omni-nano
ベーステキストモデルjina-embeddings-v5-text-small (Qwen3-0.6B)jina-embeddings-v5-text-nano (EuroBERT-210m)
総パラメータ数~1.56B~1.04B
モダリティテキスト, 画像, 音声, ビデオ, PDFテキスト, 画像, 音声, ビデオ, PDF
向量模型次元数1024768
Matryoshka 次元数32, 64, 128, 256, 512, 768, 102432, 64, 128, 256, 512, 768
最大シーケンス長32768 詞元8192 詞元
視覚エンコーダーQwen3.5-2B ViT (SigLIP2)SigLIP2 Base
音声エンコーダーWhisper-large-v3Whisper-large-v3
タスク検索, テキストマッチング, 分類, クラスタリング検索, テキストマッチング, 分類, クラスタリング
テキスト互換性jina-embeddings-v5-text-small と同一jina-embeddings-v5-text-nano と同一
jina-embeddings-v5-text-nano 学習可能なパラメータ~18M プロジェクター (0.35%)~7M プロジェクター (0.35%) プーリングLast-tokenLast-token ライセンスCC BY-NC 4.0CC BY-NC 4.0

tagはじめに

tagElasticsearch (Elastic Inference Service)

すでに Elasticsearch で jina-embeddings-v5-text を使用している場合、既存のテキストインデックスはそのまま v5-omni で動作します。omni モデルは、v5-text と同一のテキスト入力用ベクトルモデル(向量模型)を生成します。入力が同じであれば、生成されるベクトルもビット単位で完全に一致します。テキストインデックスを再作成したり、再埋め込み(リエンベディング)したりする必要はありません。画像、音声、動画を既存のテキストデータとあわせて検索し始めるには、v5-omni を使用して新しいインデックスを作成し、そこにマルチモーダルコンテンツを取り込むだけです。

v5-omni を推論エンドポイントとして semantic_text インデックスを作成します。EIS はインデックス作成および検索のために、自動的に適切な LoRA アダプターを選択します:

PUT multimodal-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-omni-small"
      }
    }
  }
}

テキスト、画像(base64 データ URI として)、音声、動画を同じフィールド、同じインデックスに取り込みます:

// テキストを取り込む
POST multimodal-semantic-index/_doc
{
  "content": "'Kraft Dinner' is what Canadians call macaroni and cheese when prepared from a kit."
}

// 画像を取り込む (base64)
POST multimodal-semantic-index/_doc
{
  "content": "data:image/png;base64,iVBORw0KGgoAAAAN..."
}

単一のテキストクエリで、すべてのモダリティを横断して検索します:

GET multimodal-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "Was bedeutet 'Kraft Dinner' für Kanadier?"
    }
  }
}

tagJina Embedding API

curl https://api.jina.ai/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "jina-embeddings-v5-omni-small",
    "task": "retrieval.query",
    "dimensions": 1024,
    "input": ["What does this image show?"],
    "images": ["data:image/png;base64,..."]
  }'

tagHugging Face

from sentence_transformers import SentenceTransformer
import torch

model = SentenceTransformer(
    "jinaai/jina-embeddings-v5-omni-small-retrieval",
    model_kwargs={"dtype": torch.bfloat16},
)

# テキストのベクトルモデル(v5-text と同一)
text_emb = model.encode("What is knowledge distillation?", prompt_name="query")

# 画像のベクトルモデル
from PIL import Image
img = Image.open("photo.jpg")
img_emb = model.encode(img)

# クロスモーダルな類似度
similarity = model.similarity(text_emb, img_emb)

tag学習

核心となる考え方は凍結エンコーダーモデルの構成です。強力なテキスト用ベクトルモデルをベースに、学習済みの視覚および音声エンコーダーを追加し、それらを小さな学習可能なプロジェクターで接続して、プロジェクター以外をすべて凍結します。全重みのうちわずか 0.35% のみが学習対象となるため、以下の3つの特性が得られます:(1) テキストの同一性の維持(バックボーンは変更されないため、同じ入力からは同一の出力が得られる)、(2) 学習効率(プロジェクターのみの学習により、1.8~3.9倍高速化し、GPU メモリ使用量を42~64%削減)、(3) モジュール性(各タワーを独立してロード可能)。

Training efficiency
4x H100 GPU におけるプロジェクターのみの学習とフル学習の比較(バッチサイズ 256、15K ステップ)。音声プロジェクターの学習は特に効率的で、small モデルで 3.2倍(154分 vs 497分)、nano モデルで 3.9倍(112分 vs 441分)の高速化を実現しました。メモリ使用量の 42~64% 削減は、凍結されたエンコーダーの勾配やオプティマイザ状態を保持しないことによって達成されています。

v5-omni は v5-text から Matryoshka 次元のサポートを引き継いでいます。画像と音声のベクトルは切り詰め(truncation)を行っても品質の大部分が維持されますが、動画は次元を小さくすると品質が低下しやすくなります。

Radar summary
概要:v5-omni と最強のベースラインモデルとのモダリティ別プロファイル比較。1.57B パラメータの jina-embeddings-v5-omni-small はテキスト、画像、音声を競合水準でカバーしており、動画は今後の課題です。

tag結論

従来の考え方では、マルチモーダルなベクトルモデルにはモデル全体をエンドツーエンドで学習させる必要があるとされてきました。私たちはこれに同意しません。v5-omni はテキストバックボーンを凍結し、重みの 0.35% を学習させるだけで、サイズが 5~7倍大きいモデルに匹敵する性能を実現しました。ここから得られる教訓は、再学習よりも構成の方が優れているということです。強力なテキストエンコーダーの構築が最も困難な部分であり、それが一度手に入れば、軽量なプロジェクターを介して視覚や音声を追加することはほぼコストゼロで行えます。

これは本番環境において非常に重要です。既存の v5-text インデックスには一切触れる必要がありません。クエリもベクトルもビット単位で同じです。ドキュメントを再エンコードすることなく、画像、音声、動画の検索機能を追加できるのです。これこそが、移行プロジェクトではなく、ドロップインでアップグレードできる「マルチモーダル検索」の真の解放です。

jina-embeddings-v5-omni-small は、2B パラメータ未満で最高性能を誇るオープンウェイトのオムニベクトルモデルです。jina-embeddings-v5-omni-nano は、0.9B パラメータでこれを実現しています。両モデルとも、Hugging Face、Jina Search Foundation API、および Elasticsearch のネイティブな推論エンドポイントとして今すぐご利用いただけます。

カテゴリー:
star
注目
プレスリリース
rss_feed

続きを読む
8月 03, 2026 • 11 読む時間
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
2月 19, 2026 • 7 読む時間
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
12月 04, 2025 • 7 読む時間
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。