Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
Elastic Inference Service
Elasticsearch内でJinaモデルをネイティブに実行する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
Embeddings
Qwen研究ライセンス
open_in_new リリースノート

jina-embeddings-v4

マルチモーダル・多言語検索のための汎用ベクトルモデル
ライセンス
Qwen Research License
発売日
calendar_month
2025-06-24
入力
abc
文章
image
写真
picture_as_pdf
PDF
arrow_forward
出力
more_horiz
ベクター
apps
マルチベクトル
Matryoshka 次元 help_outline
128
256
512
1024
2048
レイトチャンキング help_outline
check_circle
Yes
モデル詳細
パラメータ: 3.8B
入力トークン長: 32K
入力画像サイズ: 768×28×28
出力寸法: 2048
ベースモデル help_outline
open_in_new
Qwen2.5-VL-3B-Instruct
訓練された言語 help_outline
34 言語
サポートされている言語 help_outline
29 言語
量子化 help_outline
GGUF
関連機種
link
jina-embeddings-v3
link
jina-clip-v2
サポートされているタスク
search 検索
compare_arrows テキストマッチング
code コード
以下の方法で入手できます
Jina API
Hugging Face
エアギャップ
I/O 図 1

文章

jina-embeddings-v4

タスク

ベクター

I/O 図 2

画像

jina-embeddings-v4

タスク

ベクター

I/O 図 3

複数

ベクター

文章

jina-embeddings-v4

タスク

I/O 図 4

複数

ベクター

画像

jina-embeddings-v4

タスク

Pareto fronthelp_outline
RTEB public
LongEmbed
CoIR
ViDoRe v1
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v4Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
LongEmbed
69.88
Parameters
3.8B
Rank by score
7 / 69
Pareto front
Behind it
値の分布help_outline
AUC 0.8308
コーパス
翻訳ペア
ドキュメント検索
コード
画像 / バナー
画像 / ロゴ
タスク
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
関連6.7%
ハードネガティブ1.1%
無関連0.8%
推奨しきい値
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
バランス · 0.618
AUC
0.8308
ノイズ上限
0.877
再現率の崖
0.516
測定ペア数
119 / 11k
ベクトル成分help_outline
-0.19-0.020.15
σ 0.0221 · 487k 個の値
埋め込みの幾何help_outline
02048
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.496
実効次元数
73 / 2048
次元の切り詰めhelp_outline
12825651210242048
text-matching · 要求した次元数ごとのしきい値
言語ペアhelp_outline
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき: 0.069
比較するモデルを選択してください
論文 (2)
ICLR 2026
1月 22, 2026
Embedding Compression via Spherical Coordinates
EMNLP 2025
6月 24, 2025
jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval

概要

Jina Embeddings V4は、38億パラメータのマルチモーダルベクトルモデルであり、統一されたテキストと画像の表現機能を提供します。Qwen2.5-VL-3B-Instructバックボーンネットワーク上に構築されたこのモデルのアーキテクチャは、遅延インタラクティブスタイルにおける単一ベクトルと複数ベクトルをサポートし、従来のCLIPスタイルのデュアルエンコーダモデルの限界を打ち破りました。このモデルは、3つのタスク固有のLoRAアダプター(それぞれ60Mパラメータ)を統合し、固定されたバックボーンネットワークの重みを変更することなく、さまざまな検索シナリオ(非対称クエリドキュメント検索、セマンティックテキスト類似性、コード検索など)でパフォーマンスを最適化します。このモデルは、表、グラフ、ダイアグラム、スクリーンショット、混合メディア形式などの視覚的に豊富なコンテンツを統一された処理パスで処理することに優れており、従来のアーキテクチャに存在するモダリティギャップを縮小します。このモデルは多言語機能をサポートし、最大 32,768 個のトークン化された入力テキストを処理し、画像を 20 メガピクセルにサイズ変更できるため、さまざまな言語やドメインにまたがるさまざまなドキュメント検索およびクロスモーダル検索アプリケーションに適しています。

方法

Jina Embeddings V4は、CLIPスタイルのデュアルエンコーダーアプローチとは異なる、統合型マルチモーダル言語モデルアーキテクチャを実装しています。このモデルは、共有パスを介して入力を処理します。まず、ビジュアルエンコーダーを介して画像をトークンシーケンスに変換し、次にコンテキストアテンションレイヤーを備えた言語モデルデコーダーを介してテキストと画像のモダリティをまとめて処理します。このアーキテクチャは、異なるユースケースに対応するために2つの出力モードをサポートしています。シングルベクトルは、Matryoshka表現学習によって128次元に切り捨てられ、効率的な類似検索のために平均プーリングによって生成される2048次元ベクトルを生成します。マルチベクトルは、後期インタラクティブスタイル検索のために、投影層を介して各トークンを128次元出力します。このモデルには、特殊な最適化を提供する3つのタスク固有のLoRAアダプターが含まれています。検索アダプターは、プレフィックスベースの非対称エンコーディングとハードネガティブサンプルトレーニングを使用してクエリドキュメントシナリオを処理します。テキストマッチングアダプターは、CoSENT損失関数を使用して意味的類似性タスクを処理します。コードアダプターは、自然言語からコードへの検索アプリケーションに重点を置いています。トレーニングは 2 つのフェーズに分かれています。最初のペアワイズ トレーニングでは、300 を超えるソースからのテキスト間およびテキストと画像のペアに対して対照的な InfoNCE 損失を使用して実行され、その後、トリプレット ベースのアプローチと各ドメインの要件に合わせて調整された特殊な損失関数を使用して、3 つの LoRA アダプターのタスク固有の微調整が行われます。

パフォーマンス

Jina Embeddings V4は、複数のベンチマークカテゴリーで非常に競争力のあるパフォーマンスを達成しました。画像文書検索では、JinaVDRベンチマークで平均スコア72.19を達成しました。これはColPali-v1.2の64.50を上回ります。また、ViDoReベンチマークでは平均スコア84.11を達成しました。これはColPaliの83.90を上回ります。さらに、マルチベクターモードではViDoReのスコア90.17を達成しました。クロスモーダル検索では、CLIPベンチマークで84.11を達成しました。これはjina-clip-v2の81.12、nllb-clip-large-siglipの83.19を上回ります。テキスト検索タスクでは、MTEB-enで55.97、MMTEBで66.49を達成し、長文文書処理にも優れており、LongEmbedでは67.11を達成しました(前モデルの55.66を上回っています)。セマンティックテキスト類似性評価でも優れた性能を示し、英語STSタスクで85.89、多言語STSベンチマークで72.70のスコアを獲得しました。コード検索機能はCoIRベンチマークで71.59に達しましたが、voyage-code-3(77.33)などの専用モデルはこの分野でより高いスコアを獲得しています。クロスモーダルアライメント性能はOpenAI CLIPの0.15に対して0.71と向上し、マルチモーダルモデルにおけるモダリティギャップ問題に対処しています。視覚的に豊富なタスクでは、マルチベクター モードがシングルベクター モードよりも一貫して優れたパフォーマンスを発揮しますが、シングルベクター モードは標準的な検索シナリオで効率的なパフォーマンスを提供します。

ベストプラクティス

Jina Embeddings V4 を効果的に使用するには、アプリケーションのニーズに合わせて適切な LoRA アダプタを選択してください。クエリとドキュメントの構造が異なる非対称クエリドキュメント検索シナリオでは、retrieval アダプタを使用し、クエリと段落の内容を区別するために適切なプレフィックスを使用してください。text-matching アダプタは、クエリへの回答ではなく類似コンテンツの検索を目的とするセマンティック類似性タスクと対称検索に適しており、ドキュメントクラスタリング、重複検出、コンテンツ推奨システムに最適です。プログラミング関連のアプリケーションでは、code アダプタが自然言語からコードへの検索、コード間の類似性検索、技術的な質疑応答シナリオに最適化されています。パフォーマンスと効率性の要件に基づいて出力モードを選択してください。シングルベクトル埋め込みは効率的な類似性検索を提供し、ストレージ容量が限られた環境に適しており、切り捨て可能な次元により、許容可能な品質のトレードオフで次元を 2048 から 128-512 に削減できます。一方、マルチベクトル埋め込みは複雑な検索タスク、特にリッチなビジュアルコンテンツを含む文書を扱う際に高い精度を提供し、レイトインタラクションによるスコアリングによって詳細な関係性を捉えることができます。このモデルの統合アーキテクチャにより、テキストと画像が混在する入力を、別途エンコーダーやビジュアル文書のOCR前処理を必要とせずに処理できます。このモデルのクロスモーダルアライメント機能と多言語サポートにより、国際的なアプリケーションにも適しています。本番環境での展開では、メモリ要件を計画する際に、LoRAアダプタあたり6,000万パラメータのオーバーヘッドを考慮してください。また、3つのアダプタすべてを2%未満の追加メモリ使用量で同時に維持できるため、推論中に柔軟なタスク切り替えが可能になります。
このモデルについて言及しているブログ
3月 11, 2026 • 7 読む時間
Bootstrapping Audio Embeddings from Multimodal LLMs
Turn any multimodal LLM into a small audio embedding model that beats CLAP with 25x less data.
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
2月 19, 2026 • 7 読む時間
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Two sub-1B multilingual embeddings with best-in-class performance, available on Elastic Inference Service, Llama.cpp and MLX.
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
9月 09, 2025 • 11 読む時間
Multimodal Embeddings in Llama.cpp and GGUF
We brought multimodal embeddings to llama.cpp and GGUF, and uncovered a few surprising issues along the way.
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
9月 04, 2025 • 6 読む時間
Jina Code Embeddings: SOTA Code Retrieval at 0.5B and 1.5B
Code generation LLMs → code embeddings: 0.5B/1.5B models achieve SOTA performance across 25 code retrieval benchmarks.
Jina AI
Green "Code Embeddings" text displayed in a LED dot style on a black background, evoking a futuristic and technological atmos
8月 13, 2025 • 15 読む時間
Optimizing GGUFs for Decoder-Only Embedding Models
4000 tokens/sec for a 3B-parameter embedding model on L4 GPU is probably as fast as you'll get with llama.cpp. Or is it?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。