Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
warning
このモデルは、新しいモデルでは非推奨になりました。
Embeddings
Apache 2.0 ライセンス
open_in_new リリース記事

jina-clip-v1

画像と英語テキストのマルチモーダルベクトルモデル
ライセンス
Apache-2.0
発売日
calendar_month
2024-06-05
入力
image
画像
abc
テキスト
arrow_forward
出力
more_horiz
ベクター
モデル詳細
パラメータ: 223M
入力トークン長: 8K
入力画像サイズ: 224×224
出力寸法: 768
ベースモデル help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
訓練された言語 help_outline
1 言語
関連機種
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
以下の方法で入手できます
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
エアギャップ
I/O 図 1

テキスト

jina-clip-v1

ベクター

I/O 図 2

画像

jina-clip-v1

ベクター

パレートフロン help_outline
workspace_premium
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
300M1B3.0B10B20406080100bge-visualized-m3BiModernVBERTDSE-Phi3dse-qwen2-2b-mrl-v1e5-vjina-clip-v2jina-embeddings-v3jina-embeddings-v4llama-nemoretriever-col…MoCa-3Bnemotron-colembed-vl-8b…nllb-siglip-largeONE-PEACESauerkrautLM-ColLFM2-45…SauerkrautLM-ColMinistr…siglip-so400m-patch14-3…SigLIP2-L-512/16VLM2VecVultronRetrieverFlash-Q…jina-clip-v1パラメータ数(対数)nDCG@5
このモデル
フロン上
Jina AI
その他
ViDoRe v1
17.72
パラメータ
223M
スコア順位
32 / 33
パレートフロン
フロン上
値の分布help_outline
AUC 0.8440
コーパス
翻訳ペア
ドキュメント検索
画像 / バナー
0.6750.000.200.400.600.80
関連20.2%
ハードネガティブ3.2%
無関連1.2%
推奨しきい値
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
バランス · 0.376
AUC
0.8440
ノイズ上限
0.779
再現率の崖
0.123
測定ペア数
119 / 11k
ベクトル成分help_outline
-0.18-0.010.15
σ 0.0361 · 183k 個の値
埋め込みの幾何help_outline
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.283
実効次元数
55 / 768
比較するモデルを選択してください
論文 (1)
ICML 2024
5月 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

概要

jina-clip-v1 は 223M パラメータのマルチモーダル埋め込みモデルで、テキスト間の検索とテキストから画像の検索の両方で state-of-the-art の性能を達成しました — CLIP ファミリーのモデルとしては初めてです。クロスモーダルアラインメントのためにテキスト単独検索を犠牲にする標準の CLIP モデルとは異なり、jina-clip-v1 はマルチタスク対比学習により、すべての検索組み合わせで高い性能を維持します。テキストコンテキストは 12,288 トークンに対応し、元の CLIP の 77 トークン制限の 100 倍です。

方法

アーキテクチャは、ALiBi により 12,288 トークンに対応する改造済み Jina BERT v2 テキストエンコーダと、Beijing Academy for AI の EVA-02 画像エンコーダを組み合わせています。重要な革新はマルチタスク対比学習手法です:モデルは同時に (1) クロスモーダルアラインメントのための画像キャプションペア、(2) テキスト単独検索品質を維持するためのテキスト間ペア、(3) テキスト長さの変化への頑健性を高める画像の AI 生成長文説明で学習します。最終段階ではハードネガティブなテキストトリプレットを用いて意味的区別を鋭くします。このマルチタスクアプローチにより、標準の CLIP 学習に見られるテキスト単独検索の壊滅的忘却(catastrophic forgetting)を防ぎます。画像エンコーダは 224×224 ピクセルのタイルを処理し、各タイルは 1,000 トークンの処理能力を消費します。

パフォーマンス

テキスト単独検索では、このモデルは OpenAI CLIP に対して 165% の性能向上を達成しました(MTEB で 0.429 vs 0.162)。画像タスクでは:テキストから画像の検索が 2% 向上(0.899)、画像からテキストの検索が 6%(0.803)、画像から画像の検索が 12%(0.916)。ゼロショット画像分類(CIFAR-100)では、標準 CLIP を上回ります。Flickr8k/30k と MSCOCO Captions でのクロスモーダル性能は、特化した単一モダリティモデルと競争力があります。12,288 トークンのテキストコンテキストは、画像とともに長文テキスト文書を検索する上で大きな優位性です。2026 年、jina-clip-v2 が 89 言語対応と 512×512 画像処理によりこのモデルを引き継ぎます。

ベストプラクティス

モデルは 224×224 ピクセルのタイルで画像を処理します。各タイルは 1,000 トークンを消費します。750×500 ピクセルの画像には 12 タイル(12,000 トークン)が必要です。テキストは単語あたり約 1.1 トークンです。マルチモーダルクエリでは、それに合わせてトークン予算を計画してください。モデルは現在英語のみ対応 — 多言語アプリケーションには jina-clip-v2 を使用してください。Jina Embeddings API 経由と、Hugging Face での Apache 2.0 ライセンスによるオープンソースリリースで利用可能です。本番環境では、AWS Marketplace と Azure のデプロイオプションが最適化されたインフラを提供します。クロスモーダル比較にはコサイン類似度を使用してください。新しいマルチモーダルプロジェクトでは、jina-clip-v2(89 言語、512×512 画像、MRL 対応)または jina-embeddings-v4(32K コンテキスト、マルチベクトルモード、コード対応)を優先してください。

このモデルについて言及しているブログ
6月 25, 2025 • 12 読む時間
Jina Embeddings v4:マルチモーダル多言語検索のためのユニバーサルなベクトルモデル (Embeddings)
Jina 向量模型 (Embeddings) v4 は、38 億のパラメータを持つユニバーサルな 向量模型 (Embedding) モデルであり、マルチモーダルおよび多言語の検索に対応し、シングルベクトルとマルチベクトルの 向量模型 (Embedding) 出力をサポートします。
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
4月 08, 2025 • 21 読む時間
jina-reranker-m0:多言語マルチモーダルドキュメントリランカー
視覚的なドキュメントを検索するための新しい多言語・マルチモーダルリランカー jina-reranker-m0 を紹介します。多言語の長文ドキュメントやコード検索タスクにおいて、最先端(SOTA)の性能を実現しています。
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
12月 12, 2024 • 12 読む時間
埋め込みモデルにおけるテスト時の計算リソースのスケーリング
より良い結果はコンピュート量に比例して向上します—より多くの学習、より多くの探索に。優れた事前学習モデルは大きな成果をもたらしますが、テスト時のコンピュート量を増やすことでさらなる向上が得られます。埋め込みモデルであっても、テスト時のコンピュート量をスケールさせるという新しいパラダイムを認識することが重要です。
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
12月 04, 2024 • 13 読む時間
長文脈モデルが全部処理できるのに、チャンキングはまだ必要なのか?
長いコンテキストの埋め込みモデルにおける異なるチャンク分割戦略のパフォーマンスを比較し、目的に最適なアプローチを見つける方法
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
11月 21, 2024 • 9 読む時間
Jina CLIP v2:テキストと画像のための多言語マルチモーダル埋め込み
89言語のマルチリンガルサポート、512x512 の高解像度画像対応、および Matryoshka 表現を備えた 0.9B のマルチモーダル埋め込みモデル、Jina-CLIP v2。
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するコンテンツ、ソフトウェア、製品、サービスは、すべて専門的な利用を目的としています。消費者向けの利用は想定していません。