Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
warning
このモデルは、新しいモデルでは非推奨になりました。
Embeddings
Apache 2.0 ライセンス
open_in_new リリースノート

jina-clip-v1

画像と英語テキストのマルチモーダルベクトルモデル
ライセンス
Apache-2.0
発売日
calendar_month
2024-06-05
入力
image
写真
abc
文章
arrow_forward
出力
more_horiz
ベクター
モデル詳細
パラメータ: 223M
入力トークン長: 8K
入力画像サイズ: 224×224
出力寸法: 768
ベースモデル help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
訓練された言語 help_outline
1 言語
関連機種
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
以下の方法で入手できます
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
エアギャップ
I/O 図 1

文章

jina-clip-v1

ベクター

I/O 図 2

画像

jina-clip-v1

ベクター

パレートフロンhelp_outline
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14jina-clip-v2MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v1パラメータ数(対数)i2t-recall@5
このモデル
フロン上
Jina AI
その他
CLIP Benchmark
87.65
パラメータ
223M
スコア順位
44 / 56
パレートフロン
フロン未満
値の分布help_outline
AUC 0.8440
コーパス
翻訳ペア
ドキュメント検索
画像 / バナー
0.6750.000.200.400.600.80
関連20.2%
ハードネガティブ3.2%
無関連1.2%
推奨しきい値
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
バランス · 0.376
AUC
0.8440
ノイズ上限
0.779
再現率の崖
0.123
測定ペア数
119 / 11k
ベクトル成分help_outline
-0.18-0.010.15
σ 0.0361 · 183k 個の値
埋め込みの幾何help_outline
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.283
実効次元数
55 / 768
比較するモデルを選択してください
論文 (1)
ICML 2024
5月 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

概要

Jina CLIP v1 は、テキストからテキスト、テキストから画像への検索タスクに優れた最初のモデルであり、マルチモーダル AI に革命をもたらしました。テキストのみのシナリオではパフォーマンスが低い従来の CLIP モデルとは異なり、私たちが提案するモデルは、223M のパラメータという非常にコンパクトなサイズを維持しながら、すべての検索の組み合わせで最先端のパフォーマンスを実現します。このモデルは、テキストと画像処理用の個別のモデルの必要性を排除し、システムの複雑さと計算オーバーヘッドを削減することで、業界の主要な課題に対処します。検索システム、推奨エンジン、またはコンテンツ分析ツールを構築するチームにとって、Jina CLIP v1 は、テキストとビジュアル コンテンツを非常に高い精度で処理するための単一の効率的なソリューションを提供します。

方法

このモデルのアーキテクチャは、調整された Jina BERT v2 テキスト エンコーダーと北京人工知能アカデミーの最先端の EVA-02 画像エンコーダーを組み合わせたもので、マルチモーダル AI 設計における大きな革新を表しています。テキスト エンコーダーは最大 12,288 トークンのシーケンスをサポートします。これは、元の CLIP の 77 トークンの制限の 100 倍以上です。一方、イメージ エンコーダーは 16 個のパッチ トークンを効率的に処理できます。トレーニング プロセスは、新しい 3 段階のアプローチに従います。まず、テキスト理解を維持しながら、インターリーブされたテキスト ペアを使用してトレーニングすることで、画像とキャプションのペアを揃えます。次に、AI が生成した画像のより長いテキスト説明を組み込みます。最後に、ハード否定テキスト トリプレットを使用して、意味識別機能を強化します。この独自のトレーニング アプローチにより、モデルは強力な視覚的理解を維持しながら、短いタイトルと詳細なテキスト説明の両方で高いパフォーマンスを維持できます。

パフォーマンス

Jina CLIP v1 は、すべてのベンチマークにおいて OpenAI のオリジナル CLIP よりも大幅な改善を実現しています。プレーンテキスト検索では、CLIP の 0.162 と比較して 165% 優れたスコア 0.429 を獲得しました。画像関連のタスクでは、一貫した改善が見られ、テキストから画像への検索は 2% (0.899) 向上し、画像からテキストへの検索は 6% (0.803) 向上し、画像から画像への検索は 12% (0.916) 向上しました。このモデルは、ゼロショット視覚分類タスクで特に優れたパフォーマンスを発揮し、特定のドメインで事前のトレーニングを行わずに画像を分類することに成功しました。テキスト検索用の MTEB、画像タスク用の CIFAR-100、クロスモーダル パフォーマンス用の Flickr8k/30k および MSCOCO Captions などの標準ベンチマークで評価すると、クロスモーダル タスクで競争力のあるパフォーマンスを維持しながら、専門的なユニモーダル モデルを一貫して上回ります。

ベストプラクティス

Jina CLIP v1 を効果的に導入するには、チームはその機能とリソース要件の両方を考慮する必要があります。このモデルは 224 x 224 ピクセルのタイルで画像を処理し、各タイルは 1,000 トークンの処理能力を消費します。最高のパフォーマンスを得るには、これらの寸法に合わせて効果的な画像前処理を実装します。このモデルは短いテキストと長いテキストの両方の処理で優れたパフォーマンスを発揮しますが、現在は英語の入力のみをサポートしています。チームはトークンの使用を慎重に検討する必要があります。テキストは 1 単語あたり約 1.1 トークンを必要としますが、画像はタイルで処理されます (たとえば、750 x 500 ピクセルの画像には 12 個のタイルが必要で、12,000 トークンを消費します)。このモデルは、Jina Embeddings API 経由で、また Apache 2.0 ライセンスの下で Hugging Face のオープンソースとして利用可能であり、柔軟な展開オプションを提供します。実稼働環境では、最適化されたインフラストラクチャ設定を提供する AWS Marketplace または Azure デプロイメント オプションの使用を検討してください。
このモデルについて言及しているブログ
6月 25, 2025 • 12 読む時間
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
4月 08, 2025 • 21 読む時間
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
12月 12, 2024 • 12 読む時間
Scaling Test-Time Compute For Embedding Models
Better results scale with compute—more on learning, more on search. A good pretrained model takes you far, but test-time compute takes you further. It's time to recognize this paradigm of test-time compute, even for embedding models.
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
12月 04, 2024 • 13 読む時間
Still Need Chunking When Long-Context Models Can Do It All?
Comparing how long-context embedding models perform with different chunking strategies to find the optimal approach for your needs.
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
11月 21, 2024 • 9 読む時間
Jina CLIP v2: Multilingual Multimodal Embeddings for Text and Images
Jina-CLIP v2, a 0.9B multimodal embedding model with multilingual support of 89 languages, high image resolution at 512x512, and Matryoshka representations.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。