Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
Elastic Inference Service
Elasticsearch内でJinaモデルをネイティブに実行する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
warning
このモデルは、新しいモデルでは非推奨になりました。
Embeddings
Reranker
Apache 2.0 ライセンス
open_in_new リリースノート

jina-colbert-v1-en

8K トークン長に対応した改良版 ColBERT。ベクトル化およびリランキングのタスクに利用できます
ライセンス
Apache-2.0
発売日
calendar_month
2024-02-17
入力
abc
文章
arrow_forward
出力
apps
マルチベクトル
モデル詳細
パラメータ: 137M
入力トークン長: 8K
出力寸法: 128
ベースモデル help_outline
open_in_new
jina-embeddings-v2-base-en
訓練された言語 help_outline
1 言語
以下の方法で入手できます
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
エアギャップ
I/O 図 1

複数

ベクター

クエリ

jina-colbert-v1-en

I/O 図 2

複数

ベクター

書類

jina-colbert-v1-en

Pareto fronthelp_outline
LoCo
BEIR · arguana
BEIR · climatefever
chevron_leftchevron_right
30M100M300M1B3.0B406080answerai-colbert-small-…bce-reranker-base_v1bge-reranker-basebge-reranker-v2-m3ColBERTv2jina-colbert-v2jina-reranker-m0jina-reranker-v1-base-enjina-reranker-v2-base-m…jina-reranker-v3jina-reranker-v3.5mxbai-rerank-base-v2mxbai-rerank-large-v2Qwen3-Reranker-0.6BQwen3-Reranker-4Bjina-colbert-v1-enParameters (log)nDCG@10
This model
On the front
Jina AI
Other
BEIR · arguana
49.40
Parameters
137M
Rank by score
9 / 16
Pareto front
Behind it
値の分布help_outline
AUC 0.5963
コーパス
翻訳ペア
15.7801020
関連17.0%
ハードネガティブ9.3%
無関連1.0%
推奨しきい値
FPR 0.1 · 9.27
FPR 0.01 · 15.78
FPR 0.001 · 21.53
FPR 0.0001 · 25.48
バランス · 7.98
AUC
0.5963
ノイズ上限
21.44
再現率の崖
-0.71
測定ペア数
100 / 9,200
順位別スコアhelp_outline
12345678910
各順位での平均スコア
比較するモデルを選択してください

概要

Jina-ColBERT-v1-en は、計算効率を犠牲にすることなく高精度を達成するという、情報検索における重要な課題を解決することにより、テキスト検索に革命をもたらします。ドキュメント全体を 1 つのベクトルに圧縮する従来のモデルとは異なり、このモデルは 1 億 3,700 万のパラメータのみを必要としながら、正確なトークンレベルの理解を維持します。検索アプリケーション、レコメンデーション システム、またはコンテンツ検出プラットフォームを構築しているチームにとって、Jina-ColBERT-v1-en は、検索品質とシステム パフォーマンスの間の従来のトレードオフを排除します。このモデルは、技術文書の検索、学術論文の検索、または微妙な意味上の関係を捉えることが、適切な情報の発見と重要なコンテンツの欠落との違いを生む可能性があるアプリケーションなど、微妙なテキストの理解が重要なシナリオで特にうまく機能します。

方法

このモデルは、文書検索の仕組みを根本的に変える革新的な後期インタラクションアーキテクチャを採用しています。すべての文書を一度に比較するのではなく、ColBERTの改良版を用いて、最終的なマッチング段階の前にクエリと文書を個別に処理します。このアーキテクチャは、2つの主要コンポーネント、つまり最大8,192トークン(標準的なTransformerの16倍以上)を処理できる文書エンコーダと、正確なトークンレベルの表現を作成するクエリエンコーダを組み合わせています。クエリと文書内の各トークンはそれぞれ128次元のベクトルを持ち、単一のベクトルでは失われる可能性のあるきめ細かな意味情報を保持します。後期インタラクションメカニズムは、Maxプーリングと合計演算を用いて最終的な関連性スコアを計算することで、コストのかかる「全対全」比較を必要とせずに、クエリと文書間の効率的なトークンごとのマッチングを可能にします。

パフォーマンス

Jina-ColBERT-v1-en は、さまざまなベンチマークでベースライン モデルを上回る顕著な改善を示します。BEIR データセット群では、複数のカテゴリで優れたパフォーマンスを達成しています。Arguana では 49.4%(ColBERTv2 は 46.5%)、FEVER では 79.5%(同 78.8%)、TREC-COVID では 75.0%(同 72.6%)です。最も印象的なのは、ロングコンテキスト理解の LoCo ベンチマークで大幅な改善が見られ、ColBERTv2 の 74.3% と比較して 83.7% のスコアを示したことです。このモデルは、詳細な意味理解を必要とするシナリオで特に優れており、革新的な後期インタラクション アプローチによって計算効率を維持しながら、従来の埋め込みモデルを上回るパフォーマンスを発揮します。これらの改善は、モデルのパラメーター数を 137M に抑えながら達成されており、強力かつ実稼働環境での展開にも実用的なモデルとなっています。

ベストプラクティス

Jina-ColBERT-v1-en を効果的に展開するには、チームはいくつかの実用的な側面を考慮する必要があります。このモデルでは、最適なパフォーマンスを得るために CUDA 対応 GPU が必要ですが、開発中に CPU 推論が利用可能です。文書処理の場合、8,192 トークンの制限は約 6,000 ワードに相当し、学術論文、技術文書、長文コンテンツなど、ほとんどの種類の文書に適しています。チームは、トークン制限に対処するために効果的なドキュメント前処理を実装し、大規模なインデックス作成のためのバッチ処理を検討する必要があります。このモデルは英語コンテンツの処理には優れていますが、多言語アプリケーションや言語をまたいだ検索向けには設計されていません。運用環境の場合は、適切なドキュメントのチャンク化戦略を実装し、効率的な検索のために FAISS などのベクトル類似性インデックスの使用を検討してください。このモデルは、RAGatouille などのフレームワークを使用して RAG パイプラインに統合すると特に効果的であり、複雑な取得パターンの実装が簡素化されます。
このモデルについて言及しているブログ
8月 30, 2024 • 10 読む時間
Jina ColBERT v2: Multilingual Late Interaction Retriever for Embedding and Reranking
Jina ColBERT v2 supports 89 languages with superior retrieval performance, user-controlled output dimensions, and 8192 token-length.
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
6月 19, 2024 • 11 読む時間
AI Explainability Made Easy: How Late Interaction Makes Jina-ColBERT Transparent
AI explainability and transparency are hot topics. How can we trust AI if we can't see how it works? Jina-ColBERT shows you how, with the right model architecture, you can easily make your AI spill its secrets.
Maximilian Werk
Scott Martens
Digital representation of a golden building seen through a blue and yellow mesh pattern, evoking a technological vibe.
5月 13, 2024 • 5 読む時間
Albus by Springworks: Empowering Employees with Enterprise Search
Learn how a leading HR-tech startup uses Jina AI’s models to talk with structured and unstructured data.
Francesco Kruk
Saahil Ognawala
Albus logo in white on a dark blue background, surrounded by abstract blue shapes and symbols.
4月 29, 2024 • 7 読む時間
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
2月 20, 2024 • 16 読む時間
What is ColBERT and Late Interaction and Why They Matter in Search?
Jina AI's ColBERT on Hugging Face has set Twitter abuzz, bringing a fresh perspective to search with its 8192-token capability. This article unpacks the nuances of ColBERT and ColBERTv2, showcasing their innovative designs and why their late interaction feature is a game-changer for search.
Han Xiao
Neon theater or concert hall marquee letters lit up at night with city lights and faint "Adobe Sto" visible.
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。