I/O 図
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
BEIR
57.06
Parameters
278M
Rank by score
7 / 21
Pareto front
On it
値の分布help_outlineAUC 0.8574
コーパス
翻訳ペア
ドキュメント検索
コード
関連63.0%
ハードネガティブ19.0%
無関連9.9%
推奨しきい値
FPR 0.1 · 0.367
FPR 0.01 · 0.683
FPR 0.001 · 0.839
FPR 0.0001 · 0.862
バランス · 0.270
AUC
0.8574
ノイズ上限
0.832
再現率の崖
0.061
測定ペア数
119 / 2,856
順位別スコアhelp_outline
各順位での平均スコア
1 位になるものhelp_outline
119 件のクエリのうち 50% で正解が 1 位
比較するモデルを選択してください
概要
Jina Reranker v2 Base Multilingual は、言語の壁やデータ型を越えて検索精度を向上させるために設計されたクロスエンコーダー モデルです。この Reranker は、多言語環境における正確な情報検索という重要な課題を解決し、さまざまな言語やコンテンツ タイプにわたって検索結果を最適化する必要があるグローバル企業にとって特に価値があります。100 を超える言語をサポートし、独自の関数呼び出しおよびコード検索機能を備えており、国際的なコンテンツ、API ドキュメント、および多言語コード ベースにわたる正確な検索の最適化を必要とするチーム向けの統合ソリューションです。このモデルのコンパクトな 278M パラメータ設計は、高いパフォーマンスとリソース効率のバランスを求めている組織にとって特に魅力的です。
方法
このモデルは、クロスエンコーダアーキテクチャとFlash Attention 2を組み合わせることで、クエリとドキュメントを直接比較し、より正確な関連性評価を可能にします。このモデルは4段階のトレーニングプロセスを経て学習します。まず英語の能力を確立し、次にクロスリンガルおよび多言語データを段階的に統合し、最後にハードネガティブサンプルを用いて最適化を行います。この革新的なトレーニング手法とFlash Attention 2の実装を組み合わせることで、モデルは最大1024トークンのコンテキストを処理できるようになり、長いドキュメントの自動チャンク化もサポートします。このアーキテクチャの効率性により、複数の言語にまたがる複雑な再ランク付けタスクも処理可能となり、前世代のモデルと比較して6倍のスループットを実現しながら、クエリとドキュメントの直接的なインタラクションを通じて正確な関連性評価を実現します。
パフォーマンス
実際の評価では、モデルはさまざまなベンチマークで良好なパフォーマンスを示しました。RAG システムの AirBench リーダーボードで最先端のパフォーマンスを実現し、26 言語をカバーする MKQA データセットを含む多言語タスクで優れています。このモデルは構造化データ タスクで特に優れており、関数呼び出し (ToolBench ベンチマーク) と SQL スキーマ マッチング (NSText2SQL ベンチマーク) の両方で高い再現率を達成しています。最も印象的なのは、bge-reranker-v2-m3 などの同等のモデルよりも 15 倍高速にドキュメントを処理しながらこれらの結果を提供し、リアルタイム アプリケーションに適していることです。ただし、最適なパフォーマンスを得るには推論用の CUDA 対応 GPU が必要であることに注意してください。
ベストプラクティス
このモデルを最適に導入するには CUDA 対応 GPU が必要です。また、Reranker API、Haystack や LangChain などの主要な RAG フレームワーク、またはクラウドマーケットプレイスを介したプライベート導入など、さまざまなチャネルからアクセスできます。このモデルは、言語の壁やデータ型にまたがる正確な理解が求められるシナリオに優れており、多言語コンテンツ、API ドキュメント、コードリポジトリを扱うグローバル企業に最適です。1024 トークンのコンテキストウィンドウと長いドキュメントの自動チャンク化により、長大なコンテンツを効率的に処理します。このモデルは、チームが言語間検索の精度を向上させたり、エージェント型 RAG システムに関数呼び出し機能を必要としたり、多言語コードベース全体でコード検索機能を強化したりする必要がある場合に検討する必要があります。その有効性はベクトル検索システムと組み合わせることで特に顕著になり、取得したドキュメントの最終的なランキングが大幅に向上します。
このモデルについて言及しているブログ









