概要
jina-reranker-v1-tiny-en は 33M パラメータの英語クロスエンコーダーリランカー — Jina v1 ファミリーの中で最小です。積極的なナレッジ蒸留により、ベースモデルの精度の 92.5 % を維持しながら、文書を 5 倍速で処理し、turbo バリアントよりメモリ使用量が 13 % 少なくなります。厳しいレイテンシ予算を持つエッジコンピューティング、モバイルアプリケーション、高スループット検索システム向けに設計されています。
方法
モデルは対称双方向 ALiBi 位置エンコーディングを持つ JinaBERT ベースのスリムな 4 層アーキテクチャを採用しています。開発は、教師モデルとして機能する 137M パラメータの jina-reranker-v1-base-en からのナレッジ蒸留を活用しています。生徒モデルは、広範な実世界の訓練データなしで最適なランキング動作を学習し、33M パラメータのみで教師のソフトランキング分布に匹敵します。4 層の設計と削減された隠れ次元により、ベースモデルに対する 5 倍の高速化を可能にします。モデルは長い文書の自動チャンキング付きで 1,024 トークンのコンテキストをサポートします。
パフォーマンス
BEIR では、モデルは NDCG@10 48.54 を達成し、ベースモデルの性能(52.45)の 92.5 % を維持しながら、そのサイズのわずか 1/4 に留まります。LlamaIndex RAG ベンチマークでは、ドキュメントを大幅に高速処理しながら 83.16 % のヒット率を維持し、より大きなモデルにほぼ匹敵します。スループットはベースモデルのほぼ 5 倍で、turbo バリアントよりメモリ使用量は 13 % 少ないです。これらの指標は、mxbai-rerank-base-v1(184M)や bge-reranker-base(278M)といったはるかに大きなモデルと匹敵するか上回ります。性能とサイズのトレードオフにより、リソース制約のあるデプロイに特に適しています。
ベストプラクティス
処理速度とリソース効率が決定的なシナリオを優先してください:エッジコンピューティング、モバイルアプリケーション、厳しいレイテンシ予算を持つ高スループット検索システム。ランキング精度の絶対的最大値を必要とするアプリケーションには、ベースモデルまたは jina-reranker-v3.5 が望ましいです。モデルは最適な性能に CUDA 対応 GPU が必要ですが、より大きな対応モデルより高性能でないハードウェアでも動作します。主要なベクトルデータベースと RAG フレームワークと統合でき、Jina Reranker API と AWS SageMaker で利用可能です。モデルは英語のみ。多言語アプリケーションには jina-reranker-v2-base-multilingual または jina-reranker-v3.5 を使用してください。特定ドメインのためのファインチューニングでは、性能特性を維持するために訓練データの品質とモデルのスリムなアーキテクチャを慎重にバランスさせてください。





