I/O 圖 1
I/O 圖 2
取值分佈help_outlineAUC 0.9726
語料
翻譯對
程式碼
相關81.0%
困難負例10.3%
無關0.8%
懸停或點選圖表可移動閾值
推薦閾值
FPR 0.1 · 17.83
FPR 0.01 · 19.14
FPR 0.001 · 21.08
FPR 0.0001 · 23.67
均衡 · 18.66
AUC
0.9726
噪聲上限
21.05
召回懸崖
16.22
測量樣本對
100 / 9,200
各名次得分help_outline
各名次位置上的平均得分
選擇要比較的模型
論文 (1)
概述
Jina-ColBERT-v2 是一款突破性的多語言資訊檢索模型,解決了跨語言高效、高品質檢索的核心難題。作為首個能生成緊湊向量的多語言 ColBERT 類模型,它滿足了全球化應用對可擴充套件、高價效比多語言檢索方案的迫切需求。從電商平臺到內容管理系統,處理多語言內容的企業都可藉助該模型獲得覆蓋 89 種語言的精準檢索結果,同時憑藉創新的降維能力顯著降低儲存與計算成本。
方法
該模型以 ColBERT 架構為基礎,引入精巧的遲交互機制,從根本上改變了查詢與文件的匹配方式。其核心是改造過的 XLM-RoBERTa 主幹網路,含 5.6 億參數,輔以旋轉位置編碼,並用 FlashAttention 做最佳化。訓練分兩個關鍵階段:先用多語言的弱監督資料做預訓練,再用帶標註的三元組資料做微調和監督蒸餾。這套方案的獨到之處在於引入了 Matryoshka 表示學習,一次訓練即可產出 128、96 或 64 等多種維度的向量,無需重新訓練就能動態最佳化儲存開銷。
效能
在實際測試中,Jina-ColBERT-v2 於多項基準上展現出卓越能力。英語任務比原版 ColBERT-v2 提升 6.5%,14 項 BEIR 基準的平均分為 0.521。更難得的是,在 MIRACL 基準的所有受測語言上,它都優於傳統的 BM25 檢索方法,跨語言場景中的優勢尤為明顯。即便降低向量維度,效能依然穩固:從 128 維降到 64 維,效能僅下降 1.5%,儲存需求卻減半。這在生產環境中意味着可觀的成本節省,例如在 AWS 上儲存 1 億篇文件,64 維向量每月費用為 659.62 美元,128 維則需 1,319.24 美元。
最佳實踐
部署 Jina-ColBERT-v2 時,請留意以下幾個實際問題。要獲得最佳效能,模型需要支援 CUDA 的硬體;文件長度最高支援 8,192 詞元(可擴充套件至 12,288),查詢則限制在 32 詞元以內。生產部署可透過 Jina Search Foundation API、AWS 市場和 Azure 獲取,非商業版本可在 Hugging Face 上取用。接入時請明確當前向量化的是查詢還是文件,因為模型採用非對稱編碼。它並非為在沒有索引的情況下實時處理超大文件集合而設計;多語言檢索雖是它的強項,但面對特定垂直領域的任務,表現可能略遜於針對該領域微調過的模型。
提及此模型的部落格









