Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
向量模型
重排模型
copyright CC BY-NC 4.0
open_in_new 釋出部落格

jina-colbert-v2

最好的多語言 ColBERT,在向量化和重排上均有頂尖表現
許可證
copyright CC-BY-NC-4.0
釋出日期
calendar_month
2024-08-31
輸入
abc
文字
arrow_forward
輸出
apps
多向量
Matryoshka 維度 help_outline
64
96
128
模型詳情
參數: 560M
輸入詞元長度: 8K
輸出維度: 128
底座模型 help_outline
jina-xlm-roberta
已訓練語言 help_outline
89 種語言
支援的語言 help_outline
108 種語言
相關模型
link
jina-colbert-v1-en
可透過以下方式獲取
Jina API
AWS SageMaker
Microsoft Azure
谷歌雲
Hugging Face
物理隔離
I/O 圖 1

多個

向量

查詢

jina-colbert-v2

I/O 圖 2

多個

向量

文件

jina-colbert-v2

帕累託前緣help_outline
BEIR
MIRACL
chevron_leftchevron_right
30M100M300M1B3.0B50556065answerai-colbert-small-…bge-reranker-basebge-reranker-v2-m3ColBERTv2GTE-ModernColBERT-v1jina-reranker-m0jina-reranker-v1-base-enjina-reranker-v1-turbo-…jina-reranker-v2-base-m…jina-reranker-v3jina-reranker-v3.5ms-marco-MiniLM-L-4-v2mxbai-rerank-base-v1mxbai-rerank-base-v2mxbai-rerank-large-v2mxbai-rerank-xsmall-v1Qwen3-Reranker-0.6Bjina-colbert-v2參數量(對數)nDCG@10
本模型
在前緣上
Jina AI
其他
BEIR
54.49
參數量
559M
按分數的排名
12 / 21
帕累託前緣
在前緣之後
取值分佈help_outline
AUC 0.9726
語料
翻譯對
程式碼
19.141518202325
相關81.0%
困難負例10.3%
無關0.8%
推薦閾值
FPR 0.1 · 17.83
FPR 0.01 · 19.14
FPR 0.001 · 21.08
FPR 0.0001 · 23.67
均衡 · 18.66
AUC
0.9726
噪聲上限
21.05
召回懸崖
16.22
測量樣本對
100 / 9,200
各名次得分help_outline
12345678910
各名次位置上的平均得分
選擇要比較的模型
論文 (1)
EMNLP 2024
八月 30, 2024
Jina-ColBERT-v2: A General-Purpose Multilingual Late Interaction Retriever

概述

jina-colbert-v2 是一個 560M 參數的多語遲交互檢索模型,支援 89 種語言。它是首個產生緊湊 token 級向量(每 token 64–128 維)的多語 ColBERT 類模型,實現可擴展、經濟的多語搜尋。Matryoshka 表示學習允許將維度從 128 降至 64,性能僅下降 1.5%,儲存需求減半。

方法

該模型基於 ColBERT 遲交互架構,採用改進的 XLM-RoBERTa 骨幹(560M 參數),增強旋轉位置編碼並以 Flash Attention 最佳化。訓練涉及兩個關鍵階段:(1) 在來自各種語言的多樣弱監督資料上進行初始預訓練,(2) 使用標註三元組資料並藉助更大教師模型的監督蒸餾進行微調。關鍵創新是為多向量表示實現 Matryoshka 表示學習:模型從單一訓練過程產生 128、96 或 64 維的 token 級向量,無需重新訓練即可實現動態儲存最佳化。8,192 token 的文件上下文(可擴展至 12,288)和 32 token 的查詢限制透過 ALiBi 位置編碼管理。

效能

該模型在英語任務上較原始 ColBERT-v2 提升 6.5%,在 14 個 BEIR 基準上平均得分 0.521。它在 MIRACL 基準的所有測試語言上超過傳統 BM25 檢索方法,在跨語言場景中表現尤為突出。從 128 維降到 64 維僅導致 1.5% 的性能下降,同時儲存需求減半——例如,在 AWS 上用 64 維向量儲存 1 億個文件每月花費 659.62 美元,而 128 維需 1,319.24 美元。模型的多語覆蓋(89 種語言)和緊湊的 token 向量使其非常適合全球搜尋應用。

最佳實踐

該模型需要支援 CUDA 的硬體以獲得最佳性能。它支援最長 8,192 token 的文件(可擴展至 12,288),查詢限制為 32 token。生產部署可透過 Jina Search Foundation API、AWS 市場和 Azure 獲得,Hugging Face 上有非商業版本。實施時請指定是嵌入查詢還是文件——該模型使用非對稱編碼。該模型不適合在沒有適當索引的情況下即時處理超大規模文件集合;請使用 FAISS、Qdrant 或 Weaviate 進行 ANN 搜尋。對於領域特定任務,請考慮在你的語料上微調。對於需要更高維度輸出的單向量檢索,請考慮 jina-embeddings-v4(多向量模式)或 jina-embeddings-v5-text-small。

提及此模型的部落格
十月 03, 2025 • 7 分鐘閱讀
Jina Reranker v3: 0.6B Listwise Reranker for SOTA Multilingual Retrieval
New 0.6B-parameter listwise reranker that considers the query and all candidate documents in a single context window.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
十二月 16, 2024 • 2 分鐘閱讀
Re·Search: Order 2024 Yearbook of Search Foundation Advances
Discover Re·Search, our premium yearbook showcasing our best research articles and search foundation models in 2024. Featuring spot UV-coated hardcover, 160 full-color pages, and meticulous design throughout. Available worldwide at $35, shipping included.
Jina AI
Open red publication "ReSearch" volume 24 displayed on a white surface with a distinctive shadow casting over the pages.
十月 29, 2024 • 11 分鐘閱讀
Beyond CLIP: How Jina-CLIP Advances Multimodal Search
Learn how Jina-CLIP enhances OpenAI's CLIP with better retrieval accuracy and more diverse results through unified text-image embeddings.
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
八月 30, 2024 • 10 分鐘閱讀
Jina ColBERT v2: Multilingual Late Interaction Retriever for Embedding and Reranking
Jina ColBERT v2 supports 89 languages with superior retrieval performance, user-controlled output dimensions, and 8192 token-length.
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
二月 20, 2024 • 16 分鐘閱讀
What is ColBERT and Late Interaction and Why They Matter in Search?
Jina AI's ColBERT on Hugging Face has set Twitter abuzz, bringing a fresh perspective to search with its 8192-token capability. This article unpacks the nuances of ColBERT and ColBERTv2, showcasing their innovative designs and why their late interaction feature is a game-changer for search.
Han Xiao
Neon theater or concert hall marquee letters lit up at night with city lights and faint "Adobe Sto" visible.
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 標誌
open_in_new
下載 Elastic 標誌
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業使用,不面向消費者。