概述
jina-colbert-v1-en 是一個 137M 參數的英語遲交互(late-interaction)檢索模型,產生 token 級向量(每 token 128 維),而非單一文件向量。這使得以雙編碼器效率獲得交叉編碼器品質成為可能:文件只需索引一次,相關性評分在查詢時透過對 token 對的極大池化和求和完成。它支援 8,192 token 的文件,是首個將 ColBERT 風格檢索引入生產的 Jina 模型。
方法
該模型採用基於改編 ColBERT 方案的遲交互架構。它不會一次性比較整個文件,而是獨立處理查詢和文件,直到最終匹配階段。文件編碼器處理多達 8,192 token 的文字;查詢編碼器產生精確的 token 級表示。查詢和文件中的每個 token 都獲得自己的 128 維向量,保留了單向量模型中丟失的細粒度語意資訊。遲交互機制透過對查詢 token 做極大池化、對文件 token 做求和來計算相關性分數,在避免交叉編碼器昂貴的全對全注意力的同時捕捉 token 級匹配訊號。該架構使用 137M 參數、基於 BERT 的編碼器和針對 8,192 token 上下文的 ALiBi 位置編碼。
效能
在 BEIR 資料集集合上,模型取得優越性能:Arguana 49.4%(ColBERTv2 為 46.5%)、FEVER 79.5%(對比 78.8%)、TREC-COVID 75.0%(對比 72.6%)。最令人印象深刻的是長上下文理解的 LoCo 基準上的大幅提升,得分 83.7%,而 ColBERTv2 為 74.3%——9.4 個百分點的增益展示了 token 級表示對長文件的價值。該模型在透過遲交互方案保持計算效率的同時,超過了傳統單向量模型。137M 參數量使其適合生產部署。
最佳實踐
當您需要交叉編碼器的檢索品質而不需要其延遲時使用此模型。最佳性能需要支援 CUDA 的 GPU;開發時可用 CPU 推理。8,192 token 的文件上限約為 6,000 字,適合包括學術論文和技術文件在內的大多數文件類型。該模型僅支援英語——多語應用請使用 jina-colbert-v2。生產部署應實現適當的文件分塊策略,並使用向量相似度索引(FAISS、Qdrant、Weaviate)進行高效檢索。在採用 RAGatouille 等簡化遲交互實現的框架的 RAG 流水線中,該模型尤其有效。如需多語支援或更高精確度,請考慮 jina-colbert-v2 或 jina-embeddings-v4(多向量模式)。











