概述
jina-embeddings-v2-base-zh 是一個 161M 參數的中英雙語文字向量模型,具有 8,192 token 的上下文視窗和 768 維輸出。它是首個以長上下文支援無縫處理中英文的開源模型,解決了 Transformer 架構中基於字符的中文文字的獨特分詞挑戰。
方法
該模型使用帶有對稱雙向 ALiBi 位置編碼的 BERT 骨幹、161M 參數和 768 維輸出空間。訓練遵循三階段方法:先在高中英雙語資料上初始預訓練,隨後進行含對比損失和困難負樣本挖掘的主、次微調階段。ALiBi 機制在不使用學習位置編碼的情況下實現了 8,192 token 的上下文視窗。最終發布的一個顯著改進是改進的相似度分數分佈,它解決了預覽版中的分數膨脹問題,產生更具判別性且校準良好的相似度分數。
效能
在 C-MTEB(中文 MTEB)排行榜上,該模型在 0.5GB 以下的模型中表現出卓越性能,尤其在中文任務上。它在中文特定的檢索和相似度任務上大幅超過 OpenAI 的 text-embedding-ada-002,同時在英文任務上保持有競爭力的性能。改進的相似度分數分佈提高了兩種語言中相關與不相關內容之間的判別。2026 年,jina-embeddings-v5-text-small 以 89 種語言、32K 上下文和任務特定 LoRA 適配器取代該模型。
最佳實踐
中英雙語檢索、跨語言文件搜尋和多語言內容分析的最佳選擇。對於超過 8,192 token 的文件,使用語意分塊或透過 Jina API 的 `late_chunking 參數。該模型可與主要向量資料庫和 RAG 框架整合。對於新的多語言專案,請優先使用 jina-embeddings-v5-text-small`(89 種語言、32K 上下文、LoRA 適配器)。生產吞吐量建議使用支援 CUDA 的 GPU。輸入文字應為中文或英文;該模型無需翻譯即可原生處理兩種語言。







