I/O 圖

文字

jina-embeddings-v2-base-zh

向量

帕累託前緣
30M100M300M1B3.0B10B506070acge_text_embeddingbge-base-zhbge-base-zh-v1.5bge-large-zh-noinstructbge-small-zhbge-small-zh-v1.5Conan-embedding-v1Dmeta-embedding-zh-smalle5-mistral-7b-instructgte-base-zhgte-large-zhgte-multilingual-basegte-Qwen1.5-7B-instructgte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-small-zhluotuo-bert-mediumm3e-basem3e-largemultilingual-e5-basemultilingual-e5-largemultilingual-e5-smallpiccolo-base-zhpiccolo-large-zh-v2stella-base-zh-v2stella-base-zh-v3-1792dstella-large-zh-v2stella-mrl-large-zh-v3.…text2vec-base-chinesetext2vec-large-chinesexiaobu-embeddingxiaobu-embedding-v2Yinkazpoint_large_embedding_…參數量(對數)score
本模型
在前緣上
Jina AI
其他
C-MTEB
63.79
參數量
161M
按分數的排名
23 / 40
帕累託前緣
在前緣之後
取值分佈
AUC 0.8373
語料
翻譯對
文件檢索
0.6820.000.200.400.600.80
相關12.6%
困難負例1.8%
無關1.2%
推薦閾值
FPR 0.1 · 0.475
FPR 0.01 · 0.682
FPR 0.001 · 0.796
FPR 0.0001 · 0.835
均衡 · 0.353
AUC
0.8373
噪聲上限
0.793
召回懸崖
0.113
測量樣本對
119 / 11k
向量分量
-0.180.000.18
σ 0.0361 · 183k 個數值
向量幾何
0768
各維度均值,懸停檢視區間
噪聲下限
0.308
有效維度
56 / 768
選擇要比較的模型
論文 (1)

概述

jina-embeddings-v2-base-zh 是一個 161M 參數的中英雙語文字向量模型,具有 8,192 token 的上下文視窗和 768 維輸出。它是首個以長上下文支援無縫處理中英文的開源模型,解決了 Transformer 架構中基於字符的中文文字的獨特分詞挑戰。

方法

該模型使用帶有對稱雙向 ALiBi 位置編碼的 BERT 骨幹、161M 參數和 768 維輸出空間。訓練遵循三階段方法:先在高中英雙語資料上初始預訓練,隨後進行含對比損失和困難負樣本挖掘的主、次微調階段。ALiBi 機制在不使用學習位置編碼的情況下實現了 8,192 token 的上下文視窗。最終發布的一個顯著改進是改進的相似度分數分佈,它解決了預覽版中的分數膨脹問題,產生更具判別性且校準良好的相似度分數。

效能

在 C-MTEB(中文 MTEB)排行榜上,該模型在 0.5GB 以下的模型中表現出卓越性能,尤其在中文任務上。它在中文特定的檢索和相似度任務上大幅超過 OpenAI 的 text-embedding-ada-002,同時在英文任務上保持有競爭力的性能。改進的相似度分數分佈提高了兩種語言中相關與不相關內容之間的判別。2026 年,jina-embeddings-v5-text-small 以 89 種語言、32K 上下文和任務特定 LoRA 適配器取代該模型。

最佳實踐

中英雙語檢索、跨語言文件搜尋和多語言內容分析的最佳選擇。對於超過 8,192 token 的文件,使用語意分塊或透過 Jina API 的 `late_chunking 參數。該模型可與主要向量資料庫和 RAG 框架整合。對於新的多語言專案,請優先使用 jina-embeddings-v5-text-small`(89 種語言、32K 上下文、LoRA 適配器)。生產吞吐量建議使用支援 CUDA 的 GPU。輸入文字應為中文或英文;該模型無需翻譯即可原生處理兩種語言。

提及此模型的部落格