概述
jina-embeddings-v2-base-de 是一個 161M 參數的德英雙語文字向量模型,具有 8,192 token 的上下文視窗。它將兩種語言中語意等價的內容映射到相同的 768 維向量空間,從而實現無需翻譯的跨語言檢索。該模型是首批將長上下文支援與兩種語言均衡性能相結合的開源雙語向量模型之一。
方法
基於帶有對稱雙向 ALiBi 位置編碼的 BERT 骨幹構建,該模型透過統一的 161M 參數架構處理德語和英語,產生 768 維向量。訓練包含三個階段:(1) 德英平行語料庫上的多語言預訓練,(2) 含困難負樣本的精選句對上的對比微調,(3) 確保德語和英語中語意等價文字映射到向量空間鄰近區域的跨語言對齊訓練。一個關鍵設計選擇是偏置最小化目標,它抵消多語言模型偏向英語句法結構的傾向——這是早期多語言向量模型中文檔化的失敗模式。ALiBi 帶來的 8,192 token 視窗使兩種語言的完整文件都能無截斷處理。
效能
該模型超過 Microsoft 的 E5-base 同時不到其大小的三分之一,並且儘管小 7 倍仍與 E5-large 性能相當。在 WikiCLIR(英文到德文檢索)、STS17/STS22(雙向語意相似度)和 BUCC(雙語文字對齊)上,它一致超過同等或更大尺寸的模型。322MB 的佔用使其可在標準硬體上部署。2026 年,jina-embeddings-v5-text-small 在大多數應用中取代該模型,提供 32K 上下文、89 種語言和任務特定 LoRA 適配器。v2-base-de 模型在 8K 上下文足夠的德英雙語流水線中仍有價值。
最佳實踐
德英雙語檢索的最佳選擇:產品搜尋、支援文件和內容管理,其中查詢和文件可能是不同語言。對於超過 8,192 token 的文件,使用語意分塊或透過 Jina API 的 `late_chunking 參數。該模型可與 Qdrant、Weaviate、MongoDB 和 Milvus 整合。對於涵蓋兩種以上語言的新多語言專案,請優先使用 jina-embeddings-v5-text-small`(89 種語言、32K 上下文、LoRA 適配器)。生產吞吐量建議使用支援 CUDA 的 GPU。









