Jina AI 再次又展示其對高品質多語言 AI 模型的承諾,推出了其西班牙語-英語雙語模型。
這個模型可以為長達 8k token 的西班牙語或英語文本提供嵌入向量,其設計理念是:如果兩種語言的文本表達相同的意思,它們的嵌入向量在幾何空間上會非常接近。Jina Embeddings v2 的西班牙語和英語版本特別適合跨語言資訊檢索、雙語語義分析和雙語 RAG 應用。
這個新模型 jina-embeddings-v2-base-es 為西班牙語帶來了與 Jina AI 在英語、德語、中文和程式語言上相同的最先進性能和突破性功能:
- 8,192 tokens 的輸入上下文,在開源嵌入模型中處於領先地位。
- 真正的雙語能力而非不均衡的多語言支援。Jina AI 的雙語模型經過訓練,可以為兩種語言提供平衡的支援,避免了在未經整理的網路抓取數據上訓練的「多語言」模型的偏差。
- jina-embeddings-v2-base-es 相比於性能相當的開源模型更加精簡。嵌入向量維度為 768,可以節省生產環境中的空間和運行時間。
- Jina Embeddings v2 模型已完全整合到主要的向量資料庫、RAG 框架和 AI 開發函式庫中:
Jina Embeddings v2 的西班牙語和英語版本現在可以透過 Jina Embeddings API 使用,提供一百萬個免費 tokens,讓你可以免費試用。

tag基準測試
在西班牙語基準測試中,Jina v2 的西班牙語和英語版本優於Multilingual E5 base 模型和BGE M3 模型,這些是唯一可比較的具有西班牙語支援的開源模型。以下測試(MTEB-es)改編自Massive Text Embeddings Benchmark。你可以在這個 GitHub 儲存庫中查看和運行它們。

除了分類之外,Jina Embeddings 在所有指標上都優於 E5,並且在檢索、聚類和跨語言任務中優於 BGE-M3,儘管其大小只有這些大型模型的 15% 到 30%。
- 在檢索任務(如在資料庫中尋找相關文件)和聚類(識別集合中屬於同一群組的文件)方面表現明顯更好
- 在重排序(按語義相似度排序文件)方面與 E5 表現相當,在西班牙語文本分類方面接近相等的表現。
- 三個模型在跨語言任務(為西班牙語輸入找到語義相似的英語文本,或反之亦然)的基準測試分數非常相似,儘管 Jina Embeddings 仍然表現最佳。
與 Open AI 和 Cohere 的閉源多語言模型相比,Jina Embeddings 的精簡尺寸使其成就更加令人印象深刻。

在西班牙語檢索任務中,Jina 優於 Open AI 和 Cohere 提供的閉源模型,並在跨語言任務中優於 Open AI(且接近 Cohere 的表現)。
tagJina Embeddings:為多語言世界打造的 AI
西班牙語使用者超過五億人,在二十多個國家具有官方語言地位,同時也是歐盟、聯合國、世界貿易組織和國際足聯的官方語言。推出這個專門的雙語模型清楚展示了 Jina AI 致力於將 AI 技術帶給每個人的承諾。
除了西班牙語和其高性能的英語單語模型,Jina AI 目前為德語、中文和程式語言提供最先進的嵌入模型,未來還會推出更多語言。
Jina AI 致力於為最廣大的受眾推進 AI 技術,高度重視透明度、可存取性、可負擔性、隱私和資料保護。
我們重視您對所有模型的回饋。加入我們的社群頻道,貢獻想法並及時瞭解新的發展。







