Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
warning
此模型已被更新的模型取代。
向量模型
Apache 2.0 許可證
open_in_new 釋出部落格

jina-embeddings-v2-base-de

支援德英雙語的 8K 最佳向量模型
許可證
Apache-2.0
釋出日期
calendar_month
2024-01-15
輸入
abc
文字
arrow_forward
輸出
more_horiz
向量
延遲分塊 help_outline
check_circle
Yes
模型詳情
參數: 161M
輸入詞元長度: 8K
輸出維度: 768
底座模型 help_outline
jina-bert-v2-base-de
已訓練語言 help_outline
2 種語言
相關模型
link
jina-embeddings-v2-base-en
可透過以下方式獲取
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
物理隔離
I/O 圖

文字

jina-embeddings-v2-base-de

向量

帕累託前緣help_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…參數量(對數)nDCG@10
本模型
在前緣上
Jina AI
其他
MTEB English · retrieval
44.10
參數量
161M
按分數的排名
27 / 39
帕累託前緣
在前緣之後
取值分佈help_outline
AUC 0.8452
語料
翻譯對
文件檢索
0.6900.000.200.400.600.80
相關16.8%
困難負例1.7%
無關0.9%
推薦閾值
FPR 0.1 · 0.499
FPR 0.01 · 0.690
FPR 0.001 · 0.796
FPR 0.0001 · 0.897
均衡 · 0.368
AUC
0.8452
噪聲上限
0.793
召回懸崖
0.195
測量樣本對
119 / 11k
向量分量help_outline
-0.19-0.010.17
σ 0.0361 · 183k 個數值
向量幾何help_outline
0768
各維度均值,懸停檢視區間
噪聲下限
0.316
有效維度
49 / 768
語言對help_outline
de-ruen-deen-koen-zhja-ko
各語言對之間的閾值跨度:0.158
選擇要比較的模型
論文 (1)
arXiv
二月 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

概述

jina-embeddings-v2-base-de 是一個 161M 參數的德英雙語文字向量模型,具有 8,192 token 的上下文視窗。它將兩種語言中語意等價的內容映射到相同的 768 維向量空間,從而實現無需翻譯的跨語言檢索。該模型是首批將長上下文支援與兩種語言均衡性能相結合的開源雙語向量模型之一。

方法

基於帶有對稱雙向 ALiBi 位置編碼的 BERT 骨幹構建,該模型透過統一的 161M 參數架構處理德語和英語,產生 768 維向量。訓練包含三個階段:(1) 德英平行語料庫上的多語言預訓練,(2) 含困難負樣本的精選句對上的對比微調,(3) 確保德語和英語中語意等價文字映射到向量空間鄰近區域的跨語言對齊訓練。一個關鍵設計選擇是偏置最小化目標,它抵消多語言模型偏向英語句法結構的傾向——這是早期多語言向量模型中文檔化的失敗模式。ALiBi 帶來的 8,192 token 視窗使兩種語言的完整文件都能無截斷處理。

效能

該模型超過 Microsoft 的 E5-base 同時不到其大小的三分之一,並且儘管小 7 倍仍與 E5-large 性能相當。在 WikiCLIR(英文到德文檢索)、STS17/STS22(雙向語意相似度)和 BUCC(雙語文字對齊)上,它一致超過同等或更大尺寸的模型。322MB 的佔用使其可在標準硬體上部署。2026 年,jina-embeddings-v5-text-small 在大多數應用中取代該模型,提供 32K 上下文、89 種語言和任務特定 LoRA 適配器。v2-base-de 模型在 8K 上下文足夠的德英雙語流水線中仍有價值。

最佳實踐

德英雙語檢索的最佳選擇:產品搜尋、支援文件和內容管理,其中查詢和文件可能是不同語言。對於超過 8,192 token 的文件,使用語意分塊或透過 Jina API 的 `late_chunking 參數。該模型可與 Qdrant、Weaviate、MongoDB 和 Milvus 整合。對於涵蓋兩種以上語言的新多語言專案,請優先使用 jina-embeddings-v5-text-small`(89 種語言、32K 上下文、LoRA 適配器)。生產吞吐量建議使用支援 CUDA 的 GPU。

提及此模型的部落格
九月 27, 2024 • 15 分鐘閱讀
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
五月 15, 2024 • 11 分鐘閱讀
Binary Embeddings: All the AI, 3.125% of the Fat
32-bits is a lot of precision for something as robust and inexact as an AI model. So we got rid of 31 of them! Binary embeddings are smaller, faster and highly performant.
Sofia Vasileva
Scott Martens
Futuristic digital 3D model of a coffee grinder with blue neon lights on a black background, featuring numerical data.
四月 29, 2024 • 7 分鐘閱讀
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
一月 31, 2024 • 16 分鐘閱讀
A Deep Dive into Tokenization
Tokenization, in LLMs, means chopping input texts up into smaller parts for processing. So why are embeddings billed by the token?
Scott Martens
Colorful speckled grid pattern with a mix of small multicolored dots on a black background, creating a mosaic effect.
一月 26, 2024 • 13 分鐘閱讀
Jina Embeddings v2 Bilingual Models Are Now Open-Source On Hugging Face
Jina AI's open-source bilingual embedding models for German-English and Chinese-English are now on Hugging Face. We’re going to walk through installation and cross-language retrieval.
Scott Martens
Colorful "EMBEDDINGS" text above a pile of yellow smileys on a black background with decorative lines at the top.
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 標誌
open_in_new
下載 Elastic 標誌
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業使用,不面向消費者。