I/O 图

文本

jina-embeddings-v2-base-de

向量

帕累托前沿
30M100M300M1B3.0B657075808590bge-m3EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…参数量(对数)Spearman
本模型
在前沿上
Jina AI
其他
MTEB English · sts
82.00
参数量
161M
按分数的排名
13 / 39
帕累托前沿
在前沿之后
取值分布
AUC 0.8452
语料
翻译对
文档检索
0.6900.000.200.400.600.80
相关16.8%
困难负例1.7%
无关0.9%
推荐阈值
FPR 0.1 · 0.499
FPR 0.01 · 0.690
FPR 0.001 · 0.796
FPR 0.0001 · 0.897
均衡 · 0.368
AUC
0.8452
噪声上限
0.793
召回悬崖
0.195
测量样本对
119 / 11k
向量分量
-0.19-0.010.17
σ 0.0361 · 183k 个数值
向量几何
0768
各维度均值,悬停查看区间
噪声下限
0.316
有效维度
49 / 768
语言对
de-ruen-deen-koen-zhja-ko
各语言对之间的阈值跨度:0.158
选择要比较的模型
论文 (1)

概述

jina-embeddings-v2-base-de 是一个 161M 参数的德英双语文本向量模型,具有 8,192 token 的上下文窗口。它将两种语言中语义等价的内容映射到相同的 768 维向量空间,从而实现无需翻译的跨语言检索。该模型是首批将长上下文支持与两种语言均衡性能相结合的开源双语向量模型之一。

方法

基于带有对称双向 ALiBi 位置编码的 BERT 骨干构建,该模型通过统一的 161M 参数架构处理德语和英语,产生 768 维向量。训练包含三个阶段:(1) 德英平行语料库上的多语言预训练,(2) 含困难负样本的精选句对上的对比微调,(3) 确保德语和英语中语义等价文本映射到向量空间邻近区域的跨语言对齐训练。一个关键设计选择是偏置最小化目标,它抵消多语言模型偏向英语句法结构的倾向——这是早期多语言向量模型中文档化的失败模式。ALiBi 带来的 8,192 token 窗口使两种语言的完整文档都能无截断处理。

性能

该模型超过 Microsoft 的 E5-base 同时不到其大小的三分之一,并且尽管小 7 倍仍与 E5-large 性能相当。在 WikiCLIR(英语到德语检索)、STS17/STS22(双向语义相似度)和 BUCC(双语文本对齐)上,它一致超过同等或更大尺寸的模型。322MB 的占用使其可在标准硬件上部署。2026 年,jina-embeddings-v5-text-small 在大多数应用中取代该模型,提供 32K 上下文、89 种语言和任务特定 LoRA 适配器。v2-base-de 模型在 8K 上下文足够的德英双语流水线中仍有价值。

最佳实践

德英双语检索的最佳选择:产品搜索、支持文档和内容管理,其中查询和文档可能是不同语言。对于超过 8,192 token 的文档,使用语义分块或通过 Jina API 的 `late_chunking 参数。该模型可与 Qdrant、Weaviate、MongoDB 和 Milvus 集成。对于涵盖两种以上语言的新多语言项目,请优先使用 jina-embeddings-v5-text-small`(89 种语言、32K 上下文、LoRA 适配器)。生产吞吐量建议使用支持 CUDA 的 GPU。

提及此模型的博客