概述
jina-embeddings-v2-base-de 是一个 161M 参数的德英双语文本向量模型,具有 8,192 token 的上下文窗口。它将两种语言中语义等价的内容映射到相同的 768 维向量空间,从而实现无需翻译的跨语言检索。该模型是首批将长上下文支持与两种语言均衡性能相结合的开源双语向量模型之一。
方法
基于带有对称双向 ALiBi 位置编码的 BERT 骨干构建,该模型通过统一的 161M 参数架构处理德语和英语,产生 768 维向量。训练包含三个阶段:(1) 德英平行语料库上的多语言预训练,(2) 含困难负样本的精选句对上的对比微调,(3) 确保德语和英语中语义等价文本映射到向量空间邻近区域的跨语言对齐训练。一个关键设计选择是偏置最小化目标,它抵消多语言模型偏向英语句法结构的倾向——这是早期多语言向量模型中文档化的失败模式。ALiBi 带来的 8,192 token 窗口使两种语言的完整文档都能无截断处理。
性能
该模型超过 Microsoft 的 E5-base 同时不到其大小的三分之一,并且尽管小 7 倍仍与 E5-large 性能相当。在 WikiCLIR(英语到德语检索)、STS17/STS22(双向语义相似度)和 BUCC(双语文本对齐)上,它一致超过同等或更大尺寸的模型。322MB 的占用使其可在标准硬件上部署。2026 年,jina-embeddings-v5-text-small 在大多数应用中取代该模型,提供 32K 上下文、89 种语言和任务特定 LoRA 适配器。v2-base-de 模型在 8K 上下文足够的德英双语流水线中仍有价值。
最佳实践
德英双语检索的最佳选择:产品搜索、支持文档和内容管理,其中查询和文档可能是不同语言。对于超过 8,192 token 的文档,使用语义分块或通过 Jina API 的 `late_chunking 参数。该模型可与 Qdrant、Weaviate、MongoDB 和 Milvus 集成。对于涵盖两种以上语言的新多语言项目,请优先使用 jina-embeddings-v5-text-small`(89 种语言、32K 上下文、LoRA 适配器)。生产吞吐量建议使用支持 CUDA 的 GPU。









