概述
jina-embeddings-v2-base-code 是一个 161M 参数的代码向量模型,将 30 种语言的编程代码映射到共享的 768 维语义空间。凭借 8,192 token 的上下文窗口,它成为首个支持不截断的整个函数和多文件代码检索的 Jina 向量模型。发布时在十五个 CodeNetSearch 基准中的九个上领先。
方法
该模型使用 161M 参数的基于 Transformer 的编码器,在多种编程语言数据集上训练,重点为 Python、JavaScript、Java、PHP、Go 和 Ruby。8,192 token 的上下文窗口(通过 ALiBi 位置编码)使其能在单次前向传播中处理整个函数和小文件。训练包括在代码-文本对(自然语言描述与代码实现配对)上进行对比预训练,随后在含困难负样本挖掘的代码检索数据集上进行监督微调。768 维向量同时捕捉句法结构和语义意义,实现跨语言代码匹配——不同语言中功能等价的代码映射到向量空间的邻近区域。
性能
发布时,该模型在 15 个 CodeNetSearch 基准中的 9 个上领先,超过 Microsoft 和 Salesforce 的代码向量模型,同时保持更高效的 307MB 占用。其 8,192 token 上下文比竞争的代码向量模型大 4–16 倍,可实现整个文件和复杂代码块的检索。跨语言代码理解是突出强项,能匹配不同编程语言中功能等价的代码片段。2026 年,jina-code-embeddings-0.5b 和 jina-code-embeddings-1.5b 以自回归骨干、32K 上下文和显著更高的检索精度取代该模型。
最佳实践
用于单语或跨语言代码库的代码搜索、文档检索和代码复用。对于超过 8,192 token 的文档,在函数或类边界处实现分块。该模型可与向量数据库(Qdrant、Weaviate、MongoDB)和 RAG 框架集成。对于新的代码搜索项目,推荐使用 jina-code-embeddings-1.5b(1.5B 参数、32K 上下文、SOTA 精度)或 jina-code-embeddings-0.5b(494M 参数、适合边缘)。生产环境建议使用支持 CUDA 的 GPU。在 Python、JavaScript、Java、PHP、Go 和 Ruby 上性能最强;支持 30 多种语言,优雅降级。









