I/O 图

代码

jina-embeddings-v2-base-code

任务

向量

帕累托前沿
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoder参数量(对数)nDCG@10
本模型
在前沿上
Jina AI
其他
CoIR
52.24
参数量
161M
按分数的排名
19 / 31
帕累托前沿
在前沿之后
取值分布
AUC 0.8156
语料
翻译对
文档检索
代码
0.7500.000.200.400.600.80
相关10.9%
困难负例1.5%
无关1.0%
推荐阈值
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
均衡 · 0.369
AUC
0.8156
噪声上限
0.805
召回悬崖
0.204
测量样本对
119 / 11k
向量分量
-0.160.040.25
σ 0.0361 · 183k 个数值
向量几何
0768
各维度均值,悬停查看区间
噪声下限
0.404
有效维度
43 / 768
选择要比较的模型

概述

jina-embeddings-v2-base-code 是一个 161M 参数的代码向量模型,将 30 种语言的编程代码映射到共享的 768 维语义空间。凭借 8,192 token 的上下文窗口,它成为首个支持不截断的整个函数和多文件代码检索的 Jina 向量模型。发布时在十五个 CodeNetSearch 基准中的九个上领先。

方法

该模型使用 161M 参数的基于 Transformer 的编码器,在多种编程语言数据集上训练,重点为 Python、JavaScript、Java、PHP、Go 和 Ruby。8,192 token 的上下文窗口(通过 ALiBi 位置编码)使其能在单次前向传播中处理整个函数和小文件。训练包括在代码-文本对(自然语言描述与代码实现配对)上进行对比预训练,随后在含困难负样本挖掘的代码检索数据集上进行监督微调。768 维向量同时捕捉句法结构和语义意义,实现跨语言代码匹配——不同语言中功能等价的代码映射到向量空间的邻近区域。

性能

发布时,该模型在 15 个 CodeNetSearch 基准中的 9 个上领先,超过 Microsoft 和 Salesforce 的代码向量模型,同时保持更高效的 307MB 占用。其 8,192 token 上下文比竞争的代码向量模型大 4–16 倍,可实现整个文件和复杂代码块的检索。跨语言代码理解是突出强项,能匹配不同编程语言中功能等价的代码片段。2026 年,jina-code-embeddings-0.5bjina-code-embeddings-1.5b 以自回归骨干、32K 上下文和显著更高的检索精度取代该模型。

最佳实践

用于单语或跨语言代码库的代码搜索、文档检索和代码复用。对于超过 8,192 token 的文档,在函数或类边界处实现分块。该模型可与向量数据库(Qdrant、Weaviate、MongoDB)和 RAG 框架集成。对于新的代码搜索项目,推荐使用 jina-code-embeddings-1.5b1.5B 参数、32K 上下文、SOTA 精度)或 jina-code-embeddings-0.5b494M 参数、适合边缘)。生产环境建议使用支持 CUDA 的 GPU。在 Python、JavaScript、Java、PHP、Go 和 Ruby 上性能最强;支持 30 多种语言,优雅降级。

提及此模型的博客