I/O 圖

程式碼

jina-embeddings-v2-base-code

任務

向量

帕累託前緣
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoder參數量(對數)nDCG@10
本模型
在前緣上
Jina AI
其他
CoIR
52.24
參數量
161M
按分數的排名
19 / 31
帕累託前緣
在前緣之後
取值分佈
AUC 0.8156
語料
翻譯對
文件檢索
程式碼
0.7500.000.200.400.600.80
相關10.9%
困難負例1.5%
無關1.0%
推薦閾值
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
均衡 · 0.369
AUC
0.8156
噪聲上限
0.805
召回懸崖
0.204
測量樣本對
119 / 11k
向量分量
-0.160.040.25
σ 0.0361 · 183k 個數值
向量幾何
0768
各維度均值,懸停檢視區間
噪聲下限
0.404
有效維度
43 / 768
選擇要比較的模型

概述

jina-embeddings-v2-base-code 是一個 161M 參數的程式碼向量模型,將 30 種語言的程式碼映射到共享的 768 維語意空間。憑藉 8,192 token 的上下文視窗,它成為首個支援不截斷的整個函式和多重檔案程式碼檢索的 Jina 向量模型。發布時在十五個 CodeNetSearch 基準中的九個上領先。

方法

該模型使用 161M 參數的基於 Transformer 的編碼器,在多種程式語言資料集上訓練,重點為 Python、JavaScript、Java、PHP、Go 和 Ruby。8,192 token 的上下文視窗(透過 ALiBi 位置編碼)使其能在單次前向傳播中處理整個函式和小檔案。訓練包括在程式碼-文字對(自然語言描述與程式碼實現配對)上進行對比預訓練,隨後在含困難負樣本挖掘的程式碼檢索資料集上進行監督微調。768 維向量同時捕捉句法結構和語意意義,實現跨語言程式碼匹配——不同語言中功能等價的程式碼映射到向量空間的鄰近區域。

效能

發布時,該模型在 15 個 CodeNetSearch 基準中的 9 個上領先,超過 Microsoft 和 Salesforce 的程式碼向量模型,同時保持更高效的 307MB 佔用。其 8,192 token 上下文比競爭的程式碼向量模型大 4–16 倍,可實現整個檔案和複雜程式碼塊的檢索。跨語言程式碼理解是突出強項,能匹配不同程式語言中功能等價的程式碼片段。2026 年,jina-code-embeddings-0.5bjina-code-embeddings-1.5b 以自回歸骨幹、32K 上下文和顯著更高的檢索精度取代該模型。

最佳實踐

用於單語或跨語言程式碼庫的程式碼搜尋、文件檢索和程式碼重用。對於超過 8,192 token 的文件,在函式或類別邊界處實現分塊。該模型可與向量資料庫(Qdrant、Weaviate、MongoDB)和 RAG 框架整合。對於新的程式碼搜尋專案,推薦使用 jina-code-embeddings-1.5b(1.5B 參數、32K 上下文、SOTA 精確度)或 jina-code-embeddings-0.5b(494M 參數、適合邊緣)。生產環境建議使用支援 CUDA 的 GPU。在 Python、JavaScript、Java、PHP、Go 和 Ruby 上性能最強;支援 30 多種語言,優雅降級。

提及此模型的部落格