概述
jina-embeddings-v2-base-code 是一個 161M 參數的程式碼向量模型,將 30 種語言的程式碼映射到共享的 768 維語意空間。憑藉 8,192 token 的上下文視窗,它成為首個支援不截斷的整個函式和多重檔案程式碼檢索的 Jina 向量模型。發布時在十五個 CodeNetSearch 基準中的九個上領先。
方法
該模型使用 161M 參數的基於 Transformer 的編碼器,在多種程式語言資料集上訓練,重點為 Python、JavaScript、Java、PHP、Go 和 Ruby。8,192 token 的上下文視窗(透過 ALiBi 位置編碼)使其能在單次前向傳播中處理整個函式和小檔案。訓練包括在程式碼-文字對(自然語言描述與程式碼實現配對)上進行對比預訓練,隨後在含困難負樣本挖掘的程式碼檢索資料集上進行監督微調。768 維向量同時捕捉句法結構和語意意義,實現跨語言程式碼匹配——不同語言中功能等價的程式碼映射到向量空間的鄰近區域。
效能
發布時,該模型在 15 個 CodeNetSearch 基準中的 9 個上領先,超過 Microsoft 和 Salesforce 的程式碼向量模型,同時保持更高效的 307MB 佔用。其 8,192 token 上下文比競爭的程式碼向量模型大 4–16 倍,可實現整個檔案和複雜程式碼塊的檢索。跨語言程式碼理解是突出強項,能匹配不同程式語言中功能等價的程式碼片段。2026 年,jina-code-embeddings-0.5b 和 jina-code-embeddings-1.5b 以自回歸骨幹、32K 上下文和顯著更高的檢索精度取代該模型。
最佳實踐
用於單語或跨語言程式碼庫的程式碼搜尋、文件檢索和程式碼重用。對於超過 8,192 token 的文件,在函式或類別邊界處實現分塊。該模型可與向量資料庫(Qdrant、Weaviate、MongoDB)和 RAG 框架整合。對於新的程式碼搜尋專案,推薦使用 jina-code-embeddings-1.5b(1.5B 參數、32K 上下文、SOTA 精確度)或 jina-code-embeddings-0.5b(494M 參數、適合邊緣)。生產環境建議使用支援 CUDA 的 GPU。在 Python、JavaScript、Java、PHP、Go 和 Ruby 上性能最強;支援 30 多種語言,優雅降級。









