Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
向量模型
copyright CC BY-NC 4.0
open_in_new 釋出部落格

jina-code-embeddings-0.5b

來自程式碼生成模型的高效程式碼向量
許可證
copyright CC-BY-NC-4.0
釋出日期
calendar_month
2025-09-01
輸入
abc
文字(程式碼)
arrow_forward
輸出
more_horiz
向量
Matryoshka 維度 help_outline
64
128
256
512
896
模型詳情
參數: 494M
輸入詞元長度: 32K
輸出維度: 896
底座模型 help_outline
open_in_new
Qwen2.5-Coder-0.5B
已訓練語言 help_outline
1 種語言
支援的語言 help_outline
29 種語言
量化 help_outline
GGUF
相關模型
link
jina-code-embeddings-1.5b
link
jina-embeddings-v2-base-code
支援的任務
translate NL→程式碼
help_center 技術問答
sync_alt 程式碼→程式碼
description 程式碼→NL
auto_fix_high 補全
可透過以下方式獲取
Jina API
AWS SageMaker
Microsoft Azure
谷歌雲
Hugging Face
物理隔離
I/O 圖

程式碼

jina-code-embeddings

任務

向量

帕累託前緣 help_outline
workspace_premium
CoIR
MTEB Code
chevron_leftchevron_right
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderjina-code-embeddings-0.…參數量(對數)nDCG@10
本模型
在前緣上
Jina AI
其他
CoIR
73.94
參數量
494M
按分數的排名
1 / 31
帕累託前緣
在前緣上
取值分佈help_outline
AUC 0.8538
語料
翻譯對
文件檢索
程式碼
任務
nl2code.passage
nl2code.query
nl2code.query → nl2code.passage
qa.passage
qa.query
qa.query → qa.passage
0.7330.000.200.400.600.80
相關18.5%
困難負例2.3%
無關1.1%
推薦閾值
FPR 0.1 · 0.544
FPR 0.01 · 0.733
FPR 0.001 · 0.813
FPR 0.0001 · 0.889
均衡 · 0.427
AUC
0.8538
噪聲上限
0.809
召回懸崖
0.160
測量樣本對
119 / 11k
向量分量help_outline
-0.210.010.23
σ 0.0334 · 213k 個數值
向量幾何help_outline
0896
各維度均值,懸停檢視區間
噪聲下限
0.329
有效維度
55 / 896
選擇要比較的模型
論文 (1)
NeurIPS 2025
八月 31, 2025
Efficient Code Embeddings from Code Generation Models

概述

jina-code-embeddings-0.5b 是一個 494M 參數的程式碼向量模型,將程式碼和自然語言查詢映射到共享的 896 維語意空間。它支援 32K token 上下文視窗,可實現整個函式和多重檔案檢索,並使用 Matryoshka 表示學習實現靈活維度(64–896)。它在同尺寸中達到最先進的程式碼檢索性能,超過參數量為其 3 倍的模型。

方法

該模型建構在自然語言和程式碼語料上預訓練的自回歸 Transformer 骨幹之上。與傳統向量模型使用的雙向池化不同,它透過 Last-Token-Pooling 從序列的最終位置提取向量。這是一個關鍵的架構洞見:自回歸模型的因果注意力自然地關注完整輸入上下文,而程式碼生成預訓練目標產生豐富的語意表示,能很好地遷移到檢索。訓練採用兩階段方案:(1) 在大幅度的程式碼-文字對(自然語言描述與程式碼實現配對)上進行對比預訓練,(2) 在精選的程式碼檢索資料集上以困難負樣本挖掘進行監督微調。32K 上下文長度透過調整基礎頻率的旋轉位置編碼實現。

效能

該模型在標準程式碼檢索基準上取得 78.41% 的總平均和 78.72% 的 MTEB Code 平均。值得注意的分數:HumanEval 96.77%、MBPP 89.01%、WikiSQL 98.31%、CodeChefXLang 99.70%、CodeTransOceanContest(程式碼到程式碼)90.37%、COIR-CodeSearchNet(NL2Code)85.73%、Doc2Code 95.98%、StackOverflowQA 91.04%。在程式碼特定任務上,它超過 Qwen3-Embedding-0.6B 以及更大的模型,包括 jina-embeddings-v4(74.11%)和 gemini-embedding-001(77.38%)。在 494M 參數下,它超過多個尺寸為其 3–5 倍的模型,證明自回歸骨幹方法每參數提供高語意品質。

最佳實踐

始終使用適當的任務特定指令前綴:自然語言到程式碼搜尋用 nl2code,程式碼到程式碼相似度用 code2code,程式碼到自然語言用 code2nl,技術問答用 techqa,程式碼補全用 code2completion。對於大型程式碼庫,在函式或類別邊界處實現分塊,以保持在 32K token 限制內。Matryoshka 截斷到 128 或 256 維適合高吞吐索引;重排序頂級候選時使用完整的 896 維。使用餘弦相似度比較向量。最佳批次大小為 512,序列長度 512 token。該模型針對 Python、JavaScript、Java、PHP、Go 和 Ruby 最佳化,但支援 30 多種語言。對於程式碼的 RAG 流水線,第二階段搭配 jina-reranker-v3.5,以最大化前 50 候選的精確度。

提及此模型的部落格
十月 03, 2025 • 7 分鐘閱讀
Jina Reranker v3:用於 SOTA 多語檢索的 0.6B Listwise 重排器
全新 0.6B 參數的列表式重排器,可以在單一上下文視窗中考量查詢語句和所有候選文件。
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
九月 04, 2025 • 6 分鐘閱讀
Jina Code Embeddings:0.5B 和 1.5B 參數規模下,最先進的程式碼檢索向量模型
程式碼生成大模型 → 程式碼向量模型:0.5B/1.5B 模型在 25 個程式碼檢索基準測試中實現了 SOTA 效能。
Jina AI
Green "Code Embeddings" text displayed in a LED dot style on a black background, evoking a futuristic and technological atmos
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 標誌
open_in_new
下載 Elastic 標誌
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業使用,不面向消費者。