I/O 다이어그램

코드

jina-embeddings-v2-base-code

작업

벡터

파레토 프론트
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoder파라미터 수(로그)nDCG@10
이 모델
프론트에 있음
Jina AI
기타
CoIR
52.24
매개변수
161M
점수 순위
19 / 31
파레토 프론트
프론트 아래
값 분포
AUC 0.8156
코퍼스
번역 쌍
문서 검색
코드
0.7500.000.200.400.600.80
관련10.9%
하드 네거티브1.5%
무관1.0%
권장 컷오프
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
균형 · 0.369
AUC
0.8156
노이즈 상한
0.805
재현율 절벽
0.204
측정 쌍 수
119 / 11k
벡터 성분
-0.160.040.25
σ 0.0361 · 183k 개 값
임베딩 기하 구조
0768
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.404
유효 차원
43 / 768
비교할 모델을 선택하세요

개요

jina-embeddings-v2-base-code161M 파라미터 코드 임베딩 모델로, 30개 언어의 프로그래밍 코드를 공유하는 768차원 의미 공간으로 매핑합니다. 8,192토큰 컨텍스트 윈도우를 갖추고 있어, 절단 없이 전체 함수 및 여러 파일 코드 검색을 지원한 최초의 Jina 임베딩 모델입니다. 출시 시점 CodeNetSearch 벤치마크 15개 중 9개에서 1위였습니다.

방법

모델은 161M 파라미터의 트랜스퍼머 기반 인코더를 사용하며, Python, JavaScript, Java, PHP, Go, Ruby에 중점을 둔 다양한 프로그래밍 언어 데이터셋에서 학습되었습니다. 8,192토큰 컨텍스트 윈도우(ALiBi 위치 인코딩을 통해)는 함수 전체와 작은 파일을 단일 포워드 패스에서 처리할 수 있게 합니다. 학습에는 코드-텍스트 쌍(자연어 설명과 코드 구현의 짝짓기)에서의 대비 사전학습과, 어려운 음의(negative) 마이닝을 포함한 코드 검색 데이터셋에서의 지도 정밀조정이 포함됩니다. 768차원 임베딩은 문법 구조와 의미를 모두 포착해, 다른 언어의 기능적으로 동등한 코드가 임베딩 공간의 인접 영역으로 매핑되는 크로스 언어 코드 매칭을 가능하게 합니다.

성능

출시 시점, 모델은 CodeNetSearch 벤치마크 15개 중 9개에서 선두를 유지하며 Microsoft와 Salesforce의 코드 임베딩 모델을 능가했고, 더 효율적인 307MB 풋프린트를 유지했습니다. 8,192토큰 컨텍스트는 경쟁 코드 임베딩 모델보다 4–16배 커, 파일 전체와 복잡한 코드 블록에 대한 검색을 가능하게 했습니다. 크로스 언어 코드 이해는 특히 강점이었으며, 다른 프로그래밍 언어 간 기능적으로 동등한 스니펫을 매칭했습니다. 2026년에 jina-code-embeddings-0.5bjina-code-embeddings-1.5b가 자기회귀 백본, 32K 컨텍스트, 현저히 높은 검색 정확도로 이 모델을 대체합니다.

모범 사례

단일 언어 또는 크로스 언어 코드베이스의 코드 검색, 문서 검색, 코드 재사용에 사용하세요. 8,192토큰을 초과하는 문서에는 함수 또는 클래스 경계에서 청킹(chunking)을 구현하세요. 모델은 벡터 데이터베이스(Qdrant, Weaviate, MongoDB) 및 RAG 프레임워크와 통합됩니다. 새로운 코드 검색 프로젝트에는 jina-code-embeddings-1.5b(1.5B 파라미터, 32K 컨텍스트, SOTA 정확도) 또는 jina-code-embeddings-0.5b(494M 파라미터, 엣지 친화적)를 권장합니다. 프로덕션에는 CUDA 지원 GPU를 권장합니다. Python, JavaScript, Java, PHP, Go, Ruby에서 가장 강한 성능을 보여주며, 30개 이상 언어를 점진적 성능 저하와 함께 지원합니다.

이 모델을 언급하는 블로그
4월 08, 2025 • 21 분 소요
jina-reranker-m0: 다국어 멀티모달 문서 재정렬기
시각적 문서를 검색하기 위한 새로운 다국어 멀티모달 리랭커인 jina-reranker-m0를 소개합니다. 다국어 긴 문서와 코드 검색 작업에서 최고 수준(SOTA)의 성능을 제공합니다.
9월 27, 2024 • 15 분 소요
Jina Embeddings v2에서 v3로의 마이그레이션
Jina Embeddings v2에서 v3로 마이그레이션하는 데 도움이 될 만한 팁들을 모아보았습니다.
4월 29, 2024 • 7 분 소요
Azure의 Jina Embeddings와 Reranker: 확장 가능한 기업용 AI 솔루션
Jina Embeddings와 Rerankers가 이제 Azure Marketplace에서 사용 가능합니다. 개인정보 보호와 보안을 중요시하는 기업들은 이제 Jina AI의 최첨단 모델을 기존 Azure 생태계에 쉽게 통합할 수 있습니다.
3월 25, 2024 • 21 분 소요
차세대 클라우드 AI: Amazon SageMaker의 Jina Embeddings와 Rerankers
Amazon SageMaker와 AWS Marketplace에서 사용 가능한 구성 요소만을 사용하여 AWS 상의 풀스택 AI 애플리케이션에서 Jina Embeddings와 Reranking 모델을 사용하는 방법을 알아보세요.
2월 05, 2024 • 4 분 소요
Jina 코드 임베딩과 함께 코드 검색을 한 단계 업그레이드하세요
새로운 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲는 코드와 docstring 검색에 최적화되어 있습니다. 이 강력한 모델은 영어와 30개의 널리 사용되는 프로그래밍 언어 간의 검색을 지원하며, 모두 8192 컨텍스트 길이와 SOTA 성능을 제공합니다.